Бенчмарки · виміряно 07.2026 · іспити, опубліковані після навчання моделі

Наскільки насправді розумний DoubleDive?

Ми пропускаємо повний конвеєр DoubleDive через найскладніші, найновіші іспити, які реально складають учні — тести, опубліковані надто нещодавно, щоб потрапити в тренувальні дані будь-якого AI — і публікуємо результати тут.

Головний результат

Єдиний AI з ідеальними результатами і на AIME 2026, і на JEE Advanced з математики

Сумарний результат за AIME 2026 I (15 задач) та JEE Advanced 2026 з математики (34 задачі).

DoubleDive49/49
Флагманська модель компанії C48/49
Флагманська модель компанії G48/49
AIME 2026 I15/15

American Invitational Mathematics Examination — шлях до Математичної олімпіади США.

JEE Advanced 2026 Math34/34

Вступний іспит до індійських IIT — вважається одним із найскладніших математичних тестів у світі.

Іспити США 2026

Майже кожна відповідь правильна

Абсолютно нові редакції 2026 року найскладніших іспитів, які складають американські учні.

SAT 2026120/120

Ідеальний SAT — Math та Reading & Writing, кожне питання.

ACT 202636/36

Ідеальний сукупний результат ACT — English 35, Math 36, Reading 36; Science 35.

F=ma 202625/25

Максимум на відбірковому іспиті Олімпіади США з фізики.

Хімічна олімпіада США 202659/60

Локальний іспит USNCO.

Regents: U.S. History & Gov 202628/28

Ідеальний результат Regents — кожне питання правильно.

Корейський CSAT (수능)

Попереду кожної передової моделі

На бенчмарку корейського вступного тесту CSAT 2026 року DoubleDive набрав більше балів, ніж будь-яка окрема передова модель — з ідеальними результатами з корейської, англійської, математики, фізики та етики.

DoubleDive590/600
Флагманська модель компанії C570/600
Флагманська модель компанії G524/600
Методологія

Як ми вимірюємо результати

Усі результати вимірювались внутрішньо у липні–вересні 2026 року на найновіших доступних (2026 року) версіях іспитів — випущених після дати завершення навчання кожної тестованої моделі, тож жодне з питань не могло потрапити в дані для навчання.

DoubleDive працює за повним виробничим конвеєром: для кожної задачі оркестратор направляє її до найбільш придатної моделі, змушує моделі перевіряти роботу одна одної та підтверджує результат. Базові показники — це окремі одноразові запити до флагманської моделі кожної компанії на тих самих вхідних даних.

Результат ACT було виміряно у вересні 2026 року на офіційному пробному тесті ACT Practice Test 3 (форма 26MC2, випущена у серпні 2026 року) та оцінено за офіційними таблицями конвертації ACT: англійська 35, математика 36, читання 36, наука 35 — загальний бал 36, з правильними відповідями на 169 з 171 питання з множинним вибором. Результати корейського CSAT — це сирі бали (원점수). SAT® (College Board), ACT® (ACT Education Corp.), F=ma (AAPT), U.S. National Chemistry Olympiad (American Chemical Society) та Regents Examinations (NYSED) є торговими марками відповідних власників, які не підтримують і не спонсорують DoubleDive.

Той самий AI, що складає ці іспити на відмінно, навчає вашого учня за сократівським методом.

Безкоштовні кредити при реєстрації · Без кредитної картки · Працює у браузері

Почати безкоштовно