Benchmarks · gemeten 07.2026 · examens uitgebracht na training

Hoe slim is DoubleDive, echt?

We laten de volledige pipeline van DoubleDive de moeilijkste, nieuwste examens afleggen die leerlingen daadwerkelijk maken — examens die te recent zijn uitgebracht om in de trainingsdata van enige AI voor te komen — en publiceren de scores hier.

Belangrijkste resultaat

De enige AI met perfecte scores op zowel AIME 2026 als JEE Advanced Math

Gecombineerde score over AIME 2026 I (15 problemen) en JEE Advanced 2026 Math (34 problemen).

DoubleDive49/49
Het vlaggenschipmodel van Company C48/49
Het vlaggenschipmodel van Company G48/49
AIME 2026 I15/15

American Invitational Mathematics Examination — de weg naar de USA Math Olympiad.

JEE Advanced 2026 Math34/34

India's IIT-toelatingsexamen — algemeen beschouwd als een van de moeilijkste wiskundetoetsen in de wereld.

2026 US-examens

Bijna elke vraag correct

Gloednieuwe 2026-edities van de zwaarste examens die Amerikaanse leerlingen afleggen.

2026 SAT120/120

Een perfecte SAT — Math en Reading & Writing, elke vraag.

2026 ACT36/36

Een perfecte ACT Composite — English 35, Math 36, Reading 36; Science 35.

F=ma 202625/25

Perfecte score op de kwalificatie voor de USA Physics Olympiad.

U.S. Chemistry Olympiad 202659/60

Het USNCO Local-examen.

Regents: U.S. History & Gov 202628/28

Een perfecte Regents — elke vraag goed.

Korean CSAT (수능)

Voorbij elk frontier-model

Op de 2026 Korean College Scholastic Ability Test-benchmark scoorde DoubleDive hoger dan elk zelfstandig frontier-model — met perfecte scores voor Korean, English, Math, Physics en Ethics.

DoubleDive590/600
Het vlaggenschipmodel van Company C570/600
Het vlaggenschipmodel van Company G524/600
Methodologie

Hoe we meten

Alle scores zijn intern gemeten tussen juli en september 2026 op de nieuwste beschikbare (2026) examenversies — uitgebracht na de trainingsdeadline van elk getest model, zodat geen van de vragen in trainingsdata kon voorkomen.

DoubleDive draait zijn volledige productiepipeline: voor elk probleem stuurt een orchestrator naar het best passende model, laat modellen elkaars werk kruislings controleren en valideert het resultaat. Baselines zijn losse, zelfstandige aanroepen van het vlaggenschipmodel van elk bedrijf op dezelfde input.

De ACT-score is gemeten in september 2026 op de officiële ACT Practice Test 3 (Form 26MC2, uitgebracht augustus 2026) en beoordeeld met de officiële conversietabellen van ACT: English 35, Mathematics 36, Reading 36, Science 35 — Composite 36, waarbij 169 van de 171 meerkeuzevragen correct zijn beantwoord. Korean CSAT-scores zijn ruwe scores (원점수). SAT® (College Board), ACT® (ACT Education Corp.), F=ma (AAPT), de U.S. National Chemistry Olympiad (American Chemical Society), en de Regents Examinations (NYSED) zijn merken van hun respectievelijke eigenaren, die DoubleDive niet onderschrijven of sponsoren.

Dezelfde AI die deze examens haalt, begeleidt jouw kind op Socratische wijze.

Gratis credits bij aanmelden · Geen creditcard nodig · Werkt in de browser

Start gratis