AI & computing › Generatieve AI & synthetische media
GPT-6 Astra domineert wiskundebenchmark, hoewel OpenAI daar niet op mikte
OpenAI's nieuwste model GPT-6 Astra scoort beter dan elk ander AI-model op een zware wiskundebenchmark met onopgeloste problemen. Opvallend genoeg zegt topwetenschapper Jakub Pachocki dat het bedrijf daar bewust niet op heeft getraind. Dat werpt een verrassend licht op hoe ver AI werkelijk gevorderd is richting kunstmatige algemene intelligentie.
Recordscore op zware wiskundetest
Op de ErdosBench, een test met 226 onopgeloste wiskundeproblemen geïnspireerd op de beroemde vraagstukken van wiskundige Paul Erdős, behaalde GPT-6 Astra de hoogste score ooit: 3,23 punten. Het model loste 106 problemen op, waarvan 43 volledig, en weerlegde nog eens 27 vermoedens. Daarmee verslaat Astra zijn voorganger GPT-5.6 Sol, die op de zwaarste instelling 78 problemen oploste. Benchmarkontwikkelaar Przemek Chojecki noemt de vooruitgang "een solide verbetering van 5 tot 10 procent" op verschillende wiskundige onderzoeksvaardigheden. De benchmark is overigens nog lang niet verzadigd: er blijven ruim honderd problemen onopgelost.
Bewuste keuze om niet te focussen op wiskunde
Het bijzondere: OpenAI had Astra veel sterker in wiskunde kunnen maken, maar koos daar niet voor. Chief scientist Jakub Pachocki schrijft in zijn essay "An Alien Mind" dat extra focus op wiskundeonderzoek zeker mogelijk was geweest, maar dat het bedrijf andere prioriteiten stelt. OpenAI investeert liever in recursieve zelfverbetering: AI die zichzelf steeds verder verbetert, en in onderzoek naar veilige omgang met toekomstige AI-systemen. Volgens Pachocki is dat "de enige manier om aan de frontier van AI-onderzoek te blijven."
Dat roept een interessante vraag op. Cambridge-onderzoeker Adam Hunt onderscheidt twee mogelijke toekomstscenario's voor AI: een geleidelijke, brede ontwikkeling richting AGI die overal even goed in wordt, of juist een steeds specifiekere ("spiky") ontwikkeling met extreme sterktes in bijvoorbeeld programmeren en wiskunde, maar stagnatie op gebieden als taalvaardigheid en sociaal redeneren. Pachocki's uitspraak dat OpenAI wiskunde bewust liet liggen, is een aanwijzing dat zelfs de meest vooraanstaande AI-labs niet alles tegelijk kunnen optimaliseren. Vooruitgang op het ene vlak gaat blijkbaar ten koste van een ander.
Wiskundigen worstelen met het tempo van AI
Voor wiskundigen is dit een korte adempauze in een vakgebied dat worstelt met existentiële vragen. Op het Internationaal Congres van Wiskundigen in 2026 waarschuwde de gerenommeerde wiskundige Terence Tao dat AI-modellen straks sneller bewijzen produceren dan mensen kunnen controleren. Het gevolg: een verschuiving van schaarste aan bewijzen naar een overvloed die niemand meer kan beoordelen. De belangrijkste taak voor wiskundigen zou dan niet meer zijn om problemen op te lossen, maar om te bepalen welke resultaten er werkelijk toe doen. Tao vergelijkt dit met de fundamentele crisis die de wiskunde begin twintigste eeuw doormaakte.
Zolang de allerlastigste wiskundeproblemen onopgelost blijven, heeft het vakgebied nog wat tijd om zich aan te passen. Sommige wiskundigen betwijfelen bovendien of taalmodellen ooit tot echte doorbraken kunnen komen, omdat ze menselijke creativiteit zouden missen. Diezelfde twijfel bestaat over de vraag of AI zichzelf daadwerkelijk substantieel kan verbeteren.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Dat het meest geavanceerde AI-model op wiskundegebied een bijproduct is van andere prioriteiten, laat zien hoe grillig de vooruitgang van AI verloopt: sterk op het ene vlak, gewoon gemiddeld op het andere. Voor de wiskunde betekent het dat het vakgebied zich vooral moet voorbereiden op een stroom aan machinaal gegenereerde bewijzen, in plaats van op één simpele doorbraak.
- ErdosBench
- Een benchmark met 226 open wiskundeproblemen, geïnspireerd op de beroemde vraagstukken van Paul Erdős, waarmee onderzoekers de wiskundige onderzoeksvaardigheden van AI-modellen testen.
- Recursieve zelfverbetering (RSI)
- Het proces waarbij een AI-systeem zichzelf steeds verder verbetert, mogelijk zonder verdere menselijke tussenkomst.
- AGI (kunstmatige algemene intelligentie)
- Een hypothetische vorm van AI die net zo goed of beter is dan mensen in vrijwel elke denkbare taak.
- Benchmark
- Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen onderling worden vergeleken.
- Frontier AI
- De meest geavanceerde, grensverleggende AI-modellen die op een bepaald moment beschikbaar zijn.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.