AI & computingGeneratieve AI & synthetische media

GPT-6 Astra verslaat mens in efficiëntie op AI-benchmark ARC-AGI-3

· Bijgewerkt 4 september 2026, 14:24 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: The Decoder

OpenAI's nieuwe model GPT-6 Astra haalt tegenstrijdige scores op verschillende AI-benchmarks, maar imponeert op één punt: het lost onbekende puzzelspellen efficiënter op dan de gemiddelde mens. AGI-onderzoeker François Chollet noemt de vooruitgang twee keer zo snel als verwacht.

Twee gerenommeerde onderzoeksbureaus komen tot tegengestelde conclusies over GPT-6 Astra, het nieuwste AI-model van OpenAI. Epoch AI zet Astra met 169 punten ruim op de eerste plaats van 267 geteste modellen. Artificial Analysis daarentegen meet met een andere testset slechts 61 punten: exact gelijk aan voorganger GPT-5.6 Sol en achter concurrent Claude Fable 5.1, dat op 66 punten uitkomt. Beide bureaus combineren tientallen losse tests tot één totaalscore, maar gebruiken andere maatstaven.

Opvallend is dat Astra duurder is dan zijn voorganger: OpenAI rekent tweeënhalf keer zoveel per verwerkte tekst, waardoor een taak zo'n 75 procent meer kost. Vergeleken met branchegenoot Anthropic is het beeld anders. Bij programmeertaken scoort Astra gelijk aan Claude Fable 5, maar tegen minder dan de helft van de kosten per taak. De verklaring: Astra heeft veel minder rekenstappen nodig, ongeveer een derde van wat Sol gebruikt.

Grote sprong op ARC-AGI-3

De opvallendste vooruitgang zit in de benchmark ARC-AGI-3, ontwikkeld door onderzoeksorganisatie ARC Prize. Deze test zet een AI in onbekende computerspelletjes zonder uitleg over de regels: het model moet via vallen en opstaan ontdekken wat de bedoeling is. Astra haalt hier 62,7 procent, tegenover 7,8 procent voor voorganger Sol en 30,2 procent voor concurrent Opus 5. Voor mensen is dit soort taken van oudsher juist een sterk punt geweest.

Bijzonder is ook de kostenstructuur: normaal wordt een taak duurder naarmate een AI-model meer 'nadenkt'. Bij Astra werkt het net andersom. Met maximale redeneerinspanning daalt de testprijs van bijna 50.000 naar ruim 26.000 dollar, omdat het model de spellen in minder zetten oplost. ARC Prize testte eerder al zo'n 500 mensen op dezelfde spellen en registreerde per level het mediane aantal zetten dat nodig was om te winnen. Astra bleef in 96 procent van de gevallen onder dat menselijk gemiddelde, en gebruikte daarbij gemiddeld ruim de helft minder zetten dan een mens nodig had.

Eigen rekensysteem en twijfel over meetmethode

Om dit voor elkaar te krijgen, ontwikkelt Astra tijdens het spelen een eigen soort steno: een algebraïsche notatie waarin het objecten, coördinaten en spelregels bijhoudt. Chollet noemt dit op X 'symbolische wereldmodellering', een vaardigheid die AI-onderzoekers eerder alleen zagen bij modellen met uitgebreide externe hulpsoftware. Bij Astra lijkt dit gedrag in het model zelf te zitten.

Toch plaatst ARC Prize een kanttekening. OpenAI claimde aanvankelijk 99,9 procent op ARC-AGI-3, maar dat cijfer kwam tot stand met een speciaal OpenAI-hulpprogramma dat het model onder meer helpt lange denkstappen samen te vatten. Volgens ARC Prize is alleen de 62,7 procent, gemeten met de eigen neutrale testomgeving, eerlijk te vergelijken met andere AI-modellen. De organisatie noemt de voortgang niettemin indrukwekkend, al benadrukt Chollet dat dit geen bewijs is dat kunstmatige algemene intelligentie (AGI) er al is.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Dat een AI-model spelletjes efficiënter oplost dan mensen, was tot voor kort ondenkbaar en verschuift de verwachte tijdlijn richting AGI naar voren. Tegelijk laat het uiteenlopen van benchmarkscores zien hoe lastig het is om AI-vooruitgang objectief te meten, zeker nu leveranciers zelf bepalen welke hulpmiddelen ze tijdens tests gebruiken.

Benchmark
Een gestandaardiseerde test waarmee de prestaties van AI-modellen onderling worden vergeleken.
ARC-AGI-3
Een testreeks waarin AI onbekende spelwerelden moet doorgronden zonder uitleg vooraf, ontwikkeld om te meten hoe dicht een model bij algemene intelligentie komt.
AGI (kunstmatige algemene intelligentie)
Een AI-systeem dat net als een mens op vrijwel elk gebied kan leren en presteren, in plaats van slechts één specifieke taak te beheersen.
Redeneermodel
Een AI-model dat expliciet tussenstappen 'doordenkt' voordat het een antwoord geeft, wat de nauwkeurigheid kan verbeteren.
Symbolische wereldmodellering
Het door een AI zelf opstellen van een compact notatiesysteem om een omgeving en haar regels bij te houden.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media