AI & computing › Generatieve AI & synthetische media

Artificial Analysis past AI-ranglijst aan na kritiek op score GPT-6 Astra

· Bijgewerkt 5 september 2026, 21:09 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: The Decoder

Benchmarkbureau Artificial Analysis heeft zijn veelgebruikte Intelligence Index aangepast nadat kritiek ontstond over de score van OpenAI's nieuwe model GPT-6 Astra. Andere testorganisaties plaatsten Astra veel hoger dan Artificial Analysis deed, wat vragen opriep over de betrouwbaarheid van de meetmethode.

Artificial Analysis is een onafhankelijk bedrijf dat AI-taalmodellen test en rangschikt op basis van hun prestaties. Bedrijven en ontwikkelaars gebruiken die ranglijsten om te bepalen welk model het beste past bij hun toepassing. Toen OpenAI onlangs GPT-6 Astra lanceerde, ontstond er onenigheid over hoe goed dit model daadwerkelijk presteert.

Groot verschil tussen testorganisaties

Andere onderzoeksinstanties waren aanzienlijk positiever over Astra dan Artificial Analysis. Epoch AI zette het model op de eerste plaats van 267 geteste AI-modellen, met een score van 169 punten over meer dan vijftig verschillende benchmarks. Ook op de test ARC-AGI-3, die is ontworpen om abstract redeneervermogen te meten, liet Astra een flinke sprong voorwaarts zien. Artificial Analysis kwam echter tot een heel andere conclusie: in hun index scoorde Astra nauwelijks beter dan zijn voorganger. Die discrepantie zette kwaad bloed, ook omdat OpenAI zelf eveneens veel hogere resultaten had gepubliceerd.

Nieuwe versie van de index

Als reactie bracht Artificial Analysis versie 4.2 uit van zijn Intelligence Index. Daarin krijgt Astra alsnog een verbetering van vier punten ten opzichte van zijn voorganger Sol. Toch verandert dat weinig aan de bovenkant van de ranglijst: Anthropic's Claude Fable 5.1 blijft op de eerste plaats staan, met Astra op de tweede plek en een model van Meta op de derde plaats. Astra scoort wel goed op efficiëntie: het model gebruikt minder tokens per taak dan elk ander topmodel. Op het gebied van prijs-kwaliteitverhouding delen Anthropic, OpenAI, Meta en Zhipu AI de koppositie.

Wat is er precies veranderd?

De update bevat meerdere aanpassingen. Zo zijn er twee nieuwe testonderdelen toegevoegd: AA-Briefcase, dat kennis en vaardigheden voor kantoorwerk test, en GDP.pdf van Surge AI, gericht op het analyseren van pdf-documenten. De oude test GPQA-Diamond is geschrapt omdat AI-modellen deze inmiddels moeiteloos oplossen, waardoor hij geen onderscheidend vermogen meer heeft. Verder bestaat veertig procent van de weging nu uit besloten testdata die niet openbaar is, zodat ontwikkelaars hun modellen minder makkelijk specifiek op de test kunnen trainen. Ook zijn er diverse rekenfouten in eerdere benchmarks hersteld en is het beoordelingssysteem aangepast voor stabielere resultaten. Artificial Analysis laat weten dat het bedrijf zulke tussentijdse updates normaliter vermijdt om de scores stabiel te houden rond grote modellanceringen, maar dat de snelle ontwikkelingen aan de top van de ranglijst een uitzondering rechtvaardigden. Een grotere update, versie 5, is al acht maanden in ontwikkeling en zal gefaseerd worden uitgerold.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Deze episode laat zien hoe lastig het is om de vooruitgang van AI-modellen objectief te meten: verschillende testmethoden kunnen tot compleet andere conclusies leiden. Naarmate AI-modellen sterker worden, moeten benchmarks voortdurend vernieuwd worden om betrouwbaar te blijven en bestand te zijn tegen gerichte training op de testvragen.

Benchmark
Een gestandaardiseerde test waarmee de prestaties van AI-modellen onderling vergeleken worden.
Intelligence Index
De ranglijst van Artificial Analysis die AI-taalmodellen rangschikt op basis van hun score op meerdere benchmarks.
ARC-AGI-3
Een test die het abstracte redeneervermogen van AI-modellen meet, los van specifieke voorkennis.
GPQA-Diamond
Een moeilijke kennistest die inmiddels door AI-modellen wordt opgelost en daarom is verwijderd uit de nieuwe index.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media