AI & computing › Generatieve AI & synthetische media
GPT-6 Astra: OpenAI's nieuwste model blinkt uit in computergebruik en 3D-werk
OpenAI heeft GPT-6 Astra gelanceerd, een taalmodel dat volgens vroege gebruikers uitzonderlijk goed presteert op wiskunde, programmeren en het bedienen van computerprogramma's via de muis. Het model haalt opvallende scores op onafhankelijke benchmarks en is getraind met behulp van tienduizenden Mac-computers, terwijl geruchten circuleren over een nieuwe, 'lussende' architectuur die zijn redeneerstappen verbergt.
OpenAI bracht vorige week GPT-6 Astra uit, de nieuwste versie van zijn AI-taalmodel. Techschrijver en AI-onderzoeker Sebastian Raschka noemt het model in een uitgebreide analyse 'het beste dat ik tot nu toe heb gebruikt'. Astra verbetert volgens hem niet alleen op schrijven, wiskunde en programmeren ten opzichte van voorganger GPT-5.6, maar springt er vooral uit bij taken met 3D-beelden en animaties.
Opvallende benchmarkscores
Op de ARC-AGI-3-test, die logisch redeneren en generalisatievermogen meet, haalt Astra 99,9 procent. Voorganger GPT-5.6 Sol kwam niet verder dan 7,8 procent. Op de onafhankelijke Artificial Analysis Intelligence Index, die meerdere soorten taken combineert, staat Astra wel aan de top maar loopt het niet ver uit op concurrerende modellen. Deze onafhankelijke benchmarks gelden als betrouwbaarder dan cijfers die AI-bedrijven zelf publiceren, omdat ontwikkelaars hun modellen doorgaans optimaliseren voor één specifieke testomgeving. Dat kan betekenen dat Astra's werkelijke prestaties in zijn eigen software-omgeving nog hoger liggen dan de onafhankelijke tests laten zien.
Een computer bedienen met de muis
Astra's sterkste kant is computergebruik: het model kan zelfstandig knoppen aanklikken, menu's doorlopen en programma's bedienen, precies zoals een mens dat zou doen. Raschka liet het model bijvoorbeeld met de muis een tekening maken in een browserversie van MS Paint. Dit soort taken vereist dat een AI-model niet alleen tekst begrijpt, maar ook een scherm 'leest' en daar vloeiend op reageert. Omdat veel software geen programmeerkoppeling (API) heeft, is muis- en toetsenbordbediening voor AI een manier om toch met vrijwel elk programma te kunnen werken. Volgens Raschka is dit een trend die de komende jaren zal doorzetten, vergelijkbaar met de opkomst van humanoïde robots die minder efficiënt zijn dan gespecialiseerde machines, maar wel breed inzetbaar.
Trainen op tienduizenden Mac's
Om die vaardigheid te ontwikkelen, kocht OpenAI naar verluidt tienduizenden Mac Mini's en Mac Studio's. Die computers dienen niet om het model zelf te trainen — dat gebeurt op gespecialiseerde NVIDIA-chips — maar als oefenomgeving. Het model krijgt een opdracht, ziet schermafbeeldingen van macOS, voorspelt een muisklik of toetsaanslag, en leert vervolgens via reinforcement learning of die actie tot succes leidde. Volgens de topman van chipmaker NVIDIA is Astra getraind op ongeveer 100.000 krachtige Grace Blackwell-processoren.
Tot slot doen er geruchten de ronde dat Astra gebruikmaakt van een zogeheten recurrente architectuur, waarbij het model dezelfde rekenstap meerdere keren herhaalt in plaats van telkens nieuwe onderdelen te gebruiken. Sommige gebruikers vermoeden bovendien dat OpenAI de tussenliggende redeneerstappen van het model bewust afschermt, wat vragen oproept over hoe goed onderzoekers straks nog kunnen controleren wát een AI-model precies 'denkt' voordat het een antwoord geeft — een vorm van meelezen met het redeneerproces die juist steeds belangrijker wordt voor de veiligheid van AI-systemen.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? GPT-6 Astra laat zien dat AI-modellen steeds vaardiger worden in het zelfstandig bedienen van gewone software, wat drempels voor automatisering van alledaagse computertaken verlaagt. Tegelijk roept de mogelijke verborgen redenering vragen op over controleerbaarheid: als niemand meer kan meekijken hoe een AI tot zijn antwoord komt, wordt toezicht op deze steeds krachtigere systemen lastiger.
- Computer-use agent
- Een AI-model dat een computerscherm bekijkt en zelf de muis en het toetsenbord bedient om taken uit te voeren, net als een mens dat zou doen.
- Reinforcement learning
- Een trainingsmethode waarbij een AI-systeem leert door het uitproberen van acties en het krijgen van beloning bij succes en straf bij falen.
- Recurrente diepte (looped transformer)
- Een AI-architectuur waarbij hetzelfde rekenblok meerdere keren wordt herhaald, zodat het model in feite langer over een probleem kan 'nadenken' zonder dat het groter hoeft te worden.
- Chain-of-thought-monitoring
- Het controleren van de tussenstappen die een AI-model doorloopt voordat het een uiteindelijk antwoord geeft, gebruikt om te begrijpen en te verifiëren hoe het model tot zijn conclusies komt.
- ARC-AGI-benchmark
- Een testreeks die meet hoe goed een AI-systeem nieuwe, ongeziene logische puzzels kan oplossen, als graadmeter voor algemene redeneervaardigheid.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.