AI & computing › Agentic AI & autonome agents

GPT-6 Astra plaatst blokje bijna altijd goed, puzzelstuk blijft lastig

· Bijgewerkt 6 september 2026, 05:10 · 2 min leestijd

Agentic AI & autonome agents
Beeld: Hacker News frontpage

Onderzoeksbureau Robocurve liet OpenAI's nieuwe model GPT-6 Astra dezelfde robotarm besturen als eerder Anthropic's Fable-modellen. Op een simpele grijptaak scoorde Astra bijna foutloos en twee keer zo goedkoop als de concurrent, maar op een precisietaak met een puzzelstukje bleven alle modellen op hetzelfde punt steken.

Het testbureau Robocurve vergelijkt regelmatig hoe goed AI-modellen een echte robotarm kunnen besturen. Voor de nieuwste test kreeg GPT-6 Astra, het model van OpenAI, de leiding over twee robotarmen van het type YAM. Astra moest twee taken uitvoeren: een rood blokje in een kom leggen, en een rond blauw puzzelstukje in de bijpassende gleuf in een bord plaatsen. Dezelfde opdrachten werden eerder al gegeven aan Fable 5 en Fable 5.1, twee modellen van Anthropic.

Blokje in de kom: groot verschil

Op de eenvoudigste taak, het blokje in de kom leggen, presteerde Astra duidelijk beter. Het model slaagde in 19 van de 20 pogingen, tegenover 8 van de 20 voor Fable 5.1 en slechts 1 van de 20 voor het oudere Fable 5. Astra deed er gemiddeld 2,5 minuten over, ruim sneller dan de 6,8 minuten van Fable 5.1. Ook in kosten won Astra: een run kostte gemiddeld 0,94 dollar, tegenover 2,12 dollar bij Fable 5.1. Onderzoekers rekenden de kosten uit op basis van het aantal tokens dat een model nodig had om een taak te voltooien, een gangbare maatstaf om AI-modellen onderling te vergelijken op efficiëntie.

Elke poging werd door een menselijke beoordelaar gescoord op een schaal van 0 tot 4: van geen enkele poging tot het blokje daadwerkelijk op zijn plek leggen. Zo kregen onderzoekers ook zicht op hoe ver een mislukte poging kwam, niet alleen of hij slaagde.

Puzzelstukje blijft voor iedereen lastig

Bij de tweede taak, het plaatsen van een puzzelstukje in een gleuf, verdween het voordeel van Astra grotendeels. Het model slaagde slechts 2 van de 20 keer, exact hetzelfde aantal als Fable 5.1. Fable 5 haalde de taak geen enkele keer. Opvallend is dat Astra en Fable op precies dezelfde plek vastlopen: ze bewegen het stukje netjes richting de gleuf, maar weten de laatste, nauwkeurige stap niet af te ronden. Astra was ook hier wel goedkoper, met 1,36 dollar per poging tegenover 2,18 dollar voor Fable 5.1.

Deze zogeheten benchmark laat zien dat AI-modellen die als agentic AI fysieke taken uitvoeren, al behoorlijk goed zijn in grove bewegingen zoals oppakken en verplaatsen. Fijne motoriek, zoals iets precies in een nauwe opening laten glijden, blijkt voor alle geteste modellen nog een grote hindernis. Beide modellen zijn voorbeelden van zogeheten vision-language-action-modellen: AI-systemen die camerabeelden vertalen naar concrete bewegingsinstructies voor een robot.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Deze test toont dat AI-modellen die robots aansturen snel beter en goedkoper worden in grove manipulatietaken, wat de weg vrijmaakt voor bredere inzet in bijvoorbeeld magazijnen en lichte assemblage. Tegelijk laat de puzzeltaak zien dat precisiewerk, zoals iets nauwkeurig in een opening plaatsen, nog een fundamentele beperking is die alle grote AI-modellen delen.

Robotarm
Een mechanische arm die door software wordt aangestuurd om objecten op te pakken, te verplaatsen of te plaatsen.
Benchmark
Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen of systemen eerlijk met elkaar worden vergeleken.
Agentic AI
AI-systemen die niet alleen tekst genereren, maar zelfstandig taken uitvoeren en beslissingen nemen, in dit geval het besturen van een fysieke robotarm.
Vision-language-action-model
Een AI-model dat camerabeelden en taalinstructies combineert om er concrete robotbewegingen uit af te leiden.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Agentic AI & autonome agents