AI & computing › Generatieve AI & synthetische media
OpenAI's GPT-6 Astra maakt sprong in ruimtelijk inzicht bij robotproeven
Een nieuwe robotbenchmark laat zien dat OpenAI's nog onaangekondigde model GPT-6 Astra opvallend beter presteert op ruimtelijke taken dan een concurrerend model van Ai2. Op eenvoudige bureau-klusjes zoals een pen ontdoppen of paperclips uitschudden wint Astra met een ruime voorsprong, wat onderzoekers een 'step change' in ruimtelijk redeneren noemen.
Een robot die een dop van een stift haalt of een liniaal doorgeeft aan een andere arm: het klinkt simpel, maar voor kunstmatige intelligentie is het een lastige test van ruimtelijk inzicht. Een nieuwe benchmark genaamd StationeryBench zette twee AI-modellen tegen elkaar op zulke taken. Het gaat om GPT-6 Astra, een nog niet officieel aangekondigd model van OpenAI, en MolmoAct2 van het Amerikaanse onderzoeksinstituut Ai2.
Robots strijden om alledaagse bureau-taken
Beide AI-modellen bestuurden dezelfde robotarmen: zogeheten YAM-robots met twee armen die onafhankelijk van elkaar kunnen werken. Over vijf verschillende taken en in totaal tweehonderd testronden moesten de robots onder meer een stift ontdoppen, paperclips uit een bakje schudden en een liniaal van de ene naar de andere arm doorgeven. Dat laatste vraagt om wat onderzoekers bimanuale manipulatie noemen: het gecoördineerd samenwerken van twee handen of grijpers.
De verschillen tussen de modellen waren groot. Astra rondde 7 van de 100 taken volledig af, MolmoAct2 geen enkele. Op een schaal die de voortgang per poging meet, scoorde Astra gemiddeld 46 van de 100 punten, tegenover 12 voor MolmoAct2. Alle resultaten, video's en broncode zijn openbaar gemaakt op GitHub, zodat andere onderzoekers de test kunnen natrekken.
Wat maakt Astra anders?
Yoav Artzi, AI-onderzoeker aan Cornell University en verbonden aan Google DeepMind, noemt de resultaten een 'step change' in ruimtelijk redeneren: een duidelijke sprong voorwaarts ten opzichte van eerdere modellen. Op een nog niet gepubliceerde test genaamd REMAP haalt Astra volgens Artzi een nauwkeurigheid die dicht bij het niveau van mensen ligt. Hij benadrukt wel dat het model op andere taken nog altijd achterblijft bij menselijke prestaties.
Artzi vermoedt dat OpenAI het model heeft getraind op grote hoeveelheden 3D-data, bijvoorbeeld gegenereerde scènes uit 3D-software zoals Blender. Dat zou verklaren waarom Astra juist op taken die draaien om diepte, positie en de vorm van objecten in de ruimte een sprong maakt. Het past bovendien bij de bredere ambities van OpenAI: het bedrijf heeft eerder aangegeven op termijn eigen consumentenrobots te willen ontwikkelen. Betere ruimtelijke vaardigheden zijn daarvoor een belangrijke bouwsteen, omdat een robot in de fysieke wereld voortdurend moet inschatten waar objecten zich bevinden en hoe die te grijpen zijn.
Voorlopig blijft GPT-6 Astra een model waarover weinig officieel bekend is; OpenAI heeft het nog niet formeel aangekondigd. De StationeryBench-resultaten geven wel een eerste onafhankelijke blik op de vaardigheden van het model, los van OpenAI's eigen marketingmateriaal.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Betere ruimtelijke vaardigheden zijn een sleutelvoorwaarde voor bruikbare huishoudrobots en industriële robotarmen die met onvoorspelbare, alledaagse voorwerpen moeten omgaan. Als AI-modellen als GPT-6 Astra inderdaad een sprong maken in het begrijpen van vorm, positie en diepte, brengt dat de belofte van algemeen inzetbare robots dichterbij, al blijft de kloof met menselijke behendigheid vooralsnog groot.
- StationeryBench
- Een onafhankelijke testset waarin AI-modellen worden vergeleken op vijf bureau-taken, zoals het ontdoppen van een stift of het doorgeven van een liniaal tussen twee robotarmen.
- YAM-robot
- Het type dubbelarmige robot dat in deze test werd gebruikt om de AI-modellen aan te sturen.
- Voortgangsscore
- Een score van 0 tot 100 die aangeeft hoe ver een robot is gekomen in een taak, ook als die niet volledig is afgerond.
- REMAP-benchmark
- Een nog niet gepubliceerde test waarop GPT-6 Astra volgens onderzoeker Yoav Artzi bijna menselijke nauwkeurigheid haalt.
- 3D-scènedata
- Kunstmatig gegenereerde driedimensionale omgevingen, bijvoorbeeld gemaakt met software als Blender, die gebruikt kunnen worden om AI-modellen ruimtelijk inzicht bij te brengen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.