AI & computing › Agentic AI & autonome agents
Google geeft robots een 'brein' dat video begrijpt en samenwerkt
Google heeft een nieuw AI-model gelanceerd dat robots helpt om sneller na te denken, taken stap voor stap te plannen en zelfs met andere robots samen te werken. Gemini Robotics ER 2 kijkt continu mee via videobeelden en grijpt in zodra iets misgaat.
Een robot die een boodschappentas inpakt of een lamp vastdraait, moet niet alleen weten hoe de wereld eruitziet. Hij moet ook op het juiste moment de juiste actie kiezen, en dat razendsnel. Google DeepMind presenteert daarom Gemini Robotics ER 2, een model dat functioneert als hogere denklaag boven de motoriek van een robot.
Het model neemt zelf geen fysieke bewegingen voor zijn rekening. Die taak blijft bij gespecialiseerde besturingsmodellen, in de sector vision-language-action-modellen genoemd. Gemini Robotics ER 2 fungeert als regisseur: het bekijkt de omgeving, praat zo nodig met een mens, roept externe hulpmiddelen aan zoals Google Search en geeft de besturingslaag stap voor stap opdrachten. Volgens Google is dit een flinke stap vooruit ten opzichte van de vorige versie, ER 1.6.
Video kijken om fouten te herstellen
Nieuw is dat het model doorlopend videobeelden analyseert in plaats van losse foto's. Daardoor kan een robot bijhouden hoe ver een taak gevorderd is en zelf bijsturen als iets misgaat, zonder de hele klus opnieuw te beginnen. Google testte dit met twee maatstaven. Bij het inschatten van de voortgang van een taak scoorde het model 57,4 procent nauwkeurigheid, beter dan concurrerende modellen. Bij het exact aanwijzen van het moment waarop iets gebeurt, bijvoorbeeld wanneer een kopje vol genoeg is met koffie, haalde het model 91,3 procent nauwkeurigheid met een afwijking van gemiddeld minder dan een seconde. Dat laatste gebeurt volgens Google vier keer sneller dan bij vergelijkbare modellen, wat belangrijk is omdat een robot in de fysieke wereld geen seconden kan wachten op een antwoord.
Meerdere robots die samenwerken
Het model maakt het ook mogelijk dat verschillende soorten robots samen één taak uitvoeren. Een robot op wielen is bijvoorbeeld goed in vlakke gangen, terwijl een tweevoetige robot beter overweg kan met trappen of oneffen terrein. Door een gedeeld begrip van de omgeving te delen, kunnen zulke machines volgens Google elkaar aanvullen. Het bedrijf toont dit met de vierpotige robot Spot van Boston Dynamics, die op basis van gesproken opdrachten zelfstandig een snack ophaalt, en met een samenwerking tussen twee robotarmen van het bedrijf Apptronik en Franka.
Aandacht voor veiligheid
Google benadrukt dat dit tot nu toe de veiligste versie van het model is. In tests stopte een mensvormige robot automatisch zodra er iemand in de buurt kwam, en hervatte hij het werk pas weer toen de ruimte vrij was. Om dat soort gedrag te kunnen meten, introduceert Google een nieuwe testmethode die nagaat of een AI-model veiligheidsregels naleeft, de omgeving in de gaten houdt en op tijd om hulp van een mens vraagt.
Gemini Robotics ER 2 is per direct beschikbaar voor ontwikkelaars via de Gemini API en Google AI Studio. Grotere bedrijven kunnen het model ook uitproberen via het Gemini Enterprise Agent Platform, dat nog in een vroege testfase zit.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Robots die video in real time kunnen 'lezen' en zelf hun voortgang bewaken, worden minder afhankelijk van vooraf geprogrammeerde stappen. Dat maakt ze bruikbaarder in onvoorspelbare omgevingen zoals huishoudens, magazijnen en zorginstellingen, en opent de deur naar teams van robots die taken onderling verdelen.
- Vision-language-action-model
- Een AI-model dat beelden en taal combineert om daadwerkelijk fysieke bewegingen van een robot aan te sturen.
- Voortgangsclassificatie
- Een techniek waarbij een AI-model per videobeeld inschat hoe ver een taak gevorderd is, bijvoorbeeld in stappen van 20 procent.
- Momentherkenning
- Het exact aanwijzen van het videoframe waarop een belangrijke gebeurtenis plaatsvindt, zoals het moment dat een kopje vol is.
- Bidirectionele streaming
- Een verbinding waarbij een AI-model en een robot voortdurend, in twee richtingen tegelijk, gegevens met elkaar uitwisselen zodat reacties zonder merkbare vertraging verlopen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.