RoboticaHumanoïde robots

Robot leert nieuwe taak na het zien van één enkele video

· Bijgewerkt 10 september 2026, 19:32 · 2 min leestijd

Humanoïde robots
Beeld: NVIDIA blog

Het Amerikaanse robotbedrijf Skild AI heeft een AI-model ontwikkeld dat robots een complexe, onbekende taak laat uitvoeren nadat ze slechts één video van die taak hebben gezien. Het model S1 hoeft daarvoor niet opnieuw getraind te worden, wat herprogrammeren van weken terugbrengt tot enkele minuten. De techniek is samen met chipfabrikant NVIDIA ontwikkeld en draait onder meer al mee bij de assemblage van NVIDIA-servers bij Foxconn.

Robots op fabrieksvloeren en in magazijnen kunnen doorgaans maar één ding: het werk waarvoor ze geprogrammeerd zijn. Verandert de taak, dan is vaak weken aan herprogrammeren en nieuwe trainingsdata nodig. Skild AI presenteert nu een model dat dat probleem moet oplossen: S1 leert een nieuwe taak simpelweg door één video van die taak te bekijken.

Van maanden trainen naar één video

S1 is een zogeheten robotfoundatiemodel, gebouwd en getraind op AI-infrastructuur van NVIDIA. Waar de meeste robots hun vaardigheden krijgen via reinforcement learning of maandenlange training op specifieke taken, gebruikt S1 een techniek die in-context leren heet. Een operator filmt hoe een taak wordt uitgevoerd, en het model leidt daaruit af welke objecten, stappen en volgorde nodig zijn. Vervolgens voert de robot de taak uit zonder dat de onderliggende AI opnieuw getraind hoeft te worden.

Dat werkt ook voor taken die niet in de trainingsdata van het model zaten. In een test met het inpotten van een plant zat er nog maar elf minuten tussen het opnemen van de video en het zelfstandig uitvoeren van de taak door de robot. S1 kan taken van tot tien minuten aan, met tientallen handelingen achter elkaar, zoals pannenkoeken bakken, koffie zetten met een filter of onderdelen assembleren.

66 procent succes versus 9 procent

Skild vergeleek de prestaties van S1 met een vergelijkbaar AI-systeem bij nieuwe, meerstaps taken. Het eigen model haalde een slagingspercentage van 66 procent per stap, tegenover 9 procent bij het concurrerende systeem — meer dan zeven keer zo goed. Volgens Skild is het tonen van één korte video net zo waardevol als ongeveer 380 keer het handmatig voordoen van een taak, iets waar een mens normaal 50 tot 100 uur mee bezig zou zijn.

De techniek leunt sterk op simulatiesoftware van NVIDIA. Met Omniverse en Isaac Sim bouwt Skild virtuele fabrieksomgevingen om het model te trainen en te testen voordat het op echte robots wordt losgelaten. In Isaac Lab, een open leerplatform voor robotarmen en andere machines, verfijnt het bedrijf de vaardigheden van S1 verder met reinforcement learning, aangedreven door een nieuwe physica-engine genaamd Newton. Voor het verwerken van trainingsvideo's gebruikt Skild de Cosmos-modellen van NVIDIA, die beeldmateriaal omzetten in gestructureerde beschrijvingen.

Van laboratorium naar fabrieksvloer

De techniek is niet alleen theorie. Skild, NVIDIA en fabrikant Foxconn zetten de technologie al in op fabrieksvloeren, bij de assemblage van NVIDIA's Blackwell-chipsystemen. Twee-armige robots monteren daar onder meer een stroomrail en bevestigen zestien schroeven, en passen zich aan als het proces afwijkt van het plan. Dat vereist nauwkeurige bewegingen en contactbewuste besturing: de robot moet voelen wanneer en hoe hard hij ergens tegenaan duwt.

Skild bereikte tien maanden na de eerste commerciële uitrol al een omzet op jaarbasis van 100 miljoen dollar, met meer dan zestig samenwerkingen in sectoren als productie, logistiek, inspectie, beveiliging en voedselbereiding. Volgens medeoprichter en CEO Deepak Pathak is het vermogen om te leren van ervaring — in plaats van vooraf te programmeren — de belangrijkste verschuiving in de robotica van de afgelopen jaren.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Als robots taken kunnen overnemen na het zien van één video, wordt automatisering in fabrieken en magazijnen veel flexibeler en goedkoper: bedrijven hoeven niet meer weken te wachten op herprogrammering bij elke wijziging in het productieproces. Dat kan de drempel voor robotisering bij kleinere bedrijven en wisselende productielijnen flink verlagen.

In-context leren
Een AI-model leert een nieuwe taak direct uit de gegeven informatie, zoals een video, zonder dat de interne parameters van het model opnieuw getraind worden.
Robotfoundatiemodel
Een breed getraind AI-model dat als basis dient voor uiteenlopende robottaken, in plaats van één specifiek geprogrammeerde taak.
Reinforcement learning
Een trainingsmethode waarbij een systeem leert door vallen en opstaan, en beloningen krijgt voor gewenst gedrag.
Contactbewuste besturing
Een regeltechniek waarbij een robot voortdurend meet hoeveel kracht en druk hij uitoefent tijdens het aanraken of vastpakken van objecten.
Stroomrail (busbar)
Een metalen geleider die grote elektrische stromen vervoert binnen apparatuur, zoals in de servers die Foxconn met robots assembleert.
Simulatieomgeving
Een virtuele nabootsing van de fysieke wereld waarin robots veilig en snel kunnen worden getraind voordat ze in het echt aan de slag gaan.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Humanoïde robots