AI & computing › Generatieve AI & synthetische media
World Labs presenteert Atlas: AI die complete 3D-werelden bouwt uit één foto
Het AI-bedrijf World Labs, opgericht door onderzoeker Fei-Fei Li, heeft een nieuw model gepresenteerd dat uit tekst, foto's of video complete driedimensionale werelden genereert. Atlas kan bestaande ruimtes nabouwen, ontbrekende delen zelf verzinnen en filmpjes van een minuut lang produceren vanuit slechts een handvol beelden. Het model moet de basis worden voor toekomstige toepassingen in games, film en robotica.
Stel je voor: je geeft een computer één foto van een kamer, en die computer laat vervolgens zien hoe die kamer eruitziet vanuit elke denkbare hoek, inclusief de muren die je nooit hebt gefotografeerd. Dat is in essentie wat Atlas doet, het nieuwe wereldmodel van het Amerikaanse bedrijf World Labs. Het model is getraind om tekst, beeld, video en 3D-data allemaal in dezelfde 'taal' te verwerken, waardoor het niet alleen plaatjes genereert maar ook begrijpt hoe ruimtes en objecten zich in de fysieke wereld tot elkaar verhouden.
World Labs werd in 2024 opgericht door Fei-Fei Li, een gerenommeerde AI-onderzoeker aan Stanford University die bekendstaat van haar werk aan ImageNet, de databank die aan de basis lag van de doorbraak van deep learning in beeldherkenning. Met World Labs richt ze zich op wat ze 'ruimtelijke intelligentie' noemt: AI die niet alleen plaatjes herkent, maar de driedimensionale structuur van de wereld begrijpt. Atlas is de nieuwste stap in die missie en moet toekomstige versies aandrijven van Marble, het eerdere product van het bedrijf waarmee gebruikers virtuele werelden kunnen genereren.
Van losse foto's naar een kloppende 3D-wereld
Technisch gezien is Atlas een autoregressief diffusiemodel: het bouwt nieuwe beelden stap voor stap op, en voorspelt daarbij steeds wat er logischerwijs op volgt, vergelijkbaar met hoe taalmodellen het volgende woord voorspellen. Het bijzondere is dat elk beeld dat Atlas verwerkt wordt vastgepind op een positie in de driedimensionale ruimte. Zo ontstaat een gedeelde ruimtelijke context waarin het model kan navigeren, aanvullen en extrapoleren.
In de praktijk betekent dit dat Atlas met één tot enkele tientallen foto's van een locatie een volledige driedimensionale reconstructie kan maken, inclusief delen die nooit gefotografeerd zijn. Hoe meer foto's je aanlevert, hoe minder het model hoeft te 'verzinnen' en hoe getrouwer de reconstructie aan de werkelijkheid blijft. Volgens World Labs presteert Atlas daarbij beter dan gespecialiseerde 3D-reconstructiemodellen, en dat is opvallend omdat het een generiek model is dat ook tekst en video verwerkt. De output kan een gewone video zijn, maar ook een expliciete 3D-vorm zoals een puntenwolk of een zogeheten Gaussian splat, een representatie die op apparaten in real-time te renderen is.
Filmtrucs en robots die virtueel oefenen
Naast het genereren van nieuwe beelden kan Atlas ook bestaande video's herinterpreteren. Met beelden van slechts drie camera's kan het model een 'bullet time'-effect maken, waarbij een moment wordt bevroren en vanuit onmogelijke hoeken bekeken kan worden, zonder de dure camerastudio's die Hollywood daar normaal voor gebruikt. Datzelfde vermogen om ruimte en tijd te modelleren maakt Atlas ook interessant voor robotica: door een filmpje van de echte wereld om te zetten in een nauwkeurige simulatie, kunnen robots virtueel oefenen voordat ze een taak in het echt uitvoeren. Deze aanpak, door World Labs 'Real-to-Sim' genoemd, kan de ontwikkeling van robots die moeten leren grijpen, lopen of navigeren aanzienlijk versnellen.
World Labs benadrukt dat de prestaties van Atlas verder verbeteren naarmate het model met meer rekenkracht wordt getraind, en verwacht dat die trend zich voortzet. Het bedrijf biedt op dit moment vroege toegang aan voor geïnteresseerde gebruikers en ontwikkelaars, voordat het model breder beschikbaar komt.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Wereldmodellen zoals Atlas kunnen de manier veranderen waarop games, films en trainingsdata voor robots worden gemaakt: in plaats van dure 3D-scans of camerasetups volstaat straks een handvol foto's. Voor de robotica-industrie is vooral de combinatie van realistische simulatie en 3D-begrip veelbelovend, omdat robots daardoor sneller en goedkoper kunnen leren zonder dat er in de fysieke wereld geoefend hoeft te worden.
- Wereldmodel
- Een AI-systeem dat leert hoe de wereld eruitziet en verandert, en op basis daarvan nieuwe scenario's kan voorspellen of genereren.
- Diffusiemodel
- Een type AI dat beelden opbouwt door stap voor stap ruis om te zetten in een herkenbaar plaatje of video.
- Autoregressief model
- Een AI-model dat output genereert door steeds het volgende onderdeel te voorspellen op basis van alles wat het al heeft gezien.
- Puntenwolk
- Een verzameling van losse punten in de ruimte die samen de vorm van een object of omgeving beschrijven, vaak gebruikt in 3D-reconstructie.
- Ruimtelijke context
- De manier waarop een AI-model meerdere beelden aan elkaar koppelt door ze een positie in de driedimensionale ruimte te geven.
- 3D Gaussian splatting
- Een techniek om 3D-scènes weer te geven met veel kleine, doorschijnende vormen (splats) die samen realistisch en snel te renderen beelden vormen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.