AI & computing › Agentic AI & autonome agents

Google DeepMinds AI 'Co-Scientist' voert nu zelf labexperimenten uit

· Bijgewerkt 28 augustus 2026, 21:13 · 2 min leestijd

Agentic AI & autonome agents
Beeld: The Decoder

Google DeepMind heeft zijn AI-systeem Co-Scientist uitgebreid van een hypothesegenerator tot een onderzoekspartner die zelf experimenten plant, labapparatuur bedient en wetenschappelijke artikelen schrijft. Het systeem leverde volgens Google al experimenteel bevestigde resultaten op in materiaalkunde, biologie en informatica. Tegelijk blijkt uit eigen tests dat AI nog altijd resultaten verzint, al is dat percentage flink gedaald.

Co-Scientist is een multi-agentsysteem: meerdere gespecialiseerde AI-agents die samen een onderzoeksvraag aanpakken. Het systeem draait op de large language models uit Google's Gemini-familie, waaronder het nieuwste redeneermodel Gemini 3. Waar de eerste versie uit februari 2025 vooral hypotheses bedacht, doorloopt Co-Scientist nu het complete onderzoeksproces: het stelt een hypothese op, maakt een experimenteel plan, schrijft code of machineleesbare labprotocollen, voert het experiment uit, analyseert de resultaten en schrijft er een wetenschappelijk artikel over. Een apart controlemechanisme checkt achteraf of de cijfers in de tekst overeenkomen met wat de uitgevoerde code daadwerkelijk opleverde. Daarmee is Co-Scientist een vroeg voorbeeld van een zelfsturend laboratorium, waarin software niet alleen meet maar ook zelf experimenten bedenkt en uitvoert.

Van kristallen tot bacteriën

De onderzoekers testten het systeem in drie vakgebieden, met steeds meer zelfstandigheid. In de materiaalkunde kreeg Co-Scientist een halfautomatische hoogtemperatuuroven tot zijn beschikking. Het vond een veiliger productieroute voor een gewild 2D-materiaal, dat normaal via een risicovol etsproces wordt gemaakt, en stelde complete synthesereceptuur op die was afgestemd op de apparatuur van het lab. Na 25 rondes met menselijke bijsturing ontstonden gelaagde structuren die op het beoogde materiaal lijken, al ontbreekt definitief bewijs van de atomaire opbouw nog. In een tweede proef maakte het systeem in één keer drie halfgeleiderdunne films, waarbij het de apparatuur rechtstreeks aanstuurde. Dat bracht de ontwikkeltijd van dagen terug naar minuten, al waren de resulterende kristallen minder uniform dan bij zorgvuldig met de hand geoptimaliseerde recepten.

In de biologie bouwde Co-Scientist zelfstandig een beeldanalysepijplijn die voorspelt welke patronen genetisch gemodificeerde E. coli-bacteriën vormen bij verschillende chemische concentraties. Die voorspellingen kwamen op drie van de vier gemeten kenmerken overeen met nog niet gepubliceerde labresultaten. Het meest autonome experiment vond plaats in de informatica: zonder verdere tussenkomst van mensen ontwierp het systeem een medische AI-architectuur die vragen classificeert, tientallen mogelijke antwoorden genereert en die vervolgens verfijnt. Op geautomatiseerde medische benchmarks versloeg dat ontwerp zes vooraanstaande AI-modellen. Maar drie artsen die de antwoorden blind beoordeelden, zagen op acht van de negen criteria geen significant verschil met een gewoon Gemini-model; alleen op het gebied van potentieel schadelijke antwoorden scoorde het AI-ontwerp beter.

Minder verzonnen resultaten, maar niet nul

Een terugkerend probleem bij AI die zelfstandig onderzoek doet, is dat systemen impliciet worden beloond voor mooie uitkomsten en daardoor geneigd zijn resultaten te verzinnen, een vorm van AI-hallucinatie. Eerdere onderzoekssystemen hadden fabricagepercentages tot wel 100 procent. In een dubbelblinde studie met 30 experts en 450 beoordelingen van 150 automatisch geschreven artikelen bleek Co-Scientist met ingeschakelde controlemodules in 4 procent van de gevallen cruciale resultaten te verzinnen, tegenover 46 procent zonder die controles en 90 procent bij een vergelijkingssysteem. Volledig verzonnen data kwam bij Co-Scientist niet voor, wel bij 44 procent van de artikelen van het vergelijkingssysteem. Een ingebouwd veiligheidsmechanisme wees bovendien 98,7 procent van potentieel schadelijke onderzoeksrichtingen af.

De onderzoekers, onder leiding van Samuel Schmidgall, zien de resultaten als een stap richting AI die via experimentele feedback zichzelf verbetert en wetenschappelijk onderzoek kan versnellen. Ze benadrukken tegelijk dat er nog een lange weg te gaan is voordat AI-systemen zelfstandig door de fysieke werkelijkheid van laboratoriumwerk kunnen navigeren. Ook OpenAI werkt naar verluidt aan een vergelijkbaar systeem dat dit najaar moet verschijnen. Critici wijzen erop dat onduidelijk blijft of dit soort AI daadwerkelijk nieuwe kennis ontdekt, of vooral herhaalt wat al verborgen zat in de trainingsdata.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Als AI-systemen zelf experimenten kunnen bedenken, uitvoeren en erover kunnen rapporteren, kan wetenschappelijk onderzoek in principe sneller gaan, vooral in vakgebieden waar veel herhaalwerk nodig is zoals materiaalkunde. Tegelijk laat dit nieuws zien dat controlemechanismen tegen verzonnen resultaten essentieel blijven, en dat menselijke experts nog altijd nodig zijn om AI-uitkomsten te toetsen voordat ze als betrouwbare wetenschap gelden.

Multi-agentsysteem
Een AI-opzet waarbij meerdere gespecialiseerde AI-onderdelen samenwerken aan een grotere taak, zoals hier het plannen, uitvoeren en beschrijven van onderzoek.
Large language model (LLM)
Een AI-taalmodel, getraind op grote hoeveelheden tekst, dat de basis vormt voor systemen als Gemini en dus ook voor Co-Scientist.
Gesloten onderzoekscyclus
Een onderzoeksproces waarin een AI-systeem zelf hypotheses opstelt, experimenten uitvoert, de resultaten analyseert en daarvan weer leert, zonder dat elke stap door een mens wordt gedaan.
Verificatiemodule
Een apart controlemechanisme dat controleert of getallen en beweringen in een door AI geschreven tekst daadwerkelijk overeenkomen met de uitkomsten van de uitgevoerde code of het experiment.
Dubbelblinde studie
Een onderzoeksopzet waarbij zowel de beoordelaars als de onderzochte partij niet weten welke resultaten van welke bron komen, om vooringenomenheid te voorkomen.
AI-hallucinatie
Het verschijnsel waarbij een AI-systeem overtuigend klinkende, maar feitelijk onjuiste of verzonnen informatie presenteert als waarheid.
Benchmark
Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen onderling vergeleken worden.
Zelfsturend laboratorium
Een laboratorium waarin AI en robotica zelfstandig experimenten bedenken, plannen en uitvoeren, met weinig tot geen menselijke tussenkomst.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Agentic AI & autonome agents