AI & computing › Agentic AI & autonome agents
Meta geeft AI-agents een geheugencoach om lange taken vol te houden
AI-agents die lang aan een klus werken, vergeten vaak wat ze eerder hebben geleerd en herhalen daardoor fouten. Meta AI presenteert een oplossing: een tweede AI die als geheugencoach meekijkt en alleen ingrijpt als dat nodig is. Op twee testomgevingen leidde dit tot duidelijk betere resultaten.
Een AI-agent die urenlang doorwerkt aan een programmeerklus of klantvraag, botst vaak op een merkwaardig probleem: hij vergeet zijn eigen conclusies. De agentic AI herkent bijvoorbeeld vroeg in een taak een beperking, maar overtreedt die later alsnog terwijl hij een ander probleem oplost. Of hij probeert een commando dat al mislukte, in bijna identieke vorm opnieuw. Meta AI noemt dit "behavioral state decay": de kennis die het gedrag van de agent zou moeten sturen, raakt verspreid over een steeds langere taakgeschiedenis en verdwijnt uiteindelijk uit beeld.
Het probleem zit niet per se in te weinig geheugen. Onderzoekers van Meta AI stellen dat agents simpelweg een langer contextvenster geven het probleem niet oplost. Ook als informatie nog ergens in de gespreksgeschiedenis staat, betekent dat niet dat de agent zich er nog naar gedraagt. Bestaande geheugensystemen zijn vooral gericht op het opslaan en terugvinden van informatie over meerdere sessies heen, maar missen een cruciaal onderdeel: weten wanneer een herinnering het huidige moment daadwerkelijk moet beïnvloeden.
Een tweede agent als toezichthouder
De oplossing van Meta bestaat uit twee samenwerkende AI-systemen. Een onaangepaste "actie-agent" voert de eigenlijke taak uit, zoals voorheen. Daarnaast draait een "geheugenagent" die op vaste momenten de recente stappen doorneemt en een gestructureerde geheugenbank bijwerkt. Die bank bestaat uit drie delen: een privé-statusveld met risico's dat de actie-agent nooit te zien krijgt, een kennisgeheugen met vaste feiten zoals bestandslocaties en instellingen, en een proceduregeheugen met eerdere pogingen, mislukkingen en oplossingen.
Het bijzondere zit in de beslissing die de geheugenagent daarna neemt: wel of geen reminder sturen naar de actie-agent. Te veel herinneringen kosten tijd en leiden af, te weinig laat fouten zich herhalen. Het systeem kan dus ook bewust besluiten om te zwijgen.
Betere scores, vooral bij zwakkere modellen
Meta testte de aanpak op twee benchmarks: Terminal-Bench 2.0, dat agents in realistische command-line-omgevingen test, en tau2-Bench, dat gesprekken met klantenservice in de luchtvaart-, retail- en telecomsector nabootst. Met Claude Sonnet 4.5 als actie-agent en Claude Opus 4.6 als geheugenagent steeg de score op Terminal-Bench van 38 naar 46 procent bij de eerste poging. Op tau2-Bench ging het gemiddelde omhoog van 55 naar 62 procent, met de grootste winst in de luchtvaart- en retailsector.
Ook bij het sterkere model Opus 4.6 als actie-agent bleef er winst over, zij het kleiner: ruim 2 procentpunt op beide tests. Dat wijst erop dat het systeem meer doet dan alleen de zwakke plekken van een minder krachtig model compenseren. Een variant zonder de "zwijgoptie", die bij elke stap een reminder stuurde, presteerde minder consistent dan de volledige versie. Meta test ook of kleinere, open modellen dezelfde taak kunnen leren via reinforcement learning; dat lukte, maar vereiste eerst gerichte training. De code van het project staat op GitHub.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Naarmate AI-agents langere en complexere taken zelfstandig uitvoeren, wordt het onthouden van eerdere fouten en beperkingen net zo belangrijk als het redeneervermogen zelf. Een apart geheugensysteem dat zelf bepaalt wanneer het moet ingrijpen, kan agents betrouwbaarder maken zonder dat ontwikkelaars het onderliggende model hoeven aan te passen.
- Behavioral state decay
- De term van Meta voor het verschijnsel dat belangrijke kennis van een AI-agent tijdens een lange taak vervaagt of verloren raakt.
- Actie-agent
- De AI die de daadwerkelijke taak uitvoert, zoals programmeren of een klantvraag afhandelen.
- Geheugenagent
- Een los AI-systeem dat de voortgang van de actie-agent bijhoudt en beslist wanneer een herinnering nodig is.
- Geheugenbank
- De gestructureerde opslag met status, feiten en eerdere pogingen die de geheugenagent bijhoudt en raadpleegt.
- Terminal-Bench en tau2-Bench
- Testomgevingen waarmee onderzoekers meten hoe goed AI-agents realistische, meerstaps-taken uitvoeren.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.