AI & computing › Agentic AI & autonome agents
Terminalbedrijf Warp laat zijn AI-agents zichzelf verbeteren via feedback
Het Amerikaanse bedrijf Warp bouwt AI-agents die steeds beter worden door feedback van gebruikers vast te leggen in herbruikbare kennisbestanden. Zo lost het bedrijf een bekend probleem op: AI-assistenten vergeten normaal alles zodra een gesprek stopt. Warp draait de technologie op het platform van AI-bedrijf Anthropic.
Warp maakt een populaire AI-terminal waarin ontwikkelaars met tekstopdrachten programmeertaken laten uitvoeren door AI-agents. Het bedrijf, opgericht in 2020 door Zach Lloyd, haalde tot nu toe 73 miljoen dollar aan investeringen op. Ruim 800.000 ontwikkelaars gebruiken de tool maandelijks en 56 procent van de Fortune 500-bedrijven werkt ermee. Alleen al binnen Warp draaiden tot dusver 10 miljoen sessies met Claude Code, de programmeertool van Anthropic, met meer dan 400.000 per week.
Toch liep Warp tegen een bekend probleem aan. De interne AI-agent die pull requests beoordeelt, gaf regelmatig onbruikbaar commentaar. Engineers klaagden dat de code review door de agent nutteloos of storend was. Het team probeerde eerst de prompt handmatig bij te schaven na elke mislukking, maar dat schaalde niet. Het achterliggende probleem: feedback van gebruikers verdwijnt normaal zodra een sessie eindigt. De agent leert dus nooit structureel bij.
Twee agents, één leercyclus
Warps oplossing bestaat uit twee gekoppelde onderdelen. Een basisagent voert de eigenlijke taak uit, bijvoorbeeld het beoordelen van een pull request, aan de hand van een kennisbestand met vakspecifieke regels en context. Mensen geven vervolgens feedback op het resultaat, bijvoorbeeld door direct op een pull request te reageren met een duimpje omhoog of, beter nog, met een concrete uitleg waarom iets niet klopte. Een tweede agent, die op vaste tijden draait in plaats van per taak, verzamelt die feedback, vergelijkt wat de basisagent voorstelde met hoe mensen reageerden, en doet een gerichte aanpassing aan het kennisbestand. Omdat dat bestand gewoon platte tekst is, kan de wijziging via de normale procedure voor codebeoordeling door een mens worden goedgekeurd en toegevoegd. De volgende keer dat de basisagent draait, werkt hij met de verbeterde kennis.
Menselijke feedback als brandstof
Volgens oprichter Zach Lloyd werkt het systeem het best als je de agent principes meegeeft in plaats van strikte regels, en uitlegt waarom iets fout ging in plaats van alleen wat er fout ging. Ook moet feedback geven zo min mogelijk moeite kosten: een reactie direct op het werk zelf, zonder aparte stap, levert de meeste bruikbare input op. Dit principe van menselijke sturing blijkt cruciaal: een klein beetje gedetailleerde feedback van een ervaren engineer is vaak waardevoller dan honderden simpele duimpjes. Warp past de methode inmiddels toe op zijn hele opensourceproject, met aparte verbeterlussen voor het schrijven van specificaties, het beoordelen van code en het labelen van binnengekomen meldingen. Een voorbeeld: toen de meldingenagent van Warp een label miste bij een nieuwe GitHub-melding, gaf een medewerker exacte feedback. Een geautomatiseerd script verzamelde die input en de verbeteragent diende zelf een voorstel in om het kennisbestand aan te passen — waarna een mens het gewoon kon goedkeuren.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Deze aanpak laat zien hoe AI-agents kunnen blijven leren zonder dat bedrijven dure nieuwe modellen hoeven te trainen: gewone menselijke feedback wordt automatisch omgezet in blijvende kennis. Dat maakt AI-assistenten op termijn betrouwbaarder en persoonlijker afgestemd op de manier van werken binnen een specifiek team of bedrijf. Het model is bovendien overdraagbaar: dezelfde verbeterlus werkt net zo goed voor het beoordelen van code als voor het labelen van meldingen of het schrijven van specificaties.
- Feedbacklus
- Een terugkoppelmechanisme waarbij de uitkomst van een proces wordt gebruikt om datzelfde proces bij te sturen en te verbeteren.
- Kennisbestand (skill)
- Een los tekstbestand waarin vakspecifieke instructies en achtergrondinformatie voor een AI-agent zijn vastgelegd, los van de directe opdracht die de agent krijgt.
- Observeragent
- Een AI-agent die niet zelf de hoofdtaak uitvoert, maar op vaste momenten de resultaten en feedback van een andere agent analyseert om verbeteringen voor te stellen.
- Orchestratieplatform
- Software die bepaalt welke AI-agent wanneer en hoe wordt ingezet, en die taken tussen verschillende agents coördineert.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.