AI & computing › Agentic AI & autonome agents
Onderzoek: coding-AI's als Claude Code en Cursor kiezen zelden dezelfde tool
Onderzoeksbureau Armature liet drie populaire AI-codeerassistenten bijna 17.000 keer een technische keuze maken, van database tot betaaldienst. De uitkomst: de assistenten kiezen in bijna 6 op de 10 gevallen een andere oplossing voor exact dezelfde taak.
Steeds meer ontwikkelaars laten een AI-assistent zelf bepalen welke externe dienst ze in hun software inbouwen: welke database, welke betaalprovider, welk e-mailplatform. Onderzoeksbureau Armature wilde weten hoe betrouwbaar die keuzes zijn en liet drie bekende agentic AI-tools, Claude Code, Codex en Cursor, bijna 17.000 keer dezelfde soort beslissing nemen. Van de 16.893 sessies bleven er 5.292 over die streng genoeg gecontroleerd waren om te publiceren.
De onderzoekers bouwden 75 nepbedrijven met valse git-geschiedenis en API-sleutels, in tien programmeertalen. Vervolgens lieten ze vier soorten gebruikers, van een vibe coder zonder technische achtergrond tot een engineer bij een groot bedrijf met compliance-eisen, in 1.163 varianten om dezelfde functionaliteit vragen. Denk aan: "zorg dat facturen automatisch naar de klant worden gemaild". Elke sessie draaide in een aparte digitale testomgeving, verspreid over drie verschillende sandboxaanbieders om toevalstreffers uit te sluiten.
Grote onderlinge verschillen
De belangrijkste conclusie: de drie assistenten kiezen slechts in 42 procent van de gevallen dezelfde oplossing. Bij spraakgestuurde toepassingen koos Claude Code bijvoorbeeld voor Twilio, Codex voor de Realtime API van OpenAI en Cursor voor Vapi. Ook hun onderzoeksgedrag verschilt sterk. Codex zoekt in 94 procent van de sessies op internet en richt zich daarbij vaak specifiek op vertrouwde websites. Cursor doet dat in twee derde van de gevallen. Claude Code vertrouwt juist vooral op eigen kennis en zoekt maar in ongeveer 30 procent van de sessies online, al bekijkt het dan wel drie keer zoveel pagina's als Codex. Claude Code bouwt bovendien bijna twee keer zo vaak een oplossing volledig zelf, in plaats van een bestaande dienst te gebruiken: 19 procent tegenover 10 procent bij de concurrenten.
De programmeertaal bepaalt de winnaar
Opvallend is hoe sterk de context de uitkomst stuurt. Voor exact dezelfde taak, het versturen van e-mails, koos de AI in een Typescript-project meestal Resend, in Python-code Sendgrid, in Go-projecten Postmark en in Java-omgevingen Azure. Cloudplatform Vercel werd alleen aangeraden bij Typescript-projecten en zelfs altijd bij gebruik van het framework Next.js, maar nooit bij Python, waar concurrent Render domineerde. Bekende merken worden ook lang niet altijd gekozen: veel diensten worden wel genoemd in het gesprek, maar sneuvelen daarna alsnog.
Voor bedrijven die software verkopen aan ontwikkelaars is dit relevant nieuws: als AI-assistenten straks een groeiend deel van de technische keuzes maken, telt niet alleen naamsbekendheid maar ook hoe goed een dienst aansluit bij een specifieke programmeertaal of situatie. Armature, dat zelf groeidiensten verkoopt aan softwarebedrijven, publiceerde alle sessies inclusief volledige gesprekslogs openbaar, zodat iedereen de resultaten kan natrekken.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Nu AI-assistenten steeds vaker zelfstandig technische keuzes maken namens ontwikkelaars, wordt het voor softwarebedrijven cruciaal om niet mensen, maar de AI zelf te overtuigen. Dit onderzoek laat zien dat die keuzes sterk afhangen van toeval, programmeertaal en het onderzoeksgedrag van de gebruikte AI, wat de betrouwbaarheid van AI-adviezen in twijfel trekt.
- Agentic AI
- Kunstmatige intelligentie die niet alleen antwoord geeft, maar zelfstandig taken uitvoert, zoals het schrijven en aanpassen van code.
- Vibe coding
- Programmeren waarbij een gebruiker vooral in gewone taal beschrijft wat hij wil, en een AI de technische uitwerking overneemt.
- Sandbox
- Een afgeschermde digitale testomgeving waarin software veilig kan draaien zonder andere systemen te beïnvloeden.
- API
- Een technische verbinding waarmee twee stukken software met elkaar kunnen communiceren, bijvoorbeeld om een externe dienst zoals een betaalprovider aan te roepen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.