AI & computing › Agentic AI & autonome agents

Anthropic zet AI-codeertool Claude Code standaard op autopiloot

· Bijgewerkt 8 augustus 2026, 17:13 · 5 min leestijd

Agentic AI & autonome agents
Beeld: The Decoder

Anthropic maakt Auto Mode vanaf 14 augustus de standaardinstelling in Claude Code, de populairste AI-tool voor softwareontwikkeling. Een ingebouwd controlemodel checkt voortaan zelf of een actie gevaarlijk is, in plaats van dat ontwikkelaars elke stap goedkeuren. Volgens tests van Anthropic werkt die aanpak beter dan menselijke controle.

Vanaf 14 augustus 2026 schakelt Anthropic de zogeheten Auto Mode standaard in voor gebruikers van Claude Code, de populairste agentic AI-tool voor softwareontwikkeling. Pro-, Max- en Teamgebruikers hoeven niets te doen: de functie staat straks gewoon aan; wie zelf al een andere standaardinstelling had gekozen, krijgt eenmalig de vraag of hij wil overstappen op Auto Mode, en wie een vaste standaard heeft vastgezet merkt niets van de wijziging. Grote bedrijven met een Enterprise-abonnement, en gebruikers van de Claude API, AWS Bedrock, Google Cloud's Agent Platform en Microsoft Foundry, moeten Auto Mode voorlopig nog zelf activeren; Anthropic zegt de functie de komende maand ook daar standaard te willen maken. Teams bij Adobe, Nuro, Gusto en Garner Health draaien Auto Mode al als productiestandaard. Anthropic introduceerde Auto Mode in maart al als testversie, als antwoord op de vraag hoe snelheid en controle zich tot elkaar verhouden.

Classifier vangt risico's op

Claude Code kan zelfstandig bestanden aanpassen, commando's uitvoeren en code wegschrijven. Tot nu toe moest een ontwikkelaar bij risicovolle stappen telkens op 'akkoord' klikken. In Auto Mode neemt een speciaal controlemodel, een zogeheten classifier, die rol grotendeels over. Het systeem beoordeelt of een actie gevaarlijk of onomkeerbaar is en vraagt alleen dan om bevestiging, in de woorden van Anthropic zelf wanneer een actie "irreversible, destructive, or aimed outside your environment" is. Bij alle andere stappen werkt Claude gewoon door. Blokkeert de classifier toch een actie, dan zoekt Claude meestal zelf een veiligere weg of legt het de keuze alsnog aan de gebruiker voor; lukt dat niet — na drie blokkades op rij, of twintig binnen één sessie — dan schakelt Claude Code automatisch terug naar handmatige goedkeuring. Bestaande permissieregels in de instellingen blijven binnen Auto Mode gewoon van kracht, met één uitzondering: extreem brede regels die willekeurige code-uitvoering toestaan, zoals Bash(python:*), worden tijdelijk buiten werking gesteld zodat commando's niet alsnog om de classifier heen kunnen. De instellingen zelf blijven ongewijzigd en gelden weer volledig zodra iemand een andere modus kiest.

Anthropic testte de aanpak met 1.053 betaalde testers en intern rode-teamonderzoek. Daaruit blijkt dat de classifier 89 procent van de gevaarlijke commando's opspoorde. Menselijke reviewers, die zelf moesten inschatten of een actie riskant was, haalden slechts 13,6 procent: van de 1.053 testers blokkeerde Auto Mode 800 commando's die een menselijke tester had goedgekeurd, tegenover slechts 6 gevallen waarin een mens wél ingreep en de classifier niet. Naarmate een sessie langer duurde, werden mensen bovendien minder alert: het aandeel onderschepte gevaarlijke commando's zakte van zo'n 17 procent vroeg in een sessie naar 5 procent na meer dan vijftig eerdere vragen, terwijl de classifier een constant niveau aanhield. Een verklaring die Anthropic zelf aandraagt: handmatige controle wordt al snel routine, in de praktijk keuren gebruikers liefst 97 procent van de bevestigingsvragen in Claude Code goed, tegenover 'slechts' 61 procent wanneer Claude een heel plan ter goedkeuring voorlegt. Diezelfde gewenning is terug te zien in de instellingen: half juni 2026 had 49,5 procent van de actieve CLI-gebruikers zelf een 'allow-rule' voor Bash-commando's aangemaakt, had 62 procent ooit bypassPermissions gebruikt of op 'niet meer vragen' geklikt, en startte een kwart van de sessies inmiddels meteen in die bypass-modus. Teams die met Auto Mode werkten, produceerden bovendien zo'n 25 procent meer pull requests, een teken dat ze sneller werk afronden.

Ook in praktijkgebruik zou Auto Mode beter scoren, blijkt uit een analyse van Anthropic van sessies die het eigen veiligheidssysteem tussen mei en juni 2026 had gemarkeerd voor controle. Bij risico's op productieniveau kwam in 6,3 procent van de handmatig goedgekeurde sessies onbedoelde schade voor, tegenover 2,4 procent bij sessies die in Auto Mode liepen.

Boris Cherny, hoofd van Claude Code bij Anthropic, onderstreept dat vertrouwen: op X liet hij weten dat hij en zijn team al maanden uitsluitend met Auto Mode werken. "Ik zou me niet meer kunnen voorstellen terug te gaan naar losse bevestigingsvragen", aldus Cherny.

Ook een schild tegen prompt injection

Auto Mode moet daarnaast bescherming bieden tegen prompt injection: aanvallen waarbij kwaadwillenden verborgen instructies in code of documenten verstoppen om een AI-agent van zijn oorspronkelijke opdracht af te leiden. Het onafhankelijke onderzoeksbureau Trajectory Labs testte 72 verschillende aanvalsscenario's, elk tien keer, in totaal dus 720 pogingen. Tegen Claude's huidige modellen Fable 5, Opus 5 en Sonnet 5 slaagde geen enkele aanval. Bij de concurrerende oplossing van OpenAI, GPT-5.6 Sol in de Auto-Review-modus van Codex, kwam 5,83 procent van de aanvallen wel door de verdediging heen. Daarnaast werkte Anthropic samen met het Britse AI-veiligheidsbedrijf Apollo Research, dat in een tweewekelijkse pilot synthetische aanvallen injecteerde in echte codeersessies, gericht op brede uitval, datalekken en veiligheidsrisico's. Naar aanleiding daarvan versterkte Anthropic de classifier vooral door hem meer context te geven over de omgeving die hij beschermt, zoals de zichtbaarheid van een repository, de git-status en de regels voor gegevensverwerking. Verder introduceert Anthropic aanpasbare harde weigerregels, waarmee gebruikers zelf specifieke acties zoals het naar buiten versturen van data expliciet kunnen blokkeren.

Intern bij Anthropic zelf greep Auto Mode al meermaals in. Het voorkwam dat Claude vertrouwelijke bedrijfsdata naar een publiek toegankelijke pagina uploadde. Tijdens een langdurige sessie beëindigde het systeem ook zo'n tweeduizend processen die anders lopende trainingsjobs op GPU's zouden hebben verstoord.

Van coderen naar controleren

Anthropic rekent Pro-, Max- en Teamgebruikers niets extra aan voor de tokens die de classifier zelf verbruikt. Toch is de nieuwe standaardinstelling waarschijnlijk gunstig voor het bedrijf: hoe langer en zelfstandiger Claude werkt, hoe meer tokens er in totaal worden verbruikt, en dus hoe hoger de omzet.

Claude Code is nu al de meest gebruikte AI-programmeertool. Doordat Auto Mode straks de standaard is, verschuift de rol van ontwikkelaars verder van zelf code schrijven naar het controleren van wat de AI aflevert, een vorm van human-in-the-loop-toezicht. Anthropic waarschuwt zelf dat de classifier risico's vermindert, maar niet wegneemt: "Voor risicovolle wijzigingen aan productie-infrastructuur raden we nog steeds aan om Claude's acties zelf te controleren."

Dat advies bevat een spanning. Hoe minder vaak ontwikkelaars ingrijpen, hoe zwaarder hun toezicht weegt op de momenten dat ze dat wel doen. Tegelijk wordt het lastiger om grip te houden op projecten die grotendeels autonoom tot stand zijn gekomen, terwijl digitale dreigingen zich sneller ontwikkelen dan mensen kunnen bijbenen.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Nu de meest gebruikte AI-codeertool standaard autonoom werkt, verschuift softwareontwikkeling verder van zelf typen naar toezicht houden op AI. Dat kan de productiviteit flink verhogen, maar het vergroot ook het belang van goede vangnetten tegen fouten en aanvallen, juist omdat mensen minder vaak meekijken.

Auto Mode
De modus waarin Claude Code zelfstandig werkt en alleen bij risicovolle of onomkeerbare acties om bevestiging vraagt.
Classifier
Een gespecialiseerd AI-model dat inschat of een actie gevaarlijk is en op basis daarvan beslist of er menselijke goedkeuring nodig is.
Prompt injection
Een aanvalstechniek waarbij verborgen instructies in tekst of code een AI-systeem proberen te misleiden zodat het afwijkt van de opdracht van de gebruiker.
Rode-teamonderzoek
Het bewust proberen te 'breken' van een systeem door aanvallen te simuleren, om zwakke plekken op te sporen voordat kwaadwillenden dat doen.
Pull request
Een voorstel van een ontwikkelaar om nieuwe of aangepaste code aan een project toe te voegen, dat meestal eerst wordt beoordeeld.
Human-in-the-loop
Een ontwerp waarbij een mens op cruciale momenten controle houdt over een automatisch of AI-gestuurd proces.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Agentic AI & autonome agents