AI & computing › Agentic AI & autonome agents

Cognition lanceert codeermodel SWE-2: bijna topklasse voor een fractie van de prijs

· Bijgewerkt 10 september 2026, 19:36 · 2 min leestijd

Agentic AI & autonome agents
Beeld: Hacker News frontpage

Het Amerikaanse bedrijf Cognition, bekend van de AI-programmeerassistent Devin, presenteert zijn nieuwste model SWE-2. Het model scoort bijna net zo goed als de duurste concurrenten op programmeertaken, maar is tot 64 procent goedkoper in gebruik. Volgens Cognition komt dat door een nieuwe trainingsmethode die voor het eerst is toegepast op een model met biljoenen parameters.

Cognition traint AI-modellen die zelfstandig kunnen programmeren, testen en bugs oplossen. Het nieuwste model, SWE-2, haalt op de testset FrontierCode 1.1 Main een score van 50,0 procent. Dat is net iets lager dan het toonaangevende model Fable 5.1, maar SWE-2 kost daarbij 64 procent minder om te draaien. Op een andere benchmark, DeepSWE 1.1, doet het model het zelfs beter dan het duurdere GPT-5.6 Sol. Cognition noemt dit de beste balans tussen prestatie en kosten die het bedrijf ooit heeft bereikt.

Trainen op ongekende schaal

Het bijzondere aan SWE-2 is de trainingsmethode. Cognition gebruikte reinforcement learning, een trainingstechniek waarbij een AI-model beloond wordt voor goede oplossingen en gestraft voor slechte, verkeerde of te dure oplossingen. Voor het eerst is deze techniek toegepast op een basismodel met bijna drie biljoen parameters: Kimi K3, gemaakt door het Chinese AI-lab Moonshot AI. Parameters zijn de instelbare knoppen binnen een AI-model; hoe meer parameters, hoe krachtiger maar ook hoe duurder een model doorgaans is om te trainen en te gebruiken.

Gebruikers van Devin kunnen kiezen tussen verschillende effort-niveaus: medium, high en max. Bij een hoger niveau denkt het model langer en grondiger na, wat duurder is maar betere resultaten kan opleveren bij complexe taken. Normaal gesproken moet een AI-bedrijf voor elk niveau apart trainen. Cognition ontwikkelde een methode om alle niveaus in één trainingsronde tegelijk te verbeteren, met een beloningsformule die rekening houdt met zowel het succes van een taak als de kosten ervan. Daarmee verschuift het bedrijf de hele verhouding tussen kosten en prestatie in één keer, in plaats van laag voor laag.

Minder omzwervingen, snellere oplossingen

Die aanpak is terug te zien in het gedrag van het model. SWE-2 op het medium-niveau scoort hoger dan de vorige versie SWE-1.7, maar heeft daarbij 58 procent minder stappen nodig en is 81 procent goedkoper. Het model begint sneller met echt coderen: gemiddeld na 18 stappen zoeken door de code, tegen 48 stappen bij het vorige model. Cognition zegt dat SWE-2 beter inschat welke delen van een programma daadwerkelijk relevant zijn voor een taak, waardoor het minder tijd verspilt aan onnodig uitgebreid onderzoek.

Ook de kwaliteit van het werk verbetert volgens het bedrijf. Het model schrijft betere tests die fouten opvangen, zoekt actiever naar alternatieve oplossingen als de voor de hand liggende weg is afgesloten, en controleert eigen conclusies opnieuw in plaats van ze zomaar te herhalen. Bij twijfel checkt SWE-2 aannames van de gebruiker liever met bewijs dan dat het klakkeloos meegaat in wat iemand beweert.

Direct beschikbaar

SWE-2 is vanaf nu te gebruiken in Devin Desktop en de command line-versie van Devin, en wordt de komende tijd ook uitgerold naar Devin Web en Fusion. Voor bedrijven die AI inzetten bij softwareontwikkeling betekent dit vooral dat geavanceerde coderende AI dichterbij de kosten van eenvoudigere modellen komt, zonder dat daar veel kwaliteit voor wordt ingeleverd.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Doordat AI-codeermodellen goedkoper worden terwijl de kwaliteit vergelijkbaar blijft, kunnen meer bedrijven en ontwikkelaars AI op grote schaal inzetten bij softwareontwikkeling. De nieuwe trainingsmethode van Cognition laat ook zien dat kostenbewust trainen een serieuze technische discipline wordt binnen AI-ontwikkeling, niet alleen een kwestie van een groter model bouwen. Dat kan de komende jaren de manier veranderen waarop AI-bedrijven hun modellen trainen en prijzen.

Reinforcement learning
Een trainingstechniek waarbij een AI-model leert door beloningen te krijgen voor goede resultaten en straffen voor slechte, in plaats van te leren van vaste voorbeelden.
Benchmark
Een gestandaardiseerde testset waarmee de prestaties van verschillende AI-modellen onderling vergeleken kunnen worden.
Effort-niveau
De instelling die bepaalt hoeveel 'moeite' of rekentijd een AI-model in een taak steekt; een hoger niveau levert vaak betere maar duurdere resultaten op.
Parameters
De interne instelbare waarden van een AI-model die bepalen hoe het reageert op input; meer parameters betekenen doorgaans een krachtiger maar ook duurder model.
Basismodel
Het onderliggende AI-model waarop een nieuw, gespecialiseerd model wordt gebouwd via extra training.
Rollout (RL-rollout)
Een simulatie waarbij een AI-model een taak van begin tot eind zelfstandig uitvoert, waarna het resultaat wordt gebruikt om het model te trainen.
Kostenpenalisatie
Een techniek waarbij de rekenkosten van een oplossing worden meegewogen in de beloning tijdens het trainen, zodat een AI-model leert om niet alleen goede maar ook goedkope oplossingen te vinden.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Agentic AI & autonome agents