AI & computing › Generatieve AI & synthetische media
Google lanceert Gemini 3.8 Flash: sneller AI-model voor programmeren en agents
Google DeepMind heeft Gemini 3.8 Flash uitgebracht, een nieuwe versie van zijn AI-model dat vooral is verbeterd voor softwareontwikkeling en het uitvoeren van complexe taken door AI-agents. Het model bouwt voort op de voorganger Gemini 3.7 Flash en is per direct beschikbaar in onder meer de Gemini-app en Google AI Studio.
Google DeepMind presenteerde begin september Gemini 3.8 Flash, de nieuwste telg in de Gemini 3-modelfamilie. Het model is vooral bedoeld voor ontwikkelaars en bedrijven die agentic AI inzetten: AI-systemen die zelfstandig meerdere stappen uitvoeren om een taak af te ronden, zoals het schrijven en testen van code of het doorlopen van een compleet werkproces zonder voortdurende menselijke sturing. Het is al de derde Flash-uitgave in zes weken tijd, terwijl grotere "frontier"-modellen als Gemini 3.5 Pro en Gemini 4 nog altijd op zich laten wachten.
Meer keuze tussen snelheid en kwaliteit
Net als eerdere Gemini-modellen ondersteunt de nieuwe versie instelbare effort-niveaus. Gebruikers kunnen zo zelf bepalen hoeveel "moeite" het model doet: meer rekenkracht en tijd voor een grondiger antwoord, of juist snelheid en lagere kosten voor eenvoudigere taken. Het model verwerkt tekst, afbeeldingen, audio en video en heeft een contextvenster van maximaal 1 miljoen tokens, plus een uitvoer tot 64.000 tokens. Daarmee kan het model grote hoeveelheden documenten of code in één keer verwerken. Gemini 3.8 Flash is te gebruiken via de Gemini-app, Google AI Studio, de Gemini API, Google Cloud's Gemini Enterprise-platform, de nieuwe ontwikkelomgeving Google Antigravity, Android Studio en Google Search's AI Mode; betalende abonnees krijgen het model ook in Google Sheets.
Prestaties en prijzen vergeleken met concurrenten
Volgens Google's eigen benchmarks scoort Gemini 3.8 Flash 73,7 procent op DeepSWE v1.1, een test voor langlopende software-ontwikkeltaken. Daarmee blijft het net onder Claude Opus 5 (74,0 procent), maar ruim voor GPT-5.6 Sol (72,7 procent), Claude Sonnet 5 (53,8 procent) en de eigen voorganger 3.7 Flash (65,3 procent). Onafhankelijk benchmarkplatform Artificial Analysis geeft het model een Intelligence Index-score van 59, drie punten hoger dan 3.7 Flash en gelijk aan GPT-5.6 Sol en Grok 4.6. Ook op het gebied van multistap-redeneren scoort het model goed: op de test HLE-Verified haalt Gemini 3.8 Flash 54,9 procent, en in gespecialiseerde zakelijke domeinen zoals financiële analyse (Vals Finance Agent V2) en juridisch werk (Harvey's Legal Agent Benchmark) presteert het volgens Google beter dan zowel 3.7 Flash als andere frontier-modellen. Op het gebied van agentic computergebruik, getest met OSWorld-2.0, boekt het model volgens techsite Ars Technica wel vooruitgang ten opzichte van 3.7 Flash, maar blijft het op dit vlak nog duidelijk achter bij marktleider Claude Opus.
Bij lancering kost Gemini 3.8 Flash 0,75 dollar per miljoen invoertokens en 3,75 dollar per miljoen uitvoertokens, gelijk aan de prijs van 3.7 Flash. Vanaf januari 2027 stijgt dit naar 1,50 en 7,50 dollar. Daarmee blijft het model fors goedkoper dan Claude Opus 5 (5,00 en 25,00 dollar per miljoen tokens) en GPT-5.6 Sol (4,00 en 20,00 dollar). Google wijst er wel op dat het model bij complexere taken meer redeneerstappen zet en herhaaldelijk tools aanroept, wat het tokengebruik verhoogt: volgens Artificial Analysis steeg de gemiddelde kostprijs per taak daardoor zo'n 40 procent, naar 0,58 dollar, veroorzaakt door 30 procent meer uitvoertokens per taak en meer stappen bij agentic-taken. Ontwikkelaars die het tokengebruik willen beperken, kunnen er volgens Google voor kiezen om voorganger 3.7 Flash te blijven gebruiken.
Losstaande versie voor cyberbeveiliging
Naast het algemene model brengt Google ook Gemini 3.8 Flash Cyber uit, een gespecialiseerde variant voor cyberbeveiliging. Dit model is niet vrij beschikbaar, maar wordt via het Fairwind-programma verstrekt aan overheidsinstanties, beheerders van vitale infrastructuur en softwarebeheerders. Aan dit programma nemen inmiddels zo'n 650 partijen deel, waaronder beveiligingsbedrijf CrowdStrike en het Center for Internet Security; deelnemers krijgen naast toegang tot Gemini 3.8 Flash Cyber ook gebruik van Google's CodeMender-agent, die zelfstandig kwetsbaarheden moet opsporen en verhelpen. Omdat het model bedoeld is voor defensief beveiligingswerk, zoals het opsporen van kwetsbaarheden in C/C++-code, gelden er minder strikte veiligheidsinstellingen dan bij de reguliere versie. Op de veelgebruikte cyberbeveiligingstest CyberGym, die zich eveneens richt op C/C++-code, presteert het model volgens Google op het niveau van de absolute top en overtreft het zowel voorganger 3.5 Flash Cyber als aanzienlijk grotere frontier-modellen. In een bredere interne test die kwetsbaarheden in twintig verschillende programmeertalen omvat, haalt het model een slagingspercentage van ruim 70 procent. Ook bij het automatisch patchen van kwetsbaarheden scoort Gemini 3.8 Flash Cyber sterk: op de externe benchmark CWE-Bench haalt het een score van 47,2 procent, nagenoeg gelijk aan het best presterende frontier-model (47,8 procent), maar tegen aanzienlijk lagere kosten. Google meldt dat het model al concrete resultaten oplevert in de praktijk: het Chrome Security-team registreerde 2,6 keer zoveel correcte patches als met de beste commerciële modellen, beveiligingsbedrijf Wiz zag een 7,5 tot 9,7 procent hogere trefkans bij penetratietests tegen 2,3 tot 5,2 keer lagere kosten, en Google's eigen Cloud Vulnerability Research-team vond met het model een kritieke kwetsbaarheid in minder dan twee uur, een klus die normaal maanden onderzoek vergt. Ook cyberbeveiligingsbedrijf Palo Alto Networks bevestigt de sterke prestaties van het model, meldt Ars Technica.
Veiligheidstests laten wisselend beeld zien
Google test elk nieuw model uitgebreid op veiligheid, onder meer met geautomatiseerde controles en menselijke 'red teaming': speciale teams die actief proberen het model te misleiden of onveilige antwoorden te ontlokken. Uit de resultaten blijkt dat Gemini 3.8 Flash op de meeste vlakken vergelijkbaar presteert met zijn voorganger. Opvallend is wel dat de veiligheid bij meertalige gesprekken iets is verslechterd: 5,4 procentpunt slechter dan bij Gemini 3.7 Flash. Voor kinderveiligheid haalde het model de vereiste drempelwaarden. Nieuw is dat het model expliciete waarborgen bevat tegen misbruik op het gebied van chemische, biologische, radiologische en nucleaire (CBRN) dreigingen, naast waarborgen tegen cyberaanvallen. Google beoordeelde het model ook aan de hand van zijn Frontier Safety Framework, een beleidskader waarmee het bedrijf checkt of een AI-systeem gevaarlijk krachtige vaardigheden ontwikkelt. Volgens Google zijn daarbij geen zorgwekkende nieuwe capaciteiten aangetroffen. Wel meldt het bedrijf een duidelijke verbetering op het gebied van bestendigheid tegen prompt injection, gemeten door beveiligingsonderzoeker Gray Swan; dit moet gebruikers beter beschermen tegen kwaadaardige aanvallen via verstopte instructies.
Bekende beperkingen blijven bestaan
Google waarschuwt dat het model, zoals vrijwel alle taalmodellen, kan blijven hallucineren: met overtuiging onjuiste informatie presenteren. Ook blijft het kwetsbaar voor zogeheten jailbreaks, pogingen om de ingebouwde beveiligingen te omzeilen, al zegt Google hier extra mitigaties tegen te hebben doorgevoerd. Verder kan het model bij hogere effort-niveaus meer tokens gebruiken om tot een antwoord te komen, wat de kosten kan opdrijven. De kennis van het model is bijgewerkt tot maart 2026, al blijft die voor sommige onderwerpen beperkt tot januari 2025. Voor gebruikers en bedrijven betekent de release vooral een geleidelijke verbetering: geen grote sprong in mogelijkheden, maar een efficiëntere en iets veiligere versie van een model dat al breed wordt ingezet voor programmeerwerk en geautomatiseerde taken.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Modellen als Gemini 3.8 Flash laten zien hoe AI-bedrijven stap voor stap doorontwikkelen aan systemen die zelfstandig taken uitvoeren, van programmeren tot complexe workflows. Dat maakt AI-agents praktischer inzetbaar voor bedrijven, maar de aanhoudende risico's rond hallucinaties en jailbreaks tonen dat volledige betrouwbaarheid nog niet is bereikt.
- Agentic AI
- AI-systemen die zelfstandig meerdere stappen uitvoeren om een taak te voltooien, zonder dat een mens elke stap hoeft te sturen.
- Effort-niveau
- Een instelling waarmee gebruikers bepalen hoeveel rekenkracht en tijd een AI-model besteedt aan een antwoord, in ruil voor meer kwaliteit of juist snelheid.
- Contextvenster
- De hoeveelheid tekst, beeld of andere data die een AI-model tegelijk kan 'onthouden' en verwerken tijdens een gesprek of taak.
- Token
- Een stukje tekst, vaak een woord(deel), waarmee taalmodellen taal verwerken; de hoeveelheid tokens bepaalt kosten en snelheid.
- Hallucineren
- Wanneer een AI-model met overtuiging informatie presenteert die feitelijk onjuist of verzonnen is.
- Jailbreak
- Een poging om de ingebouwde veiligheidsregels van een AI-model te omzeilen zodat het verboden of schadelijke inhoud genereert.
- Red teaming
- Het gericht testen van een systeem door specialisten die actief proberen zwakke plekken of onveilig gedrag te ontdekken.
- Frontier Safety Framework
- Een beleidskader van Google DeepMind om te beoordelen of een AI-model gevaarlijk krachtige nieuwe vaardigheden ontwikkelt.
- Kennisafsluitdatum
- De datum tot waar een AI-model is getraind op actuele informatie; gebeurtenissen daarna kent het model niet.
- Intelligence Index
- Een gecombineerde score van onderzoeksplatform Artificial Analysis die de algemene prestaties van AI-modellen op meerdere benchmarks samenvat in één getal.
- CBRN
- Afkorting voor Chemical, Biological, Radiological, and Nuclear: potentieel gevaarlijke domeinen waartegen AI-modellen expliciete veiligheidswaarborgen kunnen bevatten om misbruik te voorkomen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.