AI & computingGeneratieve AI & synthetische media

AI-chipmakers draaien om: 'denken' vraagt meer rekenkracht dan trainen

· Bijgewerkt 16 september 2026, 02:34 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: IEEE Spectrum

Jarenlang ging alle aandacht naar het trainen van steeds grotere AI-modellen. Nu die modellen dagelijks miljarden vragen beantwoorden, verschuift de focus naar inferentie: het daadwerkelijke gebruik ervan. Die omslag dwingt chipmakers tot een radicaal andere aanpak.

Van trainen naar “denken”

Tussen 2020 en 2024 groeiden taalmodellen van miljoenen naar biljoenen parameters. Dat leverde spectaculaire sprongen op: de grootste versie van GPT-3 beantwoordde in 2020 nog 43,9 procent van de vragen goed op een bekende kennis- en redeneertest. Vier jaar later haalde GPT-4o op dezelfde test 88,7 procent, vergelijkbaar met menselijke experts. Volgens Matt Kimball, analist bij Moor Insights & Strategy, is trainen inmiddels 'oud nieuws'. Nvidia-topman Jensen Huang noemde 2026 tijdens de GTC-conferentie het 'kantelpunt van inferentie': het moment waarop het gebruik van AI-modellen belangrijker wordt dan het bouwen ervan.

Die verschuiving heeft een simpele oorzaak: mensen gebruiken AI nu massaal. Bovendien zijn veel populaire modellen tegenwoordig zogeheten redeneermodellen. Die genereren niet in één keer een antwoord, maar herhalen hun eigen redenering meerdere keren in een proces dat chain of thought heet. Modellen die hard 'nadenken' produceren daardoor tot twintig keer zoveel tekst als modellen zonder die stap. Ook de opkomst van agentic AI, systemen die dag en nacht zelfstandig naar een doel toewerken, jaagt de vraag naar rekenkracht verder op.

Waarom een antwoord geven zwaarder is dan gedacht

Trainen en inferentie lijken op elkaar, maar zijn technisch heel verschillend. Tijdens training leert een model door miljarden teksten te voorspellen en zichzelf bij te sturen via backpropagation, een rekenproces dat bepaalt hoe elk van de miljarden parameters een klein beetje moet veranderen. Zodra dat proces stopt, ligt het model vast en begint de inferentiefase: het echte gebruik.

Volgens Sudeep Bhoja, oprichter en CTO van chipbedrijf d-Matrix, is inferentie allesbehalve licht werk. Taalmodellen zijn 'autoregressief': elk nieuw woord hangt af van alles wat ervoor kwam, inclusief de volledige chatgeschiedenis en geüploade bestanden. Het genereren van tekst verloopt in twee stappen. Eerst leest het model de hele vraag in één keer door en berekent het hoe elk woord zich verhoudt tot de rest, een bewerking die attention heet en de kern vormt van de transformer-architectuur. Daarna volgt de decodefase, waarin het model woord voor woord zijn antwoord opbouwt.

Techreuzen jagen op nieuwe chips

De explosieve vraag naar inferentie zorgt voor verrassende samenwerkingen. Amazon Web Services splitst het rekenwerk voor OpenAI-modellen op: de eigen Trainium-chips doen het rekenintensieve deel, terwijl de gigantische wafer-scale chips van Cerebras het geheugenintensieve deel voor hun rekening nemen. Nvidia kocht voor 20 miljard dollar sleuteltalent en technologie van chipstartup Groq, bekend van zijn snelle LPU-chips. En AI-lab Anthropic betaalt naar verluidt meer dan een miljard dollar per maand aan concurrent xAI om extra rekencapaciteit te huren.

Deze stappen laten zien dat de hardware-industrie zich moet aanpassen aan een heel andere vraag dan een paar jaar geleden werd verwacht. Niet de grootste trainingscluster, maar de chip die het snelst en goedkoopst antwoorden aflevert, bepaalt straks wie de AI-markt domineert.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Nu AI-modellen dagelijks door miljoenen mensen en autonome systemen worden gebruikt, verschuift de techindustrie haar aandacht en investeringen van het trainen van modellen naar het efficiënt laten draaien ervan. Dat drijft de vraag naar gespecialiseerde inferentiechips op en verklaart de miljardendeals tussen chipmakers en AI-bedrijven. Wie de snelste en zuinigste inferentiehardware bouwt, bepaalt mede hoe snel en goedkoop AI in het dagelijks leven doordringt.

AI-inferentie
Het daadwerkelijke gebruik van een al getraind AI-model om antwoorden, tekst of beelden te genereren.
Training
Het proces waarbij een AI-model leert door miljarden voorbeelden te bestuderen en zijn instellingen steeds bij te stellen.
Backpropagation
Het rekenproces tijdens training dat berekent hoe elke instelling van een model moet veranderen om betere voorspellingen te doen.
Transformer
De architectuur achter moderne taalmodellen, die met behulp van attention bepaalt welke woorden in een tekst het meest relevant voor elkaar zijn.
Redeneermodel
Een AI-model dat een vraag meerdere keren intern doorrekent voordat het een definitief antwoord geeft.
Chain of thought
De stapsgewijze redenering die een AI-model doorloopt voordat het een antwoord formuleert.
Autoregressief
Een model dat elk nieuw woord baseert op alle voorgaande woorden in de tekst.
Prefill
De fase waarin een AI-model een volledige vraag in één keer inleest en analyseert.
Decode
De fase waarin een AI-model, na het inlezen van de vraag, woord voor woord zijn antwoord opbouwt.
Wafer-scale chip
Een chip die bijna een hele siliciumschijf beslaat, ontworpen om enorme hoeveelheden data snel te verwerken.
LPU
Een gespecialiseerde chip, ontwikkeld door Groq, die is geoptimaliseerd om taalmodellen razendsnel antwoord te laten geven.
Agentic AI
AI-systemen die zelfstandig en doorlopend naar een doel toewerken, zonder telkens een nieuwe opdracht van een gebruiker nodig te hebben.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media