Transformer: de architectuur achter moderne AI-taalmodellen
Stel je een heel oplettende lezer voor die niet alleen elk woord in een zin leest, maar bij elk woord meteen doorheeft hoe dat woord zich verhoudt tot alle andere woorden in de tekst: welke woorden bij elkaar horen, wat het onderwerp is, en welke betekenis een woord krijgt door de context eromheen. Dat is in essentie wat een transformer doet. Het is een type kunstmatig-intelligentiemodel dat razendsnel de onderlinge relaties tussen alle delen van een stuk tekst, beeld, geluid of code berekent, en daardoor uitzonderlijk goed is in taal begrijpen en genereren.
De transformer is sinds 2017 de belangrijkste bouwsteen achter vrijwel alle grote taalmodellen, van Google Translate tot ChatGPT en Gemini. Waar oudere AI-modellen een tekst woord voor woord, van links naar rechts, moesten doorlopen, ongeveer zoals je met je vinger een zin volgt, kan een transformer alle woorden tegelijk bekijken en meteen zien hoe ze samenhangen. Die eigenschap maakt transformers niet alleen slimmer in het vastleggen van context, maar ook veel efficiënter te trainen op de enorme hoeveelheden tekst die nodig zijn om een taalmodel te bouwen.
Wat is het precies?
Een transformer is een neuraal netwerk: een wiskundig model, losjes geïnspireerd op hersenverbindingen, opgebouwd uit lagen die tekst stap voor stap verwerken. Voordat het model iets kan "lezen", wordt een zin eerst opgeknipt in kleine stukjes, tokens genoemd. Dat kunnen hele woorden zijn, maar vaak ook woorddelen zoals "ge" en "loof". Elk token wordt vervolgens omgezet in een lange lijst getallen, een embedding, die de betekenis van dat stukje tekst wiskundig vastlegt.
De kern van de transformer is een mechanisme dat self-attention heet, oftewel zelf-aandacht. Voor elk token berekent het model hoe sterk het verband houdt met elk ander token in de zin. In de zin "De bank stond aan de rivier" helpt attention het model bijvoorbeeld te bepalen dat "bank" hier waarschijnlijk een zitbank of oever betekent, en niet een geldbank, omdat het woord "rivier" verderop in de zin meeweegt.
Omdat dit voor alle tokens tegelijk gebeurt, in plaats van een voor een zoals bij de oudere recurrente netwerken (RNN's), kan een transformer op grote schaal parallel rekenen op moderne grafische chips (GPU's). Dat is een van de belangrijkste praktische doorbraken geweest: het maakte het haalbaar om modellen te trainen op miljarden zinnen binnen een redelijke tijd.
Een transformer bestaat meestal uit tientallen van dit soort attention-lagen, op elkaar gestapeld en afgewisseld met kleinere rekenlagen die de informatie verder verwerken. Grote taalmodellen zoals GPT-4 bevatten vele miljarden van dit soort interne, instelbare rekenwaarden (parameters) die tijdens de training geleidelijk worden bijgeslepen.
Wat wil men ermee bereiken?
Het doel achter de transformer was aanvankelijk vrij specifiek: betere automatische vertaling. De onderzoekers die de architectuur in 2017 introduceerden, wilden een model dat de context van een hele zin beter kon vasthouden dan de toenmalige technieken, die vooral moeite hadden met lange zinnen en woorden die ver uit elkaar stonden.
Al snel bleek de architectuur veel breder toepasbaar. Onderzoekers ontdekten dat dezelfde opzet, grote hoeveelheden tekst laten voorspellen welk woord waarschijnlijk volgt, leidde tot modellen die niet alleen vertalen, maar ook vragen beantwoorden, samenvatten, programmeren en redeneren over onderwerpen waarvoor ze nooit expliciet zijn getraind.
De bredere ambitie is tweeledig. Ten eerste: één architectuur bouwen die op vrijwel elk soort data toepasbaar is, van tekst en beeld tot geluid en eiwitstructuren, zodat kennis en rekenkracht hergebruikt kunnen worden. Ten tweede: door modellen steeds groter te maken en op steeds meer data te trainen, zien onderzoekers dat vaardigheden als redeneren en probleemoplossen soms als vanzelf lijken te ontstaan, zonder dat daar expliciet voor is geprogrammeerd. Dit verschijnsel, emergentie genoemd, is een belangrijke drijfveer achter de huidige investeringen in steeds grotere modellen, al is er onder wetenschappers discussie over hoe voorspelbaar en fundamenteel dat effect werkelijk is.
Voorbeelden uit de praktijk
- Google Translate schakelde vanaf 2020 geleidelijk over op transformer-gebaseerde modellen, wat merkbaar vloeiendere vertalingen opleverde, vooral bij lange zinnen.
- BERT (Google, 2018) was een van de eerste grote transformermodellen en wordt sindsdien gebruikt om de Google-zoekmachine beter te laten begrijpen wat gebruikers precies bedoelen met hun zoekopdracht.
- De GPT-reeks van OpenAI, van GPT-2 (2019) via GPT-3 (2020) tot GPT-4 (2023), bouwt volledig op de transformer-architectuur en vormt de basis van ChatGPT.
- AlphaFold 2 van DeepMind (2020) gebruikt attention-mechanismen, verwant aan die in transformers, om de driedimensionale vouwing van eiwitten te voorspellen. Dit werk droeg in 2024 bij aan de Nobelprijs voor de Scheikunde voor Demis Hassabis en John Jumper, samen met David Baker.
- Whisper, het spraakherkenningsmodel van OpenAI (2022), gebruikt eveneens een transformer om gesproken taal in tientallen talen om te zetten naar tekst.
Hoe ver is de techniek?
Voor tekst is de transformer inmiddels een volwassen, breed toegepaste technologie: vrijwel elk groot taalmodel dat vandaag in gebruik is, van Gemini (Google) tot Claude (Anthropic) tot Llama (Meta), is een variant op dezelfde basisarchitectuur uit 2017. De ontwikkeling gaat vooral verder via schaal (grotere modellen, meer trainingsdata) en via verfijningen zoals langere "contextvensters", waarmee een model meer tekst tegelijk kan verwerken en onthouden: van een paar duizend woorden in 2020 naar honderdduizenden woorden in de nieuwste modellen.
Toch zijn er duidelijke grenzen en obstakels. Het attention-mechanisme wordt rekenkundig zwaarder naarmate de tekst langer wordt: de benodigde rekenkracht groeit kwadratisch met de lengte, waardoor heel lange documenten nog steeds duur zijn om te verwerken. Onderzoekers werken aan alternatieven en aanvullingen, zoals zogeheten state space models (bijvoorbeeld het Mamba-model, 2023), die beloven efficiënter met lange tekst om te gaan. Deze alternatieven hebben de transformer echter nog niet verdrongen.
Een ander onopgelost probleem is "hallucinatie": transformer-gebaseerde taalmodellen produceren soms met volle overtuiging onjuiste informatie, omdat het model in essentie kansen op het volgende woord voorspelt in plaats van feiten uit een database op te zoeken. Ook het energieverbruik van het trainen en gebruiken van steeds grotere modellen is een groeiend punt van zorg. De techniek verspreidt zich intussen verder dan tekst alleen: beeldmodellen, video en multimodale systemen die tekst, beeld en geluid combineren, leunen inmiddels eveneens op transformer-onderdelen.
Wie werken eraan?
De transformer werd in 2017 geïntroduceerd door een team van Google-onderzoekers, in het inmiddels invloedrijke artikel "Attention Is All You Need". Google, met sinds 2023 het onderzoekslab DeepMind volledig binnen het bedrijf, blijft een van de grootste spelers, onder meer met de Gemini-modellen.
OpenAI, oorspronkelijk opgericht als non-profitorganisatie en sinds 2019 gedeeltelijk gesteund door Microsoft, bouwde de invloedrijke GPT-reeks en ChatGPT. Meta, het moederbedrijf van Facebook en Instagram, ontwikkelt de opensource Llama-modellen en publiceert relatief veel onderzoek in het open. Anthropic, opgericht door voormalige OpenAI-medewerkers, ontwikkelt de Claude-modellen met veel nadruk op veiligheid.
Daarnaast investeren grote Chinese techbedrijven zoals Baidu, Alibaba en Tencent fors in eigen transformer-gebaseerde modellen, mede aangejaagd door nationaal industriebeleid rond kunstmatige intelligentie. Universiteiten als Stanford, MIT en Oxford leveren fundamenteel onderzoek, vaak in samenwerking met de grote techbedrijven die de benodigde rekenkracht kunnen betalen. In Europa proberen initiatieven als het Franse Mistral AI en het Duitse Aleph Alpha een eigen positie te veroveren naast de Amerikaanse en Chinese dominantie, mede gesteund door de wens van de EU om niet volledig afhankelijk te zijn van buitenlandse AI-technologie.
Verder lezen
- arXiv — het preprint-archief waarop het originele transformer-onderzoek "Attention Is All You Need" werd gepubliceerd.
- Hugging Face — platform met open modellen, code en heldere technische uitleg over transformerarchitecturen.
- Google AI — onderzoekspagina van Google, waar de transformer werd ontwikkeld.
- OpenAI — ontwikkelaar van de GPT-modellen en ChatGPT, met achtergrondinformatie over de gebruikte technieken.