AI & computing › AI-gestuurde wetenschappelijke ontdekkingen

Meta lanceert spraakmodel voor AI-assistenten die altijd meeluisteren

· Bijgewerkt 6 september 2026, 12:14 · 2 min leestijd

AI-gestuurde wetenschappelijke ontdekkingen
Beeld: The Decoder

Meta heeft een nieuw AI-model gelanceerd dat spraak in real time omzet naar tekst, sprekers uit elkaar houdt en zinsgrenzen herkent. Muse Voice Transcribe is volgens onafhankelijke tests nauwkeuriger en sneller dan modellen van OpenAI en ElevenLabs, en kost een fractie van de prijs. Het model moet de basis vormen voor AI-assistenten die continu meeluisteren, bijvoorbeeld via Meta's slimme brillen.

Meta heeft een nieuw AI-model gelanceerd dat spraak in real time omzet naar tekst, sprekers uit elkaar houdt en automatisch zinsgrenzen herkent. Muse Voice Transcribe is volgens het bedrijf sneller en nauwkeuriger dan modellen van concurrenten als OpenAI en ElevenLabs, en kost een fractie van de prijs. Het model moet de basis vormen voor AI-assistenten die continu meeluisteren, bijvoorbeeld via Meta's slimme brillen.

Sneller door slim te wachten

Muse Voice Transcribe, ontwikkeld door Meta's Superintelligence Labs, hakt binnenkomende audio op in stukjes van 80 milliseconden. Na elk stukje beslist het model of het nog even doorluistert of het volgende woord al opschrijft bij de omzetting van spraak naar tekst. Meer wachten levert een preciezere transcriptie op, maar zorgt ook voor vertraging. Meta traint dit gedrag met reinforcement learning: het model wordt beloond voor zowel een laag foutpercentage als een korte reactietijd, en past de wachttijd per woord aan op basis van hoe lastig dat woord is. Simpele woorden worden meteen uitgetypt, moeilijke woorden krijgen meer bedenktijd.

Onafhankelijke tests van Artificial Analysis, uitgevoerd op 1 september 2026, bevestigen de claims van Meta. Op Engelstalige audio haalt het model een woordfoutpercentage van 3,1 procent, met een vertraging van 0,16 seconden nadat een spreker is uitgesproken. Concurrenten als ElevenLabs Scribe v2 Realtime (3,6 procent, 0,14 seconden) en AssemblyAI Universal-3.5 Pro Realtime (4,0 procent) scoren net iets lager op nauwkeurigheid of net iets sneller.

Meerdere sprekers en talen tegelijk

Het model doet meer dan alleen transcriberen. Met sprekersdiarisatie markeert het in dezelfde tekststroom wanneer een andere spreker aan het woord is en geeft het elke spreker een letter van A tot Z mee, tot ruim twintig personen tegelijk. Ook ziet het model zelf waar een zin begint en eindigt, zonder dat daar een apart systeem voor nodig is; alle taken zijn samen getraind. In een demonstratie met acht mensen in één ruimte wist het model volgens Meta live bij te houden wie wat zei, ook bij opnames van meer dan een uur.

Muse Voice Transcribe is getraind op meer dan zeventig talen, waarvan er 25 uitgebreid zijn getest. Het model kan ook omgaan met code-switching, het verschijnsel waarbij sprekers halverwege een zin van taal wisselen. Extra context, zoals eigennamen, kan de nauwkeurigheid verder verbeteren.

Fors goedkoper dan de concurrentie

Meta rekent 0,18 dollar per uur audio, omgerekend 3 dollar per duizend minuten. Dat is aanzienlijk minder dan Cartesia Ink-2 (4 dollar) en ElevenLabs en Deepgram Flux (beide 6,50 dollar). Meta kiest daarmee opnieuw voor een lage prijs in plaats van de hoogste score, een strategie die het bedrijf ook al volgde bij eerdere Muse Spark-modellen. Het model is nu beschikbaar in Meta AI, in de programmeertool Muse Code en via de Meta Model API; gebruikers activeren spraakinvoer door de Fn-toets ingedrukt te houden.

Meta maakt niet bekend hoeveel parameters het model heeft of met welke data het is getraind, en de modelgewichten worden niet vrijgegeven. De release past in de strategie van Meta's Superintelligence Labs, die sinds de zomer van 2025 toponderzoekers wegkaapt bij OpenAI, Google DeepMind en Apple met beloningspakketten tot 300 miljoen dollar over vier jaar. Meta koppelt de lancering expliciet aan het idee van persoonlijke AI-assistenten die meeluisteren via slimme brillen, een toepassing die in Duitsland recent nog ter discussie stond voordat de toezichthouder besloot geen verbod op te leggen.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Realtime spraakherkenning die sprekers uit elkaar houdt en tegelijk goedkoop is, maakt continu luisterende AI-assistenten praktisch haalbaar, bijvoorbeeld in slimme brillen of vergaderapps. Dat opent nieuwe toepassingen, maar roept ook vragen op over privacy als apparaten voortdurend meeluisteren.

Muse Voice Transcribe
Het realtime spraak-naar-tekstmodel van Meta dat transcriptie, sprekersherkenning en zinsdetectie combineert.
Reinforcement learning
Een trainingsmethode waarbij een AI-model wordt beloond voor gewenst gedrag, in dit geval een lage foutmarge in combinatie met korte vertraging.
Woordfoutpercentage (WER)
Het percentage woorden dat een spraakherkenningsmodel verkeerd overneemt; hoe lager, hoe nauwkeuriger.
Sprekersdiarisatie
De techniek waarmee software bepaalt welke spreker op welk moment aan het woord is in een opname.
Code-switching
Het verschijnsel waarbij een spreker binnen één gesprek of zelfs één zin wisselt tussen twee talen.
Latentie
De tijd die verstrijkt tussen een gesproken woord en het moment waarop het systeem daar tekst van teruggeeft.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over AI-gestuurde wetenschappelijke ontdekkingen