AI & computing › Generatieve AI & synthetische media
Gemini zoekt zelf naar relevante scènes in video en bespaart tot 88% tokens
Google laat zijn Gemini Flash-modellen voortaan zelf bepalen welke delen van een video de moeite waard zijn om te bekijken, in plaats van elke seconde beeld te scannen. Dat scheelt tot 88 procent aan rekenkosten en maakt het zoeken naar specifieke momenten in uren aan beeldmateriaal een stuk nauwkeuriger.
Google rolt een nieuwe manier van video-analyse uit voor de nieuwste Gemini Flash-modellen: Gemini 3.7 Flash, 3.6 Flash en 3.5 Flash-Lite. In plaats van een video standaard met één beeld per seconde te doorlopen, laat het bedrijf het model zelf beslissen welke fragmenten relevant zijn. Dat gebeurt via agentic AI: het model redeneert over de vraag die gesteld wordt en gaat vervolgens gericht op zoek in het beeldmateriaal, in plaats van blindelings alles te verwerken.
Van vast frame-tempo naar gericht zoeken
Tot voor kort werkte Gemini bij video's met een vaste bemonsteringsfrequentie: elke seconde werd een los beeld geanalyseerd, aangevuld met een transcriptie van de audio. Dat werkt, maar is inefficiënt bij lange video's van tien minuten tot enkele uren. Elk beeld kost namelijk rekenkracht, uitgedrukt in tokens, de rekeneenheden waarmee AI-modellen tekst, beeld en geluid verwerken. Bij lange opnames liep dat aantal snel op, waardoor ontwikkelaars moesten kiezen tussen hoge kosten of het overslaan van belangrijke details.
De nieuwe aanpak keert dat om. Het model doorzoekt de video actief, in een lus van redeneren, een fragment ophalen en het resultaat beoordelen. Het kan daarbij zelf kiezen of het naar losse beelden kijkt, naar de audio luistert of de transcriptie raadpleegt, en past de snelheid aan waarmee het beeld bekijkt. Verdachte momenten worden opnieuw en preciezer bekeken, waardoor het model ook veranderingen van minder dan een seconde kan opmerken, zoals een harde cut of een plotselinge statuswijziging in beeld.
Minder kosten, hogere nauwkeurigheid
Op interne testen van Google, waaronder de benchmarks 1H-VideoQA en LVBench, daalt het tokengebruik met tot 88 procent, terwijl de nauwkeurigheid van de antwoorden juist licht toeneemt. Google zegt dat de kosten voor ontwikkelaars daarmee tot 66 procent kunnen dalen. De techniek bouwt voort op 'agentic vision', een functie die het bedrijf in januari introduceerde voor los beeldmateriaal. Daarbij kon een multimodaal AI-model al zelfstandig inzoomen, bijsnijden en beeld annoteren voordat het een antwoord gaf.
De functie is vanaf nu beschikbaar via de Gemini API, zowel voor geüploade video's als YouTube-video's, in Google AI Studio en op het Gemini Enterprise Agent Platform. Ontwikkelaars zetten simpelweg de verwerkingsmodus op 'agentic' en betalen de gebruikelijke tarieven per token, zonder toeslag. Google kondigt aan de techniek ook naar consumentenproducten te brengen: gebruikers van de Gemini-app met Flash-modellen krijgen de functie binnenkort, en de komende maanden moet ze ook de 'Ask YouTube'-functie op het afspeelscherm van YouTube slimmer maken, zodat antwoorden beter aansluiten bij wat daadwerkelijk in de video te zien is.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Doordat AI-modellen video's straks slimmer en goedkoper kunnen doorzoeken, wordt het praktisch haalbaar om uren aan beeldmateriaal — van bewakingscamera's tot lange lezingen — razendsnel doorzoekbaar te maken. Dat opent de deur voor toepassingen als automatische videomontage, contentmoderatie en het snel terugvinden van specifieke momenten in enorme video-archieven, zonder dat de rekenkosten uit de hand lopen.
- Agentic AI
- Een vorm van kunstmatige intelligentie die zelfstandig beslissingen neemt over welke stappen nodig zijn om een taak te volbrengen, in plaats van een vast script te volgen.
- AI-token
- De kleine eenheden waarin AI-modellen tekst, beeld of geluid verwerken; hoe meer tokens nodig zijn, hoe hoger de rekenkosten.
- Benchmark
- Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen onderling vergelijkbaar worden gemaakt.
- Multimodaal AI-model
- Een AI-model dat meerdere soorten input tegelijk kan verwerken, zoals tekst, beeld, audio en video.
- Framesampling
- De techniek waarbij een video wordt geanalyseerd door op vaste tijdsintervallen losse beelden uit de video te halen.
- Denk-handel-observeer-lus
- Een werkwijze waarbij een AI-model afwisselend redeneert over een taak, een actie uitvoert en het resultaat daarvan beoordeelt voordat het de volgende stap zet.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.