AI & computing › Neuromorfe & fotonische chips
Nvidia maakt AI-agents die volledig lokaal draaien sneller en simpeler
Op de techbeurs IFA in Berlijn presenteert chipmaker Nvidia samen met Microsoft en partners als Lenovo en Acer nieuwe software en hardware om AI-agents lokaal op de computer te laten draaien, in plaats van via de cloud. De nieuwe RTX Spark-pc's komen in oktober in de winkel en moeten lokale AI sneller, veiliger en toegankelijker maken voor een breder publiek.
Kunstmatige intelligentie draait meestal via de cloud: je stuurt een vraag naar een server van een techbedrijf en krijgt daar antwoord vandaan. Dat kost tijd, vereist een internetverbinding en betekent dat gevoelige data het huis verlaat. Nvidia wil daar verandering in brengen met een pakket aan aankondigingen op IFA, de grote consumentenelektronicabeurs in Berlijn. De kern: AI-agents die zelfstandig taken uitvoeren, moeten voortaan makkelijker en sneller op de eigen pc kunnen draaien.
Agents die zichzelf installeren
Tot nu toe was het lastig om een AI-agent lokaal aan de praat te krijgen: je moest zelf een model kiezen, een geschikte server installeren en instellingen finetunen. Drie populaire agent-apps maken daar nu korte metten mee. Hermes Agent van Nous Research krijgt een installatie in één klik die automatisch de juiste Nvidia-videokaart herkent en het beste model selecteert. Ook OpenClaw, met ruim 380.000 volgers op GitHub het grootste open-source AI-project ter wereld, krijgt een vereenvoudigde Windows-installatie. Zoekmachine Perplexity bracht vorige maand al Portable Computer uit, een agent die volledige taken lokaal uitvoert en alleen voor complexere vragen teruggrijpt op een van de vijftien clouddiensten — pas na uitdrukkelijke toestemming van de gebruiker.
Rekenkracht van je andere pc's benutten
Veel huishoudens hebben inmiddels meerdere computers, waarvan de rekenkracht grotendeels ongebruikt blijft. Nvidia lanceert daarom PAIR (Personal AI Router), een gratis programma dat AI-taken automatisch verdeelt over alle geschikte pc's in hetzelfde netwerk. Een agent kan een grote klus, zoals het opruimen van een volle mailbox, opsplitsen in kleinere deeltaken die tegelijk op verschillende apparaten draaien. Zo hoeft niet alles te wachten op één videokaart, terwijl je hoofdcomputer gewoon vrij blijft voor gamen of ander werk. PAIR werkt met bestaande software als Ollama en LM Studio en ondersteunt naast Nvidia-chips ook recente Apple-processoren.
Snellere modellen en nieuwe chips
Ook onder de motorkap wordt lokale AI sneller. Dankzij nieuwe optimalisaties in de gebruikte software levert een Nvidia RTX 5090-videokaart tot 1,9 keer meer rekensnelheid, terwijl serveronderdelen op de DGX Spark-computer tot 1,4 keer sneller worden. August was daarnaast een drukke maand voor open, lokaal te gebruiken taalmodellen: naast Nvidia's eigen Nemotron 3.5 Lightning verschenen onder meer Qwen3.8 en het Chinese GLM-5.3-Flash, een zogeheten mixture-of-experts-model dat alleen de nodige onderdelen van het netwerk activeert om sneller en zuiniger te werken. Het grootste model, DeepSeek v4 Flash, telt 284 miljard parameters maar gebruikt er dankzij die architectuur maar 13 miljard tegelijk. Om zulke modellen behapbaar te maken op gewone hardware, gebruikt Nvidia kwantisatie: getallen in het model worden met minder precisie opgeslagen, waardoor ze minder geheugen en rekenkracht vergen. De nieuwe RTX Spark-pc's van Lenovo en Acer, die in oktober verschijnen, moeten deze vorm van randcomputing naar een breder publiek brengen. Ook game-uitgevers als Electronic Arts, Embark en Ubisoft brengen titels naar het nieuwe platform.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Als AI-modellen steeds beter lokaal kunnen draaien, hoeven gebruikers minder te vertrouwen op clouddiensten van grote techbedrijven en blijft gevoelige data op het eigen apparaat. Dat maakt AI-agents sneller, goedkoper in gebruik en minder afhankelijk van een internetverbinding, wat vooral voor bedrijven met privacygevoelige data en voor consumenten met meerdere pc's thuis interessant is.
- AI-agent
- Een programma dat op basis van een taalmodel zelfstandig taken uitvoert, zoals mails sorteren of code controleren, zonder dat een mens elke stap hoeft te sturen.
- Mixture-of-experts (MoE)
- Een architectuur waarbij een AI-model is opgebouwd uit meerdere gespecialiseerde onderdelen, waarvan er per taak maar een deel wordt geactiveerd. Dat maakt grote modellen sneller en zuiniger.
- Kwantisatie
- Een techniek waarbij de getallen in een AI-model met minder precisie worden opgeslagen, zodat het model minder geheugen en rekenkracht nodig heeft.
- Randcomputing
- Het uitvoeren van berekeningen op het apparaat zelf in plaats van op een externe server, wat zorgt voor meer snelheid en privacy.
- NVFP4
- Een door Nvidia ontwikkeld getalformaat met lage precisie (4-bit), gebruikt om AI-modellen compacter te maken zodat ze op minder krachtige hardware passen.
- Diffusiedistillatie
- Een techniek waarbij een AI-model dat normaal veel rekenstappen nodig heeft om beeld of video te genereren, wordt teruggebracht tot een sneller model met veel minder stappen, met behoud van kwaliteit.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.