Ga naar inhoud
  • Drifter
    Drifter

    Google zet vol in op realtime AI met Gemini 3.8 Live: praten, kijken, redeneren en handelen tegelijk

    Google breidt de Gemini-familie uit met twee nieuwe modellen die specifiek zijn ontworpen voor realtime spraakinteractie: Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking. Met deze modellen probeert Google een van de lastigste problemen van moderne AI op te lossen: hoe combineer je natuurlijke, vrijwel directe gesprekken met complexe redenering en het uitvoeren van taken op de achtergrond?

    De nieuwe modellen zijn vanaf september 2026 beschikbaar via de Gemini API en Google AI Studio. Daarnaast worden de mogelijkheden stapsgewijs geïntegreerd in verschillende Google-producten en zakelijke toepassingen.

    De belangrijkste vernieuwing zit niet alleen in de kwaliteit van de stem. Google probeert van spraak een volwaardige interface voor agentische AI te maken. De gebruiker kan praten, terwijl het model ondertussen informatie verwerkt, visuele input interpreteert, tools aanroept en acties uitvoert. Het gesprek hoeft daarbij niet telkens stil te vallen zodra de AI meer tijd nodig heeft om na te denken.

    Dat onderscheidt Gemini 3.8 Live van een traditionele spraakassistent, waarbij de interactie vaak neerkomt op: vraag stellen, wachten, antwoord krijgen. Google wil naar een model waarbij praten en handelen veel meer gelijktijdig plaatsvinden.

    Twee modellen voor twee verschillende situaties

    Google positioneert de twee modellen nadrukkelijk verschillend.

    Gemini 3.8 Live is gericht op snelle gesprekken, schaalbaarheid en kostenefficiëntie. Het model moet geschikt zijn voor toepassingen waarbij gebruikers voortdurend met een AI-agent communiceren en waarbij een lage vertraging belangrijker is dan maximale redeneercapaciteit.

    Gemini 3.8 Live Extended Thinking is bedoeld voor complexere opdrachten. Dit model kan langer nadenken voordat het tot een oplossing komt, terwijl het gesprek met de gebruiker doorgaat. Daarmee probeert Google de klassieke tegenstelling tussen snelheid en redeneervermogen gedeeltelijk weg te nemen.

    Beide modellen zijn onderdeel van Gemini 3.8 en zijn gebaseerd op Gemini 3 Pro. Het gaat dus niet om twee volledig losstaande modelarchitecturen, maar om gespecialiseerde audio- en realtimevarianten die voortbouwen op de bredere Gemini-generatie.

    De modellen accepteren audio, afbeeldingen, video en tekst als input. Het contextvenster bedraagt maximaal 128.000 tokens, terwijl de modellen maximaal 64.000 tokens aan output kunnen produceren.

    Praten terwijl de AI aan het werk is

    Het interessantste onderdeel van Gemini 3.8 Live is de manier waarop Google omgaat met de wachttijd die normaal ontstaat wanneer een AI een ingewikkelde taak uitvoert.

    Bij traditionele voice-AI is het probleem duidelijk: zodra het systeem een complexe opdracht moet uitvoeren, ontstaat er een stilte. Voor een tekstmodel is dat nauwelijks een probleem. Bij spraak voelt een stilte van enkele seconden echter al snel alsof de verbinding is verbroken of de assistent niet meer reageert.

    Google probeert dat probleem op te lossen door het model tijdens het uitvoeren van een taak te laten blijven communiceren.

    Een gebruiker kan bijvoorbeeld een opdracht geven waarvoor meerdere stappen nodig zijn. Het model kan de opdracht bevestigen, aangeven dat het iets controleert en vervolgens verdergaan met het gesprek terwijl de daadwerkelijke verwerking op de achtergrond plaatsvindt.

    Daarmee verandert de interactie fundamenteel. De AI hoeft niet meer te wachten tot de volledige taak is afgerond voordat er opnieuw gesproken kan worden.

    Het idee lijkt op de manier waarop een menselijke assistent zou kunnen werken: je geeft een opdracht, de assistent begint eraan en blijft ondertussen beschikbaar voor aanvullende vragen.

    Extended Thinking maakt redeneren hoorbaar

    Bij Gemini 3.8 Live Extended Thinking gaat Google nog een stap verder.

    Het model is ontworpen voor taken waarbij meerdere redeneerstappen nodig zijn. In plaats van iedere vorm van extra verwerking achter de schermen te verbergen, kan het model tijdens het proces verbaal laten merken dat het nog bezig is.

    Zinnen in de trant van "Laat me dat even controleren" of een korte voortgangsreactie zijn daarbij niet alleen een cosmetische toevoeging. Ze moeten voorkomen dat langere redeneermomenten aanvoelen als een onderbroken gesprek.

    Dat is vooral belangrijk voor agentische toepassingen. Een AI-agent die bijvoorbeeld gegevens moet verzamelen, een tool moet gebruiken en vervolgens een beslissing moet voorbereiden, kan tijdens dat proces in contact blijven met de gebruiker.

    Het uiteindelijke doel is een AI die niet alleen antwoord geeft, maar daadwerkelijk als gesprekspartner en uitvoerende agent kan functioneren.

    Sterke benchmarkresultaten voor de spraakmodellen

    Google presenteert indrukwekkende resultaten voor Gemini 3.8 Live Extended Thinking op verschillende gespecialiseerde spraak- en audiobenchmarks.

    Op de Speech to Speech Quality Index van Artificial Analysis behaalde het model een score van 82,6, waarmee het volgens de gepubliceerde vergelijking bovenaan staat.

    Op τ-Voice, een benchmark gericht op het uitvoeren van agentische taken via spraak, behaalde Gemini 3.8 Live Extended Thinking 68,6 procent.

    Op Sierra's τ-Voice-banking benchmark kwam het model uit op 35,1 procent.

    Daarnaast behaalde het model 97,7 procent op Big Bench Audio, een benchmark die onder meer het redeneren met audiogegevens test.

    Deze cijfers moeten wel op de juiste manier worden gelezen. Het zijn gespecialiseerde audio- en voice-agentmetingen en geen algemene intelligentiescore voor Gemini. Bovendien zijn niet alle cijfers rechtstreeks afkomstig van exact dezelfde testconfiguratie. De prestaties laten dus vooral zien dat Google sterk inzet op het specifieke domein van realtime spraak, redeneren en agentische interactie.

    Het reguliere Gemini 3.8 Live richt zich juist meer op snelheid, vloeiende interactie en schaalbaarheid. Google meldt voor dit model onder meer een tweede plaats in de Speech Agent Arena, waar gebruikersvoorkeur een belangrijke rol speelt.

    Visuele informatie vrijwel realtime verwerken

    Gemini 3.8 Live is bovendien niet beperkt tot audio.

    Het model kan ook visuele input verwerken, waaronder afbeeldingen en video. Daardoor kan een gebruiker bijvoorbeeld met de camera iets laten zien en er tegelijkertijd mondeling vragen over stellen.

    Dat opent de deur naar toepassingen waarbij spraak en beeld voortdurend samenkomen.

    Een gebruiker kan bijvoorbeeld een scherm, document, object of andere visuele situatie tonen en vervolgens mondeling instructies geven. Het model kan de visuele context gebruiken om de conversatie te sturen, in plaats van eerst een foto te moeten uploaden en daarna een afzonderlijke tekstvraag te stellen.

    Juist die combinatie van multimodaliteit en lage latency is belangrijk voor toekomstige AI-agents. De AI krijgt daardoor niet alleen te horen wat de gebruiker zegt, maar kan ook zien waar de gebruiker naar verwijst.

    Automatisch schakelen tussen 97 talen

    Een andere opvallende mogelijkheid is de ondersteuning van 97 talen, waarbij het model tijdens een gesprek automatisch tussen talen kan schakelen.

    Dat betekent dat een gesprek niet noodzakelijk volledig in één taal hoeft plaats te vinden. Een gebruiker kan bijvoorbeeld van taal wisselen en het model kan die verandering tijdens de interactie volgen.

    Voor internationale toepassingen kan dat interessant zijn. Een voice-agent hoeft daardoor minder strikt aan één taal per sessie gebonden te zijn.

    Voor bedrijven die dezelfde AI-agent in meerdere markten willen inzetten, kan dit bovendien de technische complexiteit van afzonderlijke taalmodellen of afzonderlijke gesprekssystemen verminderen.

    Tools en API's draaien op de achtergrond

    De grootste stap richting agentische AI zit misschien wel in de manier waarop Gemini 3.8 Live met tools en API's omgaat.

    Het model kan tijdens een gesprek externe functies aanroepen terwijl de conversatie doorgaat. Daardoor hoeft de gebruiker niet noodzakelijk te wachten totdat iedere toolcall volledig is afgerond.

    Dit maakt toepassingen mogelijk waarbij de AI niet alleen informatie verstrekt, maar daadwerkelijk processen uitvoert.

    Denk bijvoorbeeld aan een agent die informatie verzamelt, een systeem raadpleegt, een workflow start of gegevens uit een applicatie verwerkt. De gebruiker kan ondertussen blijven praten en aanvullende instructies geven.

    Daarmee verschuift de rol van voice-AI van een eenvoudige vraag-en-antwoordinterface naar een interface voor agentische workflows.

    Van chatbot naar realtime agent

    Dat is uiteindelijk waar de belangrijkste ontwikkeling zit.

    De afgelopen jaren lag de nadruk bij spraakmodellen vooral op natuurlijk klinkende stemmen, goede transcriptie en lage vertraging. Met Gemini 3.8 Live probeert Google daar een nieuwe laag aan toe te voegen: actie.

    Een moderne voice-agent moet volgens die visie drie dingen tegelijkertijd kunnen:

    1. begrijpen wat de gebruiker zegt;
    2. intelligent redeneren over de opdracht;
    3. daadwerkelijk iets uitvoeren.

    Daar komt vervolgens een vierde vereiste bij: de gebruiker mag tijdens dat proces niet het gevoel krijgen dat de AI is gestopt met reageren.

    Gemini 3.8 Live is daarom minder interessant als simpelweg "een model dat beter kan praten" en vooral interessant als infrastructuur voor realtime agenten.

    Google bouwt een breed ecosysteem rond Live

    De Live API wordt inmiddels ondersteund door verschillende technologieplatformen en ontwikkeltools, waaronder Agora, LangChain, LiveKit, Pipecat en Vercel.

    Ook bedrijven als Salesforce, Genspark en Lumeris testen de technologie.

    Dat is belangrijk omdat de kwaliteit van een voice-agent niet uitsluitend wordt bepaald door het onderliggende model. Ontwikkelaars hebben daarnaast infrastructuur nodig voor realtime audio, onderbrekingen, toolcalls, sessiebeheer, authenticatie en integratie met bestaande bedrijfssoftware.

    Google probeert daarom niet alleen een model uit te brengen, maar ook een ecosysteem waarin ontwikkelaars relatief eenvoudig commerciële voice-agents kunnen bouwen.

    Beschikbaarheid binnen Google-producten

    De technologie blijft bovendien niet beperkt tot de API.

    Gemini 3.8 Live wordt ingezet voor realtime ervaringen zoals Search Live, terwijl Gemini 3.8 Live Extended Thinking naar verschillende Google-producten komt.

    Google brengt Extended Thinking onder meer naar Gemini Live, Gmail, Docs en Keep, waarbij de exacte beschikbaarheid afhankelijk is van het product en het type Google AI-abonnement.

    Voor zakelijke toepassingen is Gemini 3.8 Live inmiddels in private preview beschikbaar binnen Gemini Enterprise. Verdere beschikbaarheid voor zakelijke en customer-experience-toepassingen wordt stapsgewijs uitgebreid.

    Dat past bij Google's bredere strategie: dezelfde modeltechnologie moet zowel via API's voor ontwikkelaars als rechtstreeks binnen Google's eigen productecosysteem beschikbaar zijn.

    SynthID moet duidelijk maken dat audio door AI is gegenereerd

    Google koppelt de nieuwe audiofunctionaliteit bovendien aan SynthID.

    Door gegenereerde audio van een onzichtbaar watermerk te voorzien, wil Google het in principe mogelijk maken om later vast te stellen dat bepaalde audio door een AI-systeem is gegenereerd.

    Dat is relevant nu realtime stemmodellen steeds overtuigender worden. Naarmate synthetische stemmen natuurlijker klinken, wordt het moeilijker om alleen op basis van het geluid te bepalen of iemand daadwerkelijk spreekt of dat een model de stem genereert.

    Een watermerk lost dat probleem niet volledig op, maar kan wel een aanvullende technische methode bieden om AI-gegenereerde media te identificeren.

    Google kiest opnieuw voor snelheid en schaal

    De release van Gemini 3.8 Live past in een bredere beweging binnen Google's modelstrategie.

    Begin september introduceerde Google al Gemini 3.8 Flash en Gemini 3.8 Flash Cyber. Flash is daarbij nadrukkelijk gericht op een combinatie van intelligentie, snelheid en lage kosten.

    Met 3.8 Live trekt Google dat uitgangspunt door naar spraak.

    Dat is geen onlogische strategie. Voor voice-agents is snelheid immers niet slechts een prijsvoordeel. Latency bepaalt rechtstreeks hoe natuurlijk een gesprek aanvoelt.

    Een model dat theoretisch beter kan redeneren maar meerdere seconden stilvalt, kan in een telefoongesprek minder prettig werken dan een iets eenvoudiger model dat vrijwel onmiddellijk reageert.

    Google probeert daarom niet alleen de maximale intelligentie te verhogen, maar vooral de verhouding tussen intelligentie, snelheid, kosten en interactiekwaliteit te verbeteren.

    Betekent dit dat Google afstand neemt van algemene frontier-modellen?

    De introductie van 3.8 Live betekent niet automatisch dat Google zijn ambities op het gebied van algemene AI heeft opgegeven.

    Integendeel: de nieuwe audiomodellen zijn gebaseerd op Gemini 3 Pro en maken deel uit van dezelfde bredere Gemini-modelgeneratie.

    Wel valt op dat Google in korte tijd meerdere varianten heeft uitgebracht die sterk gericht zijn op specifieke gebruikssituaties. Met Gemini 3.8 Flash ligt de nadruk op snelle algemene taken, coding en agentische workflows. Met 3.8 Live ligt de nadruk op realtime multimodale communicatie en voice agents.

    Dat wijst op een strategie waarin Google niet uitsluitend probeert één model te bouwen dat voor iedere denkbare toepassing de beste is. In plaats daarvan worden verschillende varianten geoptimaliseerd voor verschillende omstandigheden.

    Voor ontwikkelaars kan dat uiteindelijk belangrijker zijn dan één algemene ranglijstpositie. In de praktijk draait een AI-product immers om kosten per interactie, responstijd, betrouwbaarheid, toolgebruik, contextverwerking en gebruikerservaring.

    De grote vraag blijft de algemene modelcompetitie

    Daarmee blijft echter een bredere vraag bestaan: hoe verhoudt Google's Gemini-familie zich tot de andere grote AI-aanbieders wanneer het niet specifiek om realtime spraak gaat?

    De nieuwe voice-modellen leveren overtuigende resultaten op hun eigen terrein. Dat betekent echter niet automatisch dat Gemini 3.8 Live Extended Thinking daarmee ook het beste algemene taalmodel is.

    Voice benchmarks, multimodale benchmarks, codingtests en algemene reasoningbenchmarks meten verschillende eigenschappen.

    Het zou daarom onjuist zijn om de sterke resultaten van 3.8 Live zonder meer te vertalen naar een algemene overwinning van Gemini op alle concurrerende modellen.

    Wat de release wel duidelijk maakt, is dat Google een terrein heeft geïdentificeerd waarop verschillende modelcapaciteiten samenkomen: spraak, multimodaliteit, reasoning en agentische uitvoering.

    Van praten naar samenwerken

    Daarmee verandert ook het concept van een AI-assistent. Een klassieke chatbot wacht op een prompt en geeft vervolgens een antwoord. Een traditionele voice-assistent luistert, verwerkt de opdracht en reageert.

    De nieuwe generatie voice-agents probeert iets anders te doen: samenwerken met de gebruiker terwijl de taak wordt uitgevoerd.

    De gebruiker praat. De AI luistert. Het model redeneert. Een tool wordt aangeroepen. De gebruiker stelt ondertussen een vervolgvraag. Het model verwerkt nieuwe informatie. Vervolgens wordt de oorspronkelijke taak hervat.

    Als dat betrouwbaar werkt, wordt spraak niet langer alleen een alternatieve manier om een chatbot te bedienen. Het wordt een interface waarmee mensen voortdurend met een AI-agent kunnen samenwerken.

    Dat is waarschijnlijk de belangrijkste betekenis van Gemini 3.8 Live.

    Google probeert met deze release niet simpelweg een AI te maken die natuurlijker klinkt. Het bedrijf probeert een AI te bouwen die kan luisteren, kijken, nadenken en handelen terwijl het gesprek doorgaatEn juist die combinatie kan bepalend worden voor de volgende fase van AI-assistenten.

    Door: Drifter




    Feedback Gebruiker

    Aanbevolen Reacties

    Er zijn geen reacties om weer te geven.



    Log in om te reageren

    Je kunt een reactie achterlaten na het inloggen



    Login met de gegevens die u gebruikt bij softtrack

×
×
  • Nieuwe aanmaken...