Terug naar Nieuws
ProductAI Understanding-briefing

Google introduceert Gemini 3.8 Live en Extended Thinking-modellen

Google DeepMind heeft Gemini 3.8 Live en 3.8 Live Extended Thinking gelanceerd, nieuwe live dialoogmodellen ontworpen voor vrijwel realtime redeneren, stemagenten en complexe taakuitvoering in de Google-werkruimte en zoeken.

5 min readRead the primary source
Source-provided image accompanying Google introduces Gemini 3.8 Live and Extended Thinking models
Primair brondocumentBron opgenomen
Uitgever
deepmind.google
Bronlink
deepmind.googlehttps://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking/
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

API (Applicatieprogrammeringsinterface)
Een gestructureerde manier waarop het ene softwaresysteem verzoeken kan verzenden naar en antwoorden kan ontvangen van een ander systeem.
Watermerken
Het inbedden van een detecteerbaar signaal in door AI gegenereerde tekst of media, zodat het later kan worden geïdentificeerd als machinaal geproduceerd.
Benchmark
Een gestandaardiseerde test of dataset die wordt gebruikt om de prestaties van modellen te meten en te vergelijken.
Test jezelfAI-agentenquiz

Wat is er gebeurd

Google DeepMind heeft de release aangekondigd van twee nieuwe AI-modellen: Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking. Deze modellen zijn ontworpen voor live dialoog, met vrijwel realtime redeneermogelijkheden die gelijktijdig spreken en redeneren mogelijk maken. De aankondiging benadrukt verbeteringen op het gebied van intelligentie, parallel redeneren en de mogelijkheid om tools en API-aanroepen op de achtergrond uit te voeren terwijl de gespreksstroom behouden blijft. De modellen zijn beschikbaar via de Gemini Live API voor ontwikkelaars en zijn geïntegreerd in de Gemini-app, Google Workspace en Search.

Google DeepMind introduceerde Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking en beschrijft ze als de meest geavanceerde live dialoogmodellen van het bedrijf. De belangrijkste innovatie is het vermogen om bijna realtime te redeneren, waardoor de modellen complexe taken kunnen verwerken terwijl een ononderbroken gespreksstroom behouden blijft. Dit wordt bereikt door middel van parallel redeneren, waarbij het model verzoeken kan bevestigen met verbale signalen als 'Laat me eens controleren of...' en live voortgangsverslagen kan geven voor achtergrondtaken die uit meerdere stappen bestaan.

De modellen zijn ontworpen om tools en API-aanroepen op de achtergrond uit te voeren terwijl het gesprek wordt voortgezet. Deze mogelijkheid is bedoeld om stemagenten betrouwbaarder en productiegereed te maken voor ontwikkelaars en ondernemingen. Gemini 3.8 Live verwerkt visuele invoer bijna in realtime en detecteert en schakelt automatisch tussen 97 ondersteunde talen tijdens een gesprek. De Extended Thinking-variant is gepositioneerd voor het voltooien van taken op bedrijfsniveau en biedt diepere redeneringsmogelijkheden voor complexe workflows.

Volgens de bron behaalde Gemini 3.8 Live Extended Thinking de nummer 1 algemene plek op de Speech to Speech Quality Index van Artificial Analysis met een score van 82,6. Het loopt ook voorop bij het voltooien van agentische taken met 68,6% op τ-Voice en 35,1% op Sierra's τ-Voice-banking , en scoorde 97,7% op Big Bench Audio. Gemini 3.8 Live behaalde de tweede plaats in de Speech Agent Arena. De bron merkt op dat deze modellen de Pareto-grens verleggen voor complexe workflows op de EVA-Bench van ServiceNow door nauwkeurigheid in evenwicht te brengen met gesprekskwaliteit.

De modellen zijn toegankelijk via de Gemini Live API, met ondersteuning van ontwikkelaarsplatforms zoals Agora, Fishjam, LiveKit, Pipecat, Vercel en Vision Agents. Deze platforms beheren de realtime infrastructuur voor mediastreaming, waardoor ontwikkelaars zich kunnen concentreren op de gebruikerservaring. Google kondigde ook partnerschappen aan met bedrijven als Salesforce, Genspark en Lumeris, die de modellen gebruiken vanwege hun latentie, vloeiendheid en mogelijkheden voor het aanroepen van tools. Alle audio die door deze modellen wordt gegenereerd, is voorzien van een watermerk met SynthID om detecteerbaarheid te garanderen en verkeerde informatie te voorkomen.

Brongegevens: deepmind.google ↗

Waarom het ertoe doet

Deze release vertegenwoordigt een aanzienlijke vooruitgang in spraakgebaseerde AI-interactie, die verder gaat dan eenvoudige chat en complexe, agentische taakvoltooiing. Door modellen in staat te stellen tegelijkertijd te redeneren en te spreken, pakt Google een belangrijke beperking in de huidige spraakinterfaces aan, waardoor AI intuïtiever wordt voor het verwerken van meerstapsworkflows. De integratie met bedrijfsplatforms zoals Salesforce en ontwikkelaarstools zoals LiveKit en Vercel suggereert een impuls in de richting van productieklare stemagenten. Deze ontwikkeling is van cruciaal belang voor de evolutie van AI van passieve assistenten naar actieve medewerkers in professionele en persoonlijke contexten, waardoor de manier waarop gebruikers omgaan met complexe softwaresystemen mogelijk wordt hervormd via natuurlijke taal.

De introductie van gelijktijdig redeneren en spreken pakt een fundamenteel knelpunt in stem-AI aan, waarbij modellen doorgaans even pauzeren om na te denken voordat ze reageren. Door de gespreksstroom tijdens de uitvoering van complexe taken in stand te houden, zorgen deze modellen ervoor dat AI-interacties natuurlijker en minder robotachtig aanvoelen. Dit is vooral belangrijk voor bedrijfstoepassingen waarbij gebruikers mogelijk meerdere taken of workflows moeten beheren via spraakopdrachten zonder context of momentum te verliezen.

De nadruk op 'productieklare' stemagenten signaleert een verschuiving van experimentele AI-demo's naar praktische, schaalbare oplossingen. De integratie met gevestigde ontwikkelaarsplatforms en zakelijke partners zoals Salesforce suggereert dat Google deze modellen positioneert als kerninfrastructuur voor de volgende generatie spraakgestuurde software. Dit zou de adoptie van spraakinterfaces kunnen versnellen in sectoren waar handsfree bediening van cruciaal belang is, zoals de logistiek, de gezondheidszorg en de buitendienst.

De hoge benchmarkscores, vooral bij het voltooien van taken door agenten, geven aan dat deze modellen niet alleen beter zijn in chatten, maar ook aanzienlijk beter in staat zijn om complexe, uit meerdere stappen bestaande taken uit te voeren. Dit is een belangrijke onderscheidende factor in de AI-markt, waar het vermogen om taken op betrouwbare wijze uit te voeren vaak waardevoller is dan de vloeiende gespreksvaardigheid. De in de bron genoemde kosteneffectiviteit suggereert ook dat Google ernaar streeft deze geavanceerde mogelijkheden toegankelijk te maken voor een breder scala aan ontwikkelaars en ondernemingen, en niet alleen voor grote technologiebedrijven.

De opname van SynthID-watermerken in alle gegenereerde audio is een opmerkelijke veiligheidsmaatregel. Naarmate stem-AI steeds vaker voorkomt, neemt het risico op deepfakes en desinformatie toe. Door een onmerkbaar watermerk in te bedden, probeert Google een technische standaard te creëren voor het verifiëren van door AI gegenereerde audio, wat bredere implicaties zou kunnen hebben voor het vertrouwen en de veiligheid in digitale communicatie.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Wat je nu moet bekijken

Bewaak de werkelijke latentie en betrouwbaarheid van de 'Extended Thinking'-functie in realistische scenario's, aangezien gelijktijdig redeneren en spreken een technische uitdaging is. Kijk uit naar evaluaties door derden van de geclaimde benchmarkscores, met name de nummer 1-positie in de Speech to Speech Quality Index. Kijk hoe deze modellen presteren in bedrijfsimplementaties met partners als Salesforce, en of de SynthID-watermerken effectief misbruik van de gegenereerde audio voorkomen. Houd bovendien de acceptatiegraad onder ontwikkelaars bij met behulp van de Gemini Live API en de specifieke gebruiksscenario's die voortkomen uit de nieuwe mogelijkheden voor het aanroepen van tools.

De prestaties van de 'Extended Thinking'-functie in de echte wereld zullen cruciaal zijn. Hoewel de bron beweert dat hij tegelijkertijd redeneert en spreekt, kunnen de werkelijke latentie, nauwkeurigheid en gebruikerservaring in complexe scenario's variëren. Onafhankelijk testen en feedback van gebruikers zullen belangrijk zijn om deze claims te valideren.

De acceptatie van de Gemini Live API door ontwikkelaars en de specifieke gebruiksscenario's die naar voren komen, zullen inzicht geven in de praktische waarde van deze modellen. Als ontwikkelaars robuuste, betrouwbare stemagenten kunnen bouwen die complexe workflows aankunnen, zal dit het ware potentieel van de technologie demonstreren.

De impact van de SynthID-watermerken op de audiokwaliteit en de gebruikersperceptie zal de moeite waard zijn om te monitoren. Als het watermerk te opdringerig is of gemakkelijk kan worden verwijderd, kan dit de effectiviteit ervan als veiligheidsmaatregel ondermijnen. Bovendien zal de reactie van andere AI-bedrijven op deze watermerkstandaard interessant zijn om te observeren.

Het concurrentielandschap op het gebied van stem-AI zal waarschijnlijk intensiveren naarmate andere bedrijven reageren op de release van Google. Kijk uit naar aankondigingen van OpenAI, Anthropic en andere grote spelers over hun eigen stemmodelmogelijkheden en benchmarks.

Gerelateerde gidsen en quizzen

AI-agentenAI-modellen uitgelegdWat is AI?Test wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?