Terug naar Nieuws
ProductAI Understanding-briefing

Google lanceert Gemini 3.8 Flash TTS-modellen

Google DeepMind heeft Gemini 3.8 Flash TTS en Flash-Lite TTS uitgebracht, nieuwe tekst-naar-spraak-modellen beschikbaar in Google AI Studio en via de Gemini API, met aangepaste stemcreatie en SynthID-watermerken.

4 min readRead the primary source
Source-provided image accompanying Google launches Gemini 3.8 Flash TTS models
Primair brondocumentBron opgenomen
Uitgever
deepmind.google
Bronlink
deepmind.googlehttps://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

API (Applicatieprogrammeringsinterface)
Een gestructureerde manier waarop het ene softwaresysteem verzoeken kan verzenden naar en antwoorden kan ontvangen van een ander systeem.
Watermerken
Het inbedden van een detecteerbaar signaal in door AI gegenereerde tekst of media, zodat het later kan worden geïdentificeerd als machinaal geproduceerd.
Benchmark
Een gestandaardiseerde test of dataset die wordt gebruikt om de prestaties van modellen te meten en te vergelijken.
Test jezelfQuiz over AI-modellen uitgelegd

Wat is er gebeurd

Google DeepMind heeft de release aangekondigd van twee nieuwe tekst-naar-spraak-modellen, Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS. Deze modellen zijn onmiddellijk beschikbaar in Google AI Studio en via de Gemini API, met integraties voor platforms als Agora, LiveKit en Vercel. De release breidt de Gemini Audio-familie uit en voegt mogelijkheden toe voor het genereren van aangepaste karakterstemmen en het regisseren van scènedialogen met nauwkeurige controle over de levering.

Google DeepMind introduceerde Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS en beschrijft ze als de meest expressieve modellen voor audiogeneratie in de Gemini-familie. In de aankondiging staat dat deze modellen de stemgeneratie transformeren van statische presets naar een dynamische creatieve studio, waardoor de creatie van aangepaste karakterstemmen en de regie van scènedialogen mogelijk wordt.

De modellen zijn vanaf vandaag beschikbaar in Google AI Studio, waar ze fungeren als stemontwerpwerkruimte. Gebruikers kunnen vanuit het niets nieuwe vocale identiteiten oproepen of hun eigen stemmen repliceren, en vervolgens een scenario-editor met twee luidsprekers gebruiken om de weergave regel voor regel te regelen. Toegang wordt ook geboden via de Gemini API, waardoor ontwikkelaarsplatforms zoals Agora, LiveKit, Pipecat en Vercel spraakgeneratie-ervaringen kunnen bouwen en implementeren.

Google beweert dat Gemini 3.8 Flash TTS de nummer 1 algemene plek op Hume AI's Voice Design veiligstelt met een score van 71,4 en leidt in accentmodellering met een score van 60,8. Beide modellen hebben naar verluidt de #1 en #2 posities op de Overall Quality Index van Hume AI veiliggesteld. Uit blinde menselijke voorkeursevaluaties op Voice Arena blijkt dat de modellen topposities bekleden in belangrijke mondiale talen, waaronder Japans, Braziliaans Portugees, Vietnamees, Modern Standaard Arabisch, Mexicaans Spaans en Hindi, met ondersteuning voor meer dan 100 talen.

De release bevat specifieke veiligheidsmechanismen voor stemreplicatie, waarbij gebruikers een mondelinge toestemmingsopname van de stemeigenaar moeten overleggen die overeenkomt met de referentiespreker voordat er een stem kan worden gemaakt. Bovendien is elke audioclip die door deze modellen wordt gegenereerd, voorzien van een watermerk met SynthID, een onmerkbaar watermerk dat is ontworpen om ervoor te zorgen dat door AI gegenereerde spraak detecteerbaar blijft om verkeerde informatie te helpen voorkomen.

Brongegevens: deepmind.google

Waarom het ertoe doet

Deze lancering markeert een aanzienlijke verschuiving in de AI-stemgeneratie van statische presets naar dynamische, aanpasbare audiocreatie. Door ontwikkelaars in staat te stellen geheel nieuwe vocale identiteiten te creëren of specifieke stemmen te repliceren met toestemmingsverificatie, openen de modellen nieuwe mogelijkheden voor medialokalisatie, conversatieagenten en productie van creatieve inhoud. De opname van SynthID-watermerken komt tegemoet aan de groeiende bezorgdheid over door AI gegenereerde verkeerde audio-informatie, en biedt een technische waarborg voor de transparantie van de inhoud.

De introductie van deze modellen biedt ontwikkelaars en ondernemingen tools om rijkere, expressievere audio-ervaringen te creëren zonder afhankelijk te zijn van vaste stemvoorinstellingen. Deze mogelijkheid is met name relevant voor sectoren die genuanceerde regionale accenten nodig hebben voor medialokalisatie of consistente merkstemmen voor gespreksagenten.

De samenwerking met bedrijven als Figma, HeyGen, Linguana, Wondercraft, 99.co en Ollang duidt op een onmiddellijke praktische toepassing bij het versnellen van wereldwijde nasynchronisatie en het aandrijven van conversatie-stemagenten op grote schaal. Dit suggereert een stap in de richting van het integreren van geavanceerde TTS-mogelijkheden in reguliere creatieve en zakelijke workflows.

De nadruk op toestemmingsverificatie voor stemreplicatie en het gebruik van SynthID-watermerken pakt kritische ethische en veiligheidsproblemen aan bij het genereren van AI-audio. Deze waarborgen zijn bedoeld om de identiteit van stemtalent te beschermen en de transparantie van de inhoud te garanderen, wat steeds belangrijker wordt naarmate door AI gegenereerde media steeds vaker voorkomen.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interactieve conceptcheck+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

Wat je nu moet bekijken

Houd toezicht op de adoptie van deze modellen door partnerbedrijven als Figma en HeyGen voor wereldwijde nasynchronisatie en medialokalisatie. Kijk uit naar onafhankelijke evaluaties van de waarborgen voor stemreplicatie en de effectiviteit van SynthID-watermerken bij het detecteren van door AI gegenereerde spraak. Bekijk bovendien hoe de scenario-editor met twee luidsprekers in Google AI Studio door ontwikkelaars wordt gebruikt voor complexe audioverhalen.

Observeer hoe partnerbedrijven deze modellen in hun producten integreren, vooral op het gebied van mondiale nasynchronisatie en medialokalisatie, om de prestaties in de echte wereld en de ontvangst door gebruikers te beoordelen.

Monitor onafhankelijke evaluaties door derden van de toestemmingsmechanismen voor stemreplicatie en de detecteerbaarheid van SynthID-watermerken, aangezien deze van cruciaal belang zijn voor het waarborgen van de veiligheid en integriteit van de technologie.

Volg de ontwikkeling van de scenario-editor met twee luidsprekers in Google AI Studio, aangezien deze functie een nieuwe interface vertegenwoordigt voor het regisseren van door AI gegenereerde dialogen die van invloed kunnen zijn op de manier waarop makers het vertellen van audioverhalen benaderen.

Gerelateerde gidsen en quizzen

AI-modellen uitgelegdAI-ethiekAI-agentenTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijst
Vond je dit nuttig?