Wat is er gebeurd
Google DeepMind heeft de release aangekondigd van twee nieuwe tekst-naar-spraak-modellen, Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS. Deze modellen zijn onmiddellijk beschikbaar in Google AI Studio en via de Gemini API, met integraties voor platforms als Agora, LiveKit en Vercel. De release breidt de Gemini Audio-familie uit en voegt mogelijkheden toe voor het genereren van aangepaste karakterstemmen en het regisseren van scènedialogen met nauwkeurige controle over de levering.
Google DeepMind introduceerde Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS en beschrijft ze als de meest expressieve modellen voor audiogeneratie in de Gemini-familie. In de aankondiging staat dat deze modellen de stemgeneratie transformeren van statische presets naar een dynamische creatieve studio, waardoor de creatie van aangepaste karakterstemmen en de regie van scènedialogen mogelijk wordt.
De modellen zijn vanaf vandaag beschikbaar in Google AI Studio, waar ze fungeren als stemontwerpwerkruimte. Gebruikers kunnen vanuit het niets nieuwe vocale identiteiten oproepen of hun eigen stemmen repliceren, en vervolgens een scenario-editor met twee luidsprekers gebruiken om de weergave regel voor regel te regelen. Toegang wordt ook geboden via de Gemini API, waardoor ontwikkelaarsplatforms zoals Agora, LiveKit, Pipecat en Vercel spraakgeneratie-ervaringen kunnen bouwen en implementeren.
Google beweert dat Gemini 3.8 Flash TTS de nummer 1 algemene plek op Hume AI's Voice Design veiligstelt met een score van 71,4 en leidt in accentmodellering met een score van 60,8. Beide modellen hebben naar verluidt de #1 en #2 posities op de Overall Quality Index van Hume AI veiliggesteld. Uit blinde menselijke voorkeursevaluaties op Voice Arena blijkt dat de modellen topposities bekleden in belangrijke mondiale talen, waaronder Japans, Braziliaans Portugees, Vietnamees, Modern Standaard Arabisch, Mexicaans Spaans en Hindi, met ondersteuning voor meer dan 100 talen.
De release bevat specifieke veiligheidsmechanismen voor stemreplicatie, waarbij gebruikers een mondelinge toestemmingsopname van de stemeigenaar moeten overleggen die overeenkomt met de referentiespreker voordat er een stem kan worden gemaakt. Bovendien is elke audioclip die door deze modellen wordt gegenereerd, voorzien van een watermerk met SynthID, een onmerkbaar watermerk dat is ontworpen om ervoor te zorgen dat door AI gegenereerde spraak detecteerbaar blijft om verkeerde informatie te helpen voorkomen.
Brongegevens: deepmind.google ↗
Waarom het ertoe doet
Deze lancering markeert een aanzienlijke verschuiving in de AI-stemgeneratie van statische presets naar dynamische, aanpasbare audiocreatie. Door ontwikkelaars in staat te stellen geheel nieuwe vocale identiteiten te creëren of specifieke stemmen te repliceren met toestemmingsverificatie, openen de modellen nieuwe mogelijkheden voor medialokalisatie, conversatieagenten en productie van creatieve inhoud. De opname van SynthID-watermerken komt tegemoet aan de groeiende bezorgdheid over door AI gegenereerde verkeerde audio-informatie, en biedt een technische waarborg voor de transparantie van de inhoud.
De introductie van deze modellen biedt ontwikkelaars en ondernemingen tools om rijkere, expressievere audio-ervaringen te creëren zonder afhankelijk te zijn van vaste stemvoorinstellingen. Deze mogelijkheid is met name relevant voor sectoren die genuanceerde regionale accenten nodig hebben voor medialokalisatie of consistente merkstemmen voor gespreksagenten.
De samenwerking met bedrijven als Figma, HeyGen, Linguana, Wondercraft, 99.co en Ollang duidt op een onmiddellijke praktische toepassing bij het versnellen van wereldwijde nasynchronisatie en het aandrijven van conversatie-stemagenten op grote schaal. Dit suggereert een stap in de richting van het integreren van geavanceerde TTS-mogelijkheden in reguliere creatieve en zakelijke workflows.
De nadruk op toestemmingsverificatie voor stemreplicatie en het gebruik van SynthID-watermerken pakt kritische ethische en veiligheidsproblemen aan bij het genereren van AI-audio. Deze waarborgen zijn bedoeld om de identiteit van stemtalent te beschermen en de transparantie van de inhoud te garanderen, wat steeds belangrijker wordt naarmate door AI gegenereerde media steeds vaker voorkomen.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
crm_get_transaction(id='4092').In AI, what are a model's "parameters"?
Wat je nu moet bekijken
Houd toezicht op de adoptie van deze modellen door partnerbedrijven als Figma en HeyGen voor wereldwijde nasynchronisatie en medialokalisatie. Kijk uit naar onafhankelijke evaluaties van de waarborgen voor stemreplicatie en de effectiviteit van SynthID-watermerken bij het detecteren van door AI gegenereerde spraak. Bekijk bovendien hoe de scenario-editor met twee luidsprekers in Google AI Studio door ontwikkelaars wordt gebruikt voor complexe audioverhalen.
Observeer hoe partnerbedrijven deze modellen in hun producten integreren, vooral op het gebied van mondiale nasynchronisatie en medialokalisatie, om de prestaties in de echte wereld en de ontvangst door gebruikers te beoordelen.
Monitor onafhankelijke evaluaties door derden van de toestemmingsmechanismen voor stemreplicatie en de detecteerbaarheid van SynthID-watermerken, aangezien deze van cruciaal belang zijn voor het waarborgen van de veiligheid en integriteit van de technologie.
Volg de ontwikkeling van de scenario-editor met twee luidsprekers in Google AI Studio, aangezien deze functie een nieuwe interface vertegenwoordigt voor het regisseren van door AI gegenereerde dialogen die van invloed kunnen zijn op de manier waarop makers het vertellen van audioverhalen benaderen.