Hva skjedde
Google DeepMind annonserte lanseringen av to nye tekst-til-tale-modeller, Gemini 3.8 Flash TTS og Gemini 3.8 Flash-Lite TTS. Disse modellene er tilgjengelig umiddelbart i Google AI Studio og gjennom Gemini API, med integrasjoner for plattformer som Agora, LiveKit og Vercel. Utgivelsen utvider Gemini Audio-familien, og legger til muligheter for å generere tilpassede karakterstemmer og dirigere scenedialog med presis kontroll over levering.
Google DeepMind introduserte Gemini 3.8 Flash TTS og Gemini 3.8 Flash-Lite TTS, og beskrev dem som de mest uttrykksfulle lydgenerasjonsmodellene i Gemini-familien. Kunngjøringen sier at disse modellene transformerer stemmegenerering fra statiske forhåndsinnstillinger til et dynamisk kreativt studio, noe som gir mulighet for å lage tilpassede karakterstemmer og retningen for scenedialog.
Modellene er tilgjengelige fra og med i dag i Google AI Studio, hvor de fungerer som et arbeidsområde for stemmedesign. Brukere kan spørre om nye vokalidentiteter fra bunnen av eller replikere sine egne stemmer, og deretter bruke et manusredigeringsprogram med to høyttalere for å styre linje-for-linje levering. Tilgang er også gitt via Gemini API, som gjør det mulig for utviklerplattformer som Agora, LiveKit, Pipecat og Vercel å bygge og distribuere talegenereringsopplevelser.
Google hevder at Gemini 3.8 Flash TTS sikrer #1-plassen på Hume AIs Voice Design med en poengsum på 71,4 og leder i aksentmodellering med en poengsum på 60,8. Begge modellene skal ha sikret plassene #1 og #2 på Hume AIs overordnede kvalitetsindeks. I blinde menneskelige preferanseevalueringer på Voice Arena sies modellene å ha topplasseringer i viktige globale språk, inkludert japansk, brasiliansk portugisisk, vietnamesisk, moderne standard arabisk, meksikansk spansk og hindi, med støtte for over 100 språk.
Utgivelsen inkluderer spesifikke sikkerhetsmekanismer for stemmereplikering, som krever at brukere gir et verbalt samtykkeopptak fra stemmeeieren som samsvarer med referansehøyttaleren før en stemme kan opprettes. I tillegg er hvert lydklipp som genereres av disse modellene vannmerket med SynthID, et umerkelig vannmerke designet for å sikre at AI-generert tale forblir gjenkjennelig for å forhindre feilinformasjon.
Kildedetaljer: deepmind.google ↗
Hvorfor det betyr noe
Denne lanseringen markerer et betydelig skifte i AI-stemmegenerering fra statiske forhåndsinnstillinger til dynamisk, tilpassbar lydoppretting. Ved å gjøre det mulig for utviklere å lage helt nye vokalidentiteter eller replikere spesifikke stemmer med samtykkebekreftelse, åpner modellene nye muligheter for medielokalisering, samtaleagenter og kreativ innholdsproduksjon. Inkluderingen av SynthID-vannmerking adresserer økende bekymringer om AI-generert lydfeilinformasjon, og gir en teknisk beskyttelse for innholdsgjennomsiktighet.
Introduksjonen av disse modellene gir utviklere og bedrifter verktøy for å skape rikere, mer uttrykksfulle lydopplevelser uten å stole på faste stemmeforhåndsinnstillinger. Denne egenskapen er spesielt relevant for bransjer som krever nyanserte regionale aksenter for medielokalisering eller konsistente merkestemmer for samtaleagenter.
Partnerskapet med selskaper som Figma, HeyGen, Linguana, Wondercraft, 99.co og Ollang indikerer umiddelbar praktisk anvendelse for å akselerere global dubbing og drive samtaletaleagenter i stor skala. Dette antyder et grep mot å integrere avanserte TTS-funksjoner i vanlige kreative og bedriftsarbeidsflyter.
Vektleggingen av samtykkeverifisering for stemmereplikering og bruk av SynthID-vannmerking adresserer kritiske etiske og sikkerhetsmessige bekymringer i generering av AI-lyd. Disse sikkerhetstiltakene tar sikte på å beskytte stemmetalents identitet og sikre innholdsgjennomsiktighet, noe som blir stadig viktigere etter hvert som AI-genererte medier blir mer utbredt.
Interaktiv mekanisme: Hvordan det faktisk fungerer
Utforsk den underliggende teknologien bak denne utviklingen interaktivt.
crm_get_transaction(id='4092').In AI, what are a model's "parameters"?
Hva du skal se neste
Overvåk bruken av disse modellene av partnerselskaper som Figma og HeyGen for global dubbing og medielokalisering. Se etter uavhengige evalueringer av sikkerhetstiltakene for stemmereplikering og effektiviteten til SynthID-vannmerking for å oppdage AI-generert tale. I tillegg kan du se hvordan manusredigereren med to høyttalere i Google AI Studio brukes av utviklere for komplekse lydfortellinger.
Se hvordan partnerbedrifter integrerer disse modellene i produktene sine, spesielt innen global dubbing og medielokalisering, for å vurdere den virkelige ytelsen og brukermottakelsen.
Overvåk uavhengige tredjepartsevalueringer av stemmereplikeringssamtykkemekanismene og detekterbarheten til SynthID-vannmerker, da disse er kritiske for å sikre sikkerheten og integriteten til teknologien.
Følg utviklingen av manusredigereren med to høyttalere i Google AI Studio, siden denne funksjonen representerer et nytt grensesnitt for å dirigere AI-generert dialog som kan påvirke hvordan skaperne nærmer seg lydhistoriefortelling.