Tilbake til Nyheter
ProduktAI Understanding orientering

Google lanserer Gemini 3.8 Flash TTS-modeller

Google DeepMind har gitt ut Gemini 3.8 Flash TTS og Flash-Lite TTS, nye tekst-til-tale-modeller tilgjengelig i Google AI Studio og via Gemini API, med tilpasset stemmeoppretting og SynthID-vannmerking.

4 min readRead the primary source
Source-provided image accompanying Google launches Gemini 3.8 Flash TTS models
PrimærkildedokumentKilde registrert
Utgiver
deepmind.google
Kilde lenke
deepmind.googlehttps://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

API (Application Programming Interface)
En strukturert måte for ett programvaresystem å sende forespørsler til og motta svar fra et annet system.
Vannmerking
Innbygging av et detekterbart signal i AI-generert tekst eller media slik at det senere kan identifiseres som maskinprodusert.
Benchmark
En standardisert test eller datasett som brukes til å måle og sammenligne modellytelse.
Test deg selvQuiz for forklaring av AI-modeller

Hva skjedde

Google DeepMind annonserte lanseringen av to nye tekst-til-tale-modeller, Gemini 3.8 Flash TTS og Gemini 3.8 Flash-Lite TTS. Disse modellene er tilgjengelig umiddelbart i Google AI Studio og gjennom Gemini API, med integrasjoner for plattformer som Agora, LiveKit og Vercel. Utgivelsen utvider Gemini Audio-familien, og legger til muligheter for å generere tilpassede karakterstemmer og dirigere scenedialog med presis kontroll over levering.

Google DeepMind introduserte Gemini 3.8 Flash TTS og Gemini 3.8 Flash-Lite TTS, og beskrev dem som de mest uttrykksfulle lydgenerasjonsmodellene i Gemini-familien. Kunngjøringen sier at disse modellene transformerer stemmegenerering fra statiske forhåndsinnstillinger til et dynamisk kreativt studio, noe som gir mulighet for å lage tilpassede karakterstemmer og retningen for scenedialog.

Modellene er tilgjengelige fra og med i dag i Google AI Studio, hvor de fungerer som et arbeidsområde for stemmedesign. Brukere kan spørre om nye vokalidentiteter fra bunnen av eller replikere sine egne stemmer, og deretter bruke et manusredigeringsprogram med to høyttalere for å styre linje-for-linje levering. Tilgang er også gitt via Gemini API, som gjør det mulig for utviklerplattformer som Agora, LiveKit, Pipecat og Vercel å bygge og distribuere talegenereringsopplevelser.

Google hevder at Gemini 3.8 Flash TTS sikrer #1-plassen på Hume AIs Voice Design med en poengsum på 71,4 og leder i aksentmodellering med en poengsum på 60,8. Begge modellene skal ha sikret plassene #1 og #2 på Hume AIs overordnede kvalitetsindeks. I blinde menneskelige preferanseevalueringer på Voice Arena sies modellene å ha topplasseringer i viktige globale språk, inkludert japansk, brasiliansk portugisisk, vietnamesisk, moderne standard arabisk, meksikansk spansk og hindi, med støtte for over 100 språk.

Utgivelsen inkluderer spesifikke sikkerhetsmekanismer for stemmereplikering, som krever at brukere gir et verbalt samtykkeopptak fra stemmeeieren som samsvarer med referansehøyttaleren før en stemme kan opprettes. I tillegg er hvert lydklipp som genereres av disse modellene vannmerket med SynthID, et umerkelig vannmerke designet for å sikre at AI-generert tale forblir gjenkjennelig for å forhindre feilinformasjon.

Kildedetaljer: deepmind.google

Hvorfor det betyr noe

Denne lanseringen markerer et betydelig skifte i AI-stemmegenerering fra statiske forhåndsinnstillinger til dynamisk, tilpassbar lydoppretting. Ved å gjøre det mulig for utviklere å lage helt nye vokalidentiteter eller replikere spesifikke stemmer med samtykkebekreftelse, åpner modellene nye muligheter for medielokalisering, samtaleagenter og kreativ innholdsproduksjon. Inkluderingen av SynthID-vannmerking adresserer økende bekymringer om AI-generert lydfeilinformasjon, og gir en teknisk beskyttelse for innholdsgjennomsiktighet.

Introduksjonen av disse modellene gir utviklere og bedrifter verktøy for å skape rikere, mer uttrykksfulle lydopplevelser uten å stole på faste stemmeforhåndsinnstillinger. Denne egenskapen er spesielt relevant for bransjer som krever nyanserte regionale aksenter for medielokalisering eller konsistente merkestemmer for samtaleagenter.

Partnerskapet med selskaper som Figma, HeyGen, Linguana, Wondercraft, 99.co og Ollang indikerer umiddelbar praktisk anvendelse for å akselerere global dubbing og drive samtaletaleagenter i stor skala. Dette antyder et grep mot å integrere avanserte TTS-funksjoner i vanlige kreative og bedriftsarbeidsflyter.

Vektleggingen av samtykkeverifisering for stemmereplikering og bruk av SynthID-vannmerking adresserer kritiske etiske og sikkerhetsmessige bekymringer i generering av AI-lyd. Disse sikkerhetstiltakene tar sikte på å beskytte stemmetalents identitet og sikre innholdsgjennomsiktighet, noe som blir stadig viktigere etter hvert som AI-genererte medier blir mer utbredt.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiv konseptsjekk+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

Hva du skal se neste

Overvåk bruken av disse modellene av partnerselskaper som Figma og HeyGen for global dubbing og medielokalisering. Se etter uavhengige evalueringer av sikkerhetstiltakene for stemmereplikering og effektiviteten til SynthID-vannmerking for å oppdage AI-generert tale. I tillegg kan du se hvordan manusredigereren med to høyttalere i Google AI Studio brukes av utviklere for komplekse lydfortellinger.

Se hvordan partnerbedrifter integrerer disse modellene i produktene sine, spesielt innen global dubbing og medielokalisering, for å vurdere den virkelige ytelsen og brukermottakelsen.

Overvåk uavhengige tredjepartsevalueringer av stemmereplikeringssamtykkemekanismene og detekterbarheten til SynthID-vannmerker, da disse er kritiske for å sikre sikkerheten og integriteten til teknologien.

Følg utviklingen av manusredigereren med to høyttalere i Google AI Studio, siden denne funksjonen representerer et nytt grensesnitt for å dirigere AI-generert dialog som kan påvirke hvordan skaperne nærmer seg lydhistoriefortelling.

Relaterte guider og quizer

AI-modeller forklartKI-etikkAI-agenterTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vår
Fant du dette nyttig?