Înapoi la Știri
ProdusAI Understanding briefing

Google lansează modelele Gemini 3.8 Flash TTS

Google DeepMind a lansat Gemini 3.8 Flash TTS și Flash-Lite TTS, noi modele text-to-speech disponibile în Google AI Studio și prin API-ul Gemini, cu crearea personalizată a vocii și filigranul SynthID.

4 min readRead the primary source
Source-provided image accompanying Google launches Gemini 3.8 Flash TTS models
Document sursă primarăSursa înregistrată
Editor
deepmind.google
Link sursă
deepmind.googlehttps://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/
Tip sursă
Document principal — un anunț oficial, hârtie, depunere sau pagină primară pe care o citim direct.
ContextÎnțelege asta în 60 de secunde

Începeți de aici

Termeni cheie

API (Interfață de programare a aplicației)
O modalitate structurată pentru ca un sistem software să trimită cereri și să primească răspunsuri de la un alt sistem.
Watermarking
Încorporarea unui semnal detectabil în text sau media generat de AI, astfel încât să poată fi identificat ulterior ca produs de mașină.
Benchmark
Un test standardizat sau un set de date utilizat pentru a măsura și compara performanța modelului.
Testează-teTest explicativ pentru modelele AI

Ce sa întâmplat

Google DeepMind a anunțat lansarea a două noi modele text-to-speech, Gemini 3.8 Flash TTS și Gemini 3.8 Flash-Lite TTS. Aceste modele sunt disponibile imediat în Google AI Studio și prin API-ul Gemini, cu integrări pentru platforme precum Agora, LiveKit și Vercel. Lansarea extinde familia Gemini Audio, adăugând capabilități de generare de voci personalizate ale personajelor și de dirijare a dialogului scenei cu control precis asupra difuzării.

Google DeepMind a introdus Gemini 3.8 Flash TTS și Gemini 3.8 Flash-Lite TTS, descriindu-le ca fiind cele mai expresive modele de generare audio din familia Gemini. Anunțul afirmă că aceste modele transformă generarea vocii din presetări statice într-un studio creativ dinamic, permițând crearea de voci personalizate ale personajelor și direcția dialogului scenei.

Modelele sunt disponibile începând de astăzi în Google AI Studio, unde funcționează ca spațiu de lucru pentru design vocal. Utilizatorii pot solicita noi identități vocale de la zero sau pot replica propriile voci, apoi pot folosi un editor de scenarii cu două difuzoare pentru a direcționa livrarea rând cu linie. Accesul este oferit și prin intermediul API-ului Gemini, permițând platformelor de dezvoltare precum Agora, LiveKit, Pipecat și Vercel să construiască și să implementeze experiențe de generare a vorbirii.

Google susține că Gemini 3.8 Flash TTS asigură locul 1 în clasamentul Hume AI Voice Design cu un scor de 71,4 și conduce în modelarea accentului cu un scor de 60,8. Se pare că ambele modele asigură locurile #1 și #2 în indicele de calitate generală al Hume AI. În evaluările oarbe ale preferințelor umane de pe Voice Arena, se spune că modelele dețin poziții de top în limbi cheie globale, inclusiv japoneză, portugheză braziliană, vietnameză, arabă standard modernă, spaniolă mexicană și hindi, cu suport pentru peste 100 de limbi.

Versiunea include mecanisme de siguranță specifice pentru replicarea vocii, solicitând utilizatorilor să furnizeze o înregistrare verbală a consimțământului de la proprietarul vocii care se potrivește cu difuzorul de referință înainte de a putea fi creată o voce. În plus, fiecare clip audio generat de aceste modele este marcat cu SynthID, un filigran imperceptibil conceput pentru a se asigura că vorbirea generată de AI rămâne detectabilă pentru a ajuta la prevenirea dezinformării.

Detalii sursa: deepmind.google

De ce contează

Această lansare marchează o schimbare semnificativă în generarea vocii AI de la presetări statice la crearea audio dinamică, personalizabilă. Permițând dezvoltatorilor să creeze identități vocale complet noi sau să reproducă voci specifice cu verificarea consimțământului, modelele deschid noi posibilități pentru localizarea media, agenții conversaționali și producția de conținut creativ. Includerea filigranului SynthID abordează preocupările tot mai mari cu privire la dezinformările audio generate de AI, oferind o garanție tehnică pentru transparența conținutului.

Introducerea acestor modele oferă dezvoltatorilor și întreprinderilor instrumente pentru a crea experiențe audio mai bogate și mai expresive, fără a se baza pe presetări fixe de voce. Această capacitate este deosebit de relevantă pentru industriile care necesită accente regionale nuanțate pentru localizarea media sau voci consistente ale mărcii pentru agenții conversaționali.

Parteneriatul cu companii precum Figma, HeyGen, Linguana, Wondercraft, 99.co și Ollang indică aplicarea practică imediată în accelerarea dublării globale și pentru alimentarea agenților vocali conversaționali la scară. Acest lucru sugerează o mișcare către integrarea capabilităților avansate TTS în fluxurile de lucru creative și ale întreprinderii.

Accentul pus pe verificarea consimțământului pentru replicarea vocii și utilizarea filigranului SynthID abordează preocupările critice de etică și securitate în generarea audio AI. Aceste măsuri de protecție urmăresc să protejeze identitatea talentelor vocale și să asigure transparența conținutului, ceea ce este din ce în ce mai important pe măsură ce media generată de AI devine mai răspândită.

Interactive Mechanism

Mecanism interactiv: cum funcționează de fapt

Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Verificare interactivă a conceptului+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

Ce să urmărești în continuare

Monitorizați adoptarea acestor modele de către companii partenere precum Figma și HeyGen pentru dublare globală și localizare media. Urmăriți evaluările independente ale garanțiilor de replicare a vocii și eficacitatea filigranului SynthID în detectarea vorbirii generate de AI. În plus, observați cum editorul de scenarii cu două difuzoare din Google AI Studio este utilizat de dezvoltatori pentru narațiuni audio complexe.

Observați modul în care companiile partenere integrează aceste modele în produsele lor, în special în domeniile dublării globale și localizării media, pentru a evalua performanța în lumea reală și recepția utilizatorilor.

Monitorizați evaluările independente ale unor terțe părți ale mecanismelor de consimțământ pentru replicarea vocii și detectabilitatea filigranelor SynthID, deoarece acestea sunt esențiale pentru asigurarea siguranței și integrității tehnologiei.

Urmăriți dezvoltarea editorului de scenarii cu două difuzoare în Google AI Studio, deoarece această caracteristică reprezintă o nouă interfață pentru dirijarea dialogului generat de AI, care ar putea influența modul în care creatorii abordează povestea audio.

Ghiduri și chestionare conexe

Modelele AI explicateEtica IAAgenți AITestați ceea ce știți — încercați un test AI gratuitCăutați un termen AI în glosarul nostru
Ai găsit asta util?