Retour aux Actualités
ProduitBriefing AI Understanding

Google lance les modèles Gemini 3.8 Flash TTS

Google DeepMind a publié Gemini 3.8 Flash TTS et Flash-Lite TTS, de nouveaux modèles de synthèse vocale disponibles dans Google AI Studio et via l'API Gemini, avec création vocale personnalisée et filigrane SynthID.

4 min readRead the primary source
Source-provided image accompanying Google launches Gemini 3.8 Flash TTS models
Document de source principaleSource enregistrée
Éditeur
deepmind.google
Lien source
deepmind.googlehttps://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/
Type de source
Document principal : une annonce officielle, un document, un dépôt ou une page de première partie que nous lisons directement.
ContexteComprenez cela en 60 secondes

Commencez ici

Termes clés

API (interface de programmation d'applications)
Une manière structurée permettant à un système logiciel d'envoyer des requêtes et de recevoir des réponses d'un autre système.
Filigrane
Intégrer un signal détectable dans un texte ou un média généré par l'IA afin qu'il puisse ensuite être identifié comme étant produit par une machine.
Référence
Un test ou un ensemble de données standardisé utilisé pour mesurer et comparer les performances du modèle.
Testez-vousQuiz sur les modèles d'IA expliqués

Que s'est-il passé

Google DeepMind a annoncé la sortie de deux nouveaux modèles de synthèse vocale, Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS. Ces modèles sont disponibles immédiatement dans Google AI Studio et via l'API Gemini, avec des intégrations pour des plateformes comme Agora, LiveKit et Vercel. Cette version étend la famille Gemini Audio, en ajoutant des capacités permettant de générer des voix de personnages personnalisées et de diriger les dialogues de scène avec un contrôle précis sur la diffusion.

Google DeepMind a présenté Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, les décrivant comme les modèles de génération audio les plus expressifs de la famille Gemini. L'annonce indique que ces modèles transforment la génération de voix à partir de préréglages statiques en un studio de création dynamique, permettant la création de voix de personnages personnalisées et la direction des dialogues de scène.

Les modèles sont disponibles dès aujourd'hui dans Google AI Studio, où ils fonctionnent comme un espace de travail de conception vocale. Les utilisateurs peuvent proposer de nouvelles identités vocales à partir de zéro ou reproduire leurs propres voix, puis utiliser un éditeur de scénario à deux haut-parleurs pour diriger la diffusion ligne par ligne. L'accès est également fourni via l'API Gemini, permettant aux plateformes de développement telles que Agora, LiveKit, Pipecat et Vercel de créer et de déployer des expériences de génération vocale.

Google affirme que Gemini 3.8 Flash TTS occupe la première place globale sur le Voice Design de Hume AI avec un score de 71,4 et est en tête en matière de modélisation d'accent avec un score de 60,8. Les deux modèles auraient obtenu les places n°1 et n°2 sur l’indice de qualité globale de Hume AI. Dans les évaluations aveugles des préférences humaines sur Voice Arena, les modèles occuperaient les premières positions dans les langues mondiales clés, notamment le japonais, le portugais brésilien, le vietnamien, l'arabe standard moderne, l'espagnol mexicain et l'hindi, avec une prise en charge de plus de 100 langues.

La version inclut des mécanismes de sécurité spécifiques pour la réplication vocale, obligeant les utilisateurs à fournir un enregistrement de consentement verbal du propriétaire de la voix correspondant au locuteur de référence avant qu'une voix puisse être créée. De plus, chaque clip audio généré par ces modèles est filigrané avec SynthID, un filigrane imperceptible conçu pour garantir que la parole générée par l'IA reste détectable afin d'éviter la désinformation.

Détails de la source: deepmind.google

Pourquoi c'est important

Ce lancement marque un changement significatif dans la génération de voix IA, passant des préréglages statiques à la création audio dynamique et personnalisable. En permettant aux développeurs de créer des identités vocales entièrement nouvelles ou de reproduire des voix spécifiques avec vérification du consentement, les modèles ouvrent de nouvelles possibilités pour la localisation des médias, les agents conversationnels et la production de contenu créatif. L'inclusion du filigrane SynthID répond aux préoccupations croissantes concernant la désinformation audio générée par l'IA, offrant une garantie technique pour la transparence du contenu.

L'introduction de ces modèles fournit aux développeurs et aux entreprises des outils permettant de créer des expériences audio plus riches et plus expressives sans recourir à des préréglages vocaux fixes. Cette fonctionnalité est particulièrement pertinente pour les secteurs nécessitant des accents régionaux nuancés pour la localisation des médias ou des voix de marque cohérentes pour les agents conversationnels.

Le partenariat avec des sociétés telles que Figma, HeyGen, Linguana, Wondercraft, 99.co et Ollang indique une application pratique immédiate pour accélérer le doublage mondial et alimenter les agents vocaux conversationnels à grande échelle. Cela suggère une évolution vers l’intégration de fonctionnalités TTS avancées dans les flux de travail créatifs et d’entreprise traditionnels.

L'accent mis sur la vérification du consentement pour la réplication vocale et l'utilisation du filigrane SynthID répond à des problèmes éthiques et de sécurité critiques dans la génération audio de l'IA. Ces garanties visent à protéger l’identité des talents vocaux et à garantir la transparence du contenu, ce qui est de plus en plus important à mesure que les médias générés par l’IA deviennent plus répandus.

Interactive Mechanism

Mécanisme interactif : comment cela fonctionne réellement

Explorez de manière interactive la technologie sous-jacente à ce développement.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Vérification de concept interactive+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

Que regarder ensuite

Surveillez l'adoption de ces modèles par des sociétés partenaires comme Figma et HeyGen pour le doublage mondial et la localisation de médias. Surveillez les évaluations indépendantes des garanties de réplication vocale et de l'efficacité du filigrane SynthID dans la détection de la parole générée par l'IA. De plus, observez comment l'éditeur de scénario à double haut-parleur de Google AI Studio est utilisé par les développeurs pour des récits audio complexes.

Observez comment les entreprises partenaires intègrent ces modèles dans leurs produits, en particulier dans les domaines du doublage mondial et de la localisation de médias, pour évaluer les performances réelles et l'accueil des utilisateurs.

Surveillez les évaluations tierces indépendantes des mécanismes de consentement à la réplication vocale et de la détectabilité des filigranes SynthID, car ceux-ci sont essentiels pour garantir la sécurité et l'intégrité de la technologie.

Suivez le développement de l'éditeur de scénario à double haut-parleur dans Google AI Studio, car cette fonctionnalité représente une nouvelle interface pour diriger les dialogues générés par l'IA qui pourrait influencer la façon dont les créateurs abordent la narration audio.

Guides et quiz associés

Modèles d'IA expliquésÉthique de l'IAAgents IATestez ce que vous savez : essayez un quiz gratuit sur l'IARecherchez un terme d'IA dans notre glossaire
Vous avez trouvé cela utile ?