Zurück zu den Neuigkeiten
ProduktAI Understanding Briefing

Google bringt Gemini 3.8 Flash TTS-Modelle auf den Markt

Google DeepMind hat Gemini 3.8 Flash TTS und Flash-Lite TTS veröffentlicht, neue Text-to-Speech-Modelle, die in Google AI Studio und über die Gemini-API verfügbar sind und benutzerdefinierte Spracherstellung und SynthID-Wasserzeichen bieten.

4 min readRead the primary source
Source-provided image accompanying Google launches Gemini 3.8 Flash TTS models
PrimärquellendokumentQuelle aufgezeichnet
Herausgeber
deepmind.google
Quelllink
deepmind.googlehttps://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/
Quelltyp
Primärdokument – ​​eine offizielle Ankündigung, ein Papier, eine Akte oder eine Erstanbieterseite, die wir direkt lesen.
KontextVerstehen Sie dies in 60 Sekunden

Beginnen Sie hier

Schlüsselbegriffe

API (Anwendungsprogrammierschnittstelle)
Eine strukturierte Möglichkeit für ein Softwaresystem, Anfragen an ein anderes System zu senden und Antworten von diesem zu empfangen.
Wasserzeichen
Einbetten eines erkennbaren Signals in KI-generierte Texte oder Medien, damit es später als maschinell erzeugt identifiziert werden kann.
Benchmark
Ein standardisierter Test oder Datensatz zum Messen und Vergleichen der Modellleistung.
Testen Sie sich selbstKI-Modelle erklärt Quiz

Was ist passiert?

Google DeepMind kündigte die Veröffentlichung von zwei neuen Text-to-Speech-Modellen an: Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS. Diese Modelle sind sofort in Google AI Studio und über die Gemini-API verfügbar, mit Integrationen für Plattformen wie Agora, LiveKit und Vercel. Die Veröffentlichung erweitert die Gemini Audio-Familie um Funktionen zur Generierung benutzerdefinierter Charakterstimmen und zur Steuerung von Szenendialogen mit präziser Steuerung der Wiedergabe.

Google DeepMind stellte Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS vor und bezeichnete sie als die ausdrucksstärksten Audiogenerationsmodelle in der Gemini-Familie. In der Ankündigung heißt es, dass diese Modelle die Stimmerzeugung von statischen Voreinstellungen in ein dynamisches Kreativstudio umwandeln und die Erstellung benutzerdefinierter Charakterstimmen und die Richtung des Szenendialogs ermöglichen.

Die Modelle sind ab heute im Google AI Studio verfügbar, wo sie als Sprachdesign-Arbeitsbereich fungieren. Benutzer können neue Stimmidentitäten von Grund auf vorgeben oder ihre eigenen Stimmen nachbilden und dann einen Drehbucheditor mit zwei Lautsprechern verwenden, um die zeilenweise Wiedergabe zu steuern. Der Zugriff erfolgt auch über die Gemini-API, sodass Entwicklerplattformen wie Agora, LiveKit, Pipecat und Vercel Sprachgenerierungserlebnisse erstellen und bereitstellen können.

Google behauptet, dass Gemini 3.8 Flash TTS mit einer Punktzahl von 71,4 den ersten Platz im Voice Design von Hume AI sichert und bei der Akzentmodellierung mit einer Punktzahl von 60,8 führend ist. Berichten zufolge belegen beide Modelle die Plätze 1 und 2 im Overall Quality Index von Hume AI. Bei der Bewertung blinder menschlicher Präferenzen auf Voice Arena sollen die Modelle Spitzenplätze in wichtigen globalen Sprachen belegen, darunter Japanisch, brasilianisches Portugiesisch, Vietnamesisch, modernes Hocharabisch, mexikanisches Spanisch und Hindi, wobei über 100 Sprachen unterstützt werden.

Die Version enthält spezielle Sicherheitsmechanismen für die Sprachreplikation, die von Benutzern die Bereitstellung einer mündlichen Einwilligungsaufzeichnung des Stimmbesitzers erfordern, die mit dem Referenzsprecher übereinstimmt, bevor eine Stimme erstellt werden kann. Darüber hinaus ist jeder von diesen Modellen generierte Audioclip mit SynthID versehen, einem nicht wahrnehmbaren Wasserzeichen, das sicherstellen soll, dass KI-generierte Sprache erkennbar bleibt, um Fehlinformationen zu verhindern.

Quellenangaben: deepmind.google

Warum es wichtig ist

Diese Einführung markiert einen bedeutenden Wandel in der KI-Sprachgenerierung von statischen Voreinstellungen hin zur dynamischen, anpassbaren Audioerstellung. Indem sie es Entwicklern ermöglichen, völlig neue Stimmidentitäten zu erstellen oder bestimmte Stimmen mit Einwilligungsüberprüfung zu replizieren, eröffnen die Modelle neue Möglichkeiten für die Medienlokalisierung, Konversationsagenten und die Produktion kreativer Inhalte. Die Aufnahme von SynthID-Wasserzeichen trägt der wachsenden Besorgnis über durch KI erzeugte Audio-Fehlinformationen Rechnung und bietet einen technischen Schutz für die Transparenz von Inhalten.

Die Einführung dieser Modelle stellt Entwicklern und Unternehmen Werkzeuge zur Verfügung, um reichhaltigere, ausdrucksstärkere Audioerlebnisse zu schaffen, ohne auf feste Sprachvoreinstellungen angewiesen zu sein. Diese Funktion ist besonders relevant für Branchen, die differenzierte regionale Akzente für die Medienlokalisierung oder konsistente Markenstimmen für Gesprächsagenten benötigen.

Die Partnerschaft mit Unternehmen wie Figma, HeyGen, Linguana, Wondercraft, 99.co und Ollang deutet auf eine unmittelbare praktische Anwendung bei der Beschleunigung globaler Synchronisation und der Bereitstellung von Konversations-Sprachagenten in großem Maßstab hin. Dies deutet auf einen Schritt hin zur Integration fortschrittlicher TTS-Funktionen in gängige Kreativ- und Unternehmens-Workflows hin.

Der Schwerpunkt auf der Zustimmungsüberprüfung für die Sprachreplikation und der Verwendung von SynthID-Wasserzeichen geht auf kritische ethische und sicherheitsrelevante Bedenken bei der KI-Audioerzeugung ein. Diese Schutzmaßnahmen zielen darauf ab, die Identität von Sprechern zu schützen und die Transparenz der Inhalte sicherzustellen, was mit der zunehmenden Verbreitung von KI-generierten Medien immer wichtiger wird.

Interactive Mechanism

Interaktiver Mechanismus: Wie es tatsächlich funktioniert

Entdecken Sie interaktiv die zugrunde liegende Technologie, die dieser Entwicklung zugrunde liegt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiver Konzeptcheck+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

Was Sie als nächstes sehen sollten

Überwachen Sie die Einführung dieser Modelle durch Partnerunternehmen wie Figma und HeyGen für die globale Synchronisierung und Medienlokalisierung. Achten Sie auf unabhängige Bewertungen der Sprachreplikationsschutzmaßnahmen und der Wirksamkeit des SynthID-Wasserzeichens bei der Erkennung von KI-generierter Sprache. Beobachten Sie außerdem, wie Entwickler den Drehbucheditor mit zwei Lautsprechern in Google AI Studio für komplexe Audioerzählungen nutzen.

Beobachten Sie, wie Partnerunternehmen diese Modelle in ihre Produkte integrieren, insbesondere in den Bereichen globale Synchronisierung und Medienlokalisierung, um die Leistung in der Praxis und die Benutzerrezeption zu bewerten.

Überwachen Sie unabhängige Bewertungen der Zustimmungsmechanismen zur Sprachreplikation und der Erkennbarkeit von SynthID-Wasserzeichen durch Dritte, da diese für die Gewährleistung der Sicherheit und Integrität der Technologie von entscheidender Bedeutung sind.

Verfolgen Sie die Entwicklung des Dual-Speaker-Drehbucheditors in Google AI Studio, da diese Funktion eine neue Schnittstelle zur Steuerung von KI-generierten Dialogen darstellt, die Einfluss darauf haben könnte, wie Autoren an das Audio-Storytelling herangehen.

Verwandte Leitfäden und Quizze

KI-Modelle erklärtKI-EthikKI-AgentenTesten Sie, was Sie wissen – probieren Sie ein kostenloses KI-Quiz ausSuchen Sie in unserem Glossar nach einem KI-Begriff
Fanden Sie das nützlich?