Вернуться к новостям
ПродуктAI Understanding брифинг

Google представляет модели Gemini 3.8 Flash TTS

Google DeepMind выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS, новые модели преобразования текста в речь, доступные в Google AI Studio и через API Gemini, с функцией создания собственного голоса и водяными знаками SynthID.

4 min readRead the primary source
Source-provided image accompanying Google launches Gemini 3.8 Flash TTS models
ПервоисточникИсточник записан
Издатель
deepmind.google
Ссылка на источник
deepmind.googlehttps://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

API (интерфейс прикладного программирования)
Структурированный способ отправки одной программной системой запросов и получения ответов от другой системы.
Водяные знаки
Встраивание обнаруживаемого сигнала в текст или медиафайлы, сгенерированные ИИ, чтобы впоследствии его можно было идентифицировать как созданный машиной.
Контрольный показатель
Стандартизированный тест или набор данных, используемый для измерения и сравнения производительности модели.
Проверьте себяВикторина с объяснением моделей искусственного интеллекта

Что случилось

Google DeepMind объявила о выпуске двух новых моделей преобразования текста в речь: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Эти модели доступны сразу в Google AI Studio и через API Gemini с интеграцией для таких платформ, как Agora, LiveKit и Vercel. Эта версия расширяет семейство Gemini Audio, добавляя возможности для создания пользовательских голосов персонажей и управления диалогами в сцене с точным контролем над их воспроизведением.

Google DeepMind представила Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, назвав их наиболее выразительными моделями генерации звука в семействе Gemini. В объявлении говорится, что эти модели преобразуют генерацию голоса из статических пресетов в динамичную творческую студию, позволяя создавать собственные голоса персонажей и направление диалогов в сцене.

Модели доступны с сегодняшнего дня в Google AI Studio, где они функционируют как рабочее пространство для голосового дизайна. Пользователи могут создавать новые голосовые образы с нуля или воспроизводить свои собственные голоса, а затем использовать редактор сценариев с двумя динамиками для управления построчной передачей. Доступ также предоставляется через API Gemini, что позволяет платформам разработчиков, таким как Agora, LiveKit, Pipecat и Vercel, создавать и развертывать возможности генерации речи.

Google утверждает, что Gemini 3.8 Flash TTS занимает первое место в рейтинге голосового дизайна Hume AI с результатом 71,4 и лидирует в моделировании акцента с результатом 60,8. Сообщается, что обе модели занимают первое и второе места в общем индексе качества Hume AI. По данным слепой оценки предпочтений людей на Voice Arena, модели занимают лидирующие позиции на ключевых мировых языках, включая японский, бразильский португальский, вьетнамский, современный стандартный арабский, мексиканский испанский и хинди, с поддержкой более 100 языков.

Релиз включает в себя специальные механизмы безопасности для репликации голоса, требующие от пользователей предоставить запись устного согласия владельца голоса, которая соответствует эталонному говорящему, прежде чем голос может быть создан. Кроме того, каждый аудиоклип, созданный этими моделями, имеет водяной знак SynthID — незаметный водяной знак, предназначенный для обеспечения обнаружения речи, сгенерированной искусственным интеллектом, и предотвращения дезинформации.

Подробности об источнике: deepmind.google

Почему это важно

Этот запуск знаменует собой значительный сдвиг в генерации голоса ИИ от статических предустановок к динамическому, настраиваемому созданию звука. Позволяя разработчикам создавать совершенно новые голосовые идентификаторы или воспроизводить определенные голоса с проверкой согласия, эти модели открывают новые возможности для локализации мультимедиа, диалоговых агентов и создания творческого контента. Включение водяных знаков SynthID устраняет растущую обеспокоенность по поводу дезинформации звука, генерируемой искусственным интеллектом, обеспечивая техническую защиту прозрачности контента.

Внедрение этих моделей предоставляет разработчикам и предприятиям инструменты для создания более богатого и выразительного звука, не полагаясь на фиксированные голосовые настройки. Эта возможность особенно актуальна для отраслей, которым необходимы тонкие региональные акценты для локализации СМИ или последовательные голоса бренда для диалоговых агентов.

Партнерство с такими компаниями, как Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang, указывает на немедленное практическое применение в ускорении глобального дубляжа и расширении возможностей диалоговых голосовых агентов в больших масштабах. Это предполагает переход к интеграции расширенных возможностей TTS в основные творческие и корпоративные рабочие процессы.

Акцент на проверке согласия для репликации голоса и использовании водяных знаков SynthID решает критические проблемы этики и безопасности при создании звука с помощью ИИ. Эти меры защиты направлены на защиту личности ораторов и обеспечение прозрачности контента, что становится все более важным по мере того, как средства массовой информации, созданные с помощью искусственного интеллекта, становятся все более распространенными.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Интерактивная проверка концепции+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

Что посмотреть дальше

Следите за внедрением этих моделей такими компаниями-партнерами, как Figma и HeyGen, для глобального дубляжа и локализации мультимедиа. Следите за независимыми оценками средств защиты репликации голоса и эффективности водяных знаков SynthID при обнаружении речи, генерируемой искусственным интеллектом. Кроме того, обратите внимание, как редактор сценариев с двумя динамиками в Google AI Studio используется разработчиками для создания сложных звуковых повествований.

Посмотрите, как компании-партнеры интегрируют эти модели в свои продукты, особенно в области глобального дубляжа и локализации мультимедиа, чтобы оценить реальную производительность и восприятие пользователями.

Контролируйте независимые сторонние оценки механизмов согласия на репликацию голоса и возможности обнаружения водяных знаков SynthID, поскольку они имеют решающее значение для обеспечения безопасности и целостности технологии.

Отслеживайте разработку редактора сценариев с двумя динамиками в Google AI Studio, поскольку эта функция представляет собой новый интерфейс для управления диалогами, создаваемыми искусственным интеллектом, что может повлиять на то, как создатели подходят к аудиорассказыванию.

Сопутствующие руководства и викторины

Объяснение моделей искусственного интеллектаЭтика ИИИИ-агентыПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.
Нашли это полезным?