Что случилось
Google DeepMind объявила о выпуске двух новых моделей преобразования текста в речь: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Эти модели доступны сразу в Google AI Studio и через API Gemini с интеграцией для таких платформ, как Agora, LiveKit и Vercel. Эта версия расширяет семейство Gemini Audio, добавляя возможности для создания пользовательских голосов персонажей и управления диалогами в сцене с точным контролем над их воспроизведением.
Google DeepMind представила Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, назвав их наиболее выразительными моделями генерации звука в семействе Gemini. В объявлении говорится, что эти модели преобразуют генерацию голоса из статических пресетов в динамичную творческую студию, позволяя создавать собственные голоса персонажей и направление диалогов в сцене.
Модели доступны с сегодняшнего дня в Google AI Studio, где они функционируют как рабочее пространство для голосового дизайна. Пользователи могут создавать новые голосовые образы с нуля или воспроизводить свои собственные голоса, а затем использовать редактор сценариев с двумя динамиками для управления построчной передачей. Доступ также предоставляется через API Gemini, что позволяет платформам разработчиков, таким как Agora, LiveKit, Pipecat и Vercel, создавать и развертывать возможности генерации речи.
Google утверждает, что Gemini 3.8 Flash TTS занимает первое место в рейтинге голосового дизайна Hume AI с результатом 71,4 и лидирует в моделировании акцента с результатом 60,8. Сообщается, что обе модели занимают первое и второе места в общем индексе качества Hume AI. По данным слепой оценки предпочтений людей на Voice Arena, модели занимают лидирующие позиции на ключевых мировых языках, включая японский, бразильский португальский, вьетнамский, современный стандартный арабский, мексиканский испанский и хинди, с поддержкой более 100 языков.
Релиз включает в себя специальные механизмы безопасности для репликации голоса, требующие от пользователей предоставить запись устного согласия владельца голоса, которая соответствует эталонному говорящему, прежде чем голос может быть создан. Кроме того, каждый аудиоклип, созданный этими моделями, имеет водяной знак SynthID — незаметный водяной знак, предназначенный для обеспечения обнаружения речи, сгенерированной искусственным интеллектом, и предотвращения дезинформации.
Подробности об источнике: deepmind.google ↗
Почему это важно
Этот запуск знаменует собой значительный сдвиг в генерации голоса ИИ от статических предустановок к динамическому, настраиваемому созданию звука. Позволяя разработчикам создавать совершенно новые голосовые идентификаторы или воспроизводить определенные голоса с проверкой согласия, эти модели открывают новые возможности для локализации мультимедиа, диалоговых агентов и создания творческого контента. Включение водяных знаков SynthID устраняет растущую обеспокоенность по поводу дезинформации звука, генерируемой искусственным интеллектом, обеспечивая техническую защиту прозрачности контента.
Внедрение этих моделей предоставляет разработчикам и предприятиям инструменты для создания более богатого и выразительного звука, не полагаясь на фиксированные голосовые настройки. Эта возможность особенно актуальна для отраслей, которым необходимы тонкие региональные акценты для локализации СМИ или последовательные голоса бренда для диалоговых агентов.
Партнерство с такими компаниями, как Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang, указывает на немедленное практическое применение в ускорении глобального дубляжа и расширении возможностей диалоговых голосовых агентов в больших масштабах. Это предполагает переход к интеграции расширенных возможностей TTS в основные творческие и корпоративные рабочие процессы.
Акцент на проверке согласия для репликации голоса и использовании водяных знаков SynthID решает критические проблемы этики и безопасности при создании звука с помощью ИИ. Эти меры защиты направлены на защиту личности ораторов и обеспечение прозрачности контента, что становится все более важным по мере того, как средства массовой информации, созданные с помощью искусственного интеллекта, становятся все более распространенными.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
crm_get_transaction(id='4092').In AI, what are a model's "parameters"?
Что посмотреть дальше
Следите за внедрением этих моделей такими компаниями-партнерами, как Figma и HeyGen, для глобального дубляжа и локализации мультимедиа. Следите за независимыми оценками средств защиты репликации голоса и эффективности водяных знаков SynthID при обнаружении речи, генерируемой искусственным интеллектом. Кроме того, обратите внимание, как редактор сценариев с двумя динамиками в Google AI Studio используется разработчиками для создания сложных звуковых повествований.
Посмотрите, как компании-партнеры интегрируют эти модели в свои продукты, особенно в области глобального дубляжа и локализации мультимедиа, чтобы оценить реальную производительность и восприятие пользователями.
Контролируйте независимые сторонние оценки механизмов согласия на репликацию голоса и возможности обнаружения водяных знаков SynthID, поскольку они имеют решающее значение для обеспечения безопасности и целостности технологии.
Отслеживайте разработку редактора сценариев с двумя динамиками в Google AI Studio, поскольку эта функция представляет собой новый интерфейс для управления диалогами, создаваемыми искусственным интеллектом, что может повлиять на то, как создатели подходят к аудиорассказыванию.