Назад до новин
ПродуктAI Understanding брифінг

Google запускає моделі Gemini 3.8 Flash TTS

Google DeepMind випустив Gemini 3.8 Flash TTS і Flash-Lite TTS, нові моделі перетворення тексту в мовлення, доступні в Google AI Studio та через API Gemini, які містять власне створення голосу та водяні знаки SynthID.

4 min readRead the primary source
Source-provided image accompanying Google launches Gemini 3.8 Flash TTS models
Першоджерельний документДжерело записано
Видавець
deepmind.google
Посилання на джерело
deepmind.googlehttps://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

API (інтерфейс прикладного програмування)
Структурований спосіб для однієї програмної системи надсилати запити до іншої системи та отримувати відповіді від неї.
Водяний знак
Вбудовування сигналу, який можна виявити, у текст або медіа, згенерований штучним інтелектом, щоб пізніше можна було ідентифікувати його як створений машиною.
Еталон
Стандартизований тест або набір даних, який використовується для вимірювання та порівняння продуктивності моделі.
Перевір себеВікторина «Пояснення моделей ШІ».

Що сталося

Google DeepMind оголосив про випуск двох нових моделей синтезу мовлення: Gemini 3.8 Flash TTS і Gemini 3.8 Flash-Lite TTS. Ці моделі доступні відразу в Google AI Studio та через Gemini API, з інтеграцією для таких платформ, як Agora, LiveKit і Vercel. Випуск розширює сімейство Gemini Audio, додаючи можливості для генерації користувальницьких голосів персонажів і керування діалогами сцен із точним контролем над доставкою.

Google DeepMind представив Gemini 3.8 Flash TTS і Gemini 3.8 Flash-Lite TTS, описуючи їх як найвиразніші моделі аудіогенерації в сімействі Gemini. У оголошенні зазначено, що ці моделі перетворюють генерацію голосу зі статичних пресетів на динамічну творчу студію, дозволяючи створювати власні голоси персонажів і керувати сценічними діалогами.

Відсьогодні моделі доступні в Google AI Studio, де вони функціонують як робочий простір для голосового дизайну. Користувачі можуть запропонувати нові вокальні ідентифікації з нуля або відтворити власні голоси, а потім використовувати редактор сценарію з подвійним динаміком, щоб керувати подачею рядків за рядками. Доступ також надається через Gemini API, що дає змогу платформам розробників, таким як Agora, LiveKit, Pipecat і Vercel, створювати та розгортати засоби генерації мовлення.

Google стверджує, що Gemini 3.8 Flash TTS займає загальне місце №1 у Voice Design Hume AI з результатом 71,4 і лідирує в моделюванні акценту з результатом 60,8. Повідомляється, що обидві моделі займають позиції №1 і №2 у загальному індексі якості Hume AI. У сліпих оцінках людських уподобань на Voice Arena говориться, що моделі займають перші позиції в ключових глобальних мовах, включаючи японську, бразильську португальську, в’єтнамську, сучасну стандартну арабську, мексиканську іспанську та хінді, з підтримкою понад 100 мов.

Випуск містить спеціальні механізми безпеки для реплікації голосу, вимагаючи від користувачів надати запис усної згоди від власника голосу, який відповідає еталонному динаміку, перш ніж можна буде створити голос. Крім того, кожен аудіокліп, згенерований цими моделями, має водяний знак SynthID, непомітний водяний знак, призначений для того, щоб мовлення, створене штучним інтелектом, залишалося видимим, щоб запобігти дезінформації.

Деталі джерела: deepmind.google

Чому це важливо

Цей запуск знаменує значний зсув у створенні голосу штучним інтелектом від статичних попередніх налаштувань до динамічного, настроюваного створення аудіо. Дозволяючи розробникам створювати абсолютно нові вокальні ідентифікації або копіювати певні голоси з перевіркою згоди, моделі відкривають нові можливості для локалізації медіа, розмовних агентів і створення творчого контенту. Включення водяних знаків SynthID усуває зростаючі занепокоєння щодо дезінформації аудіо, створеної штучним інтелектом, забезпечуючи технічну гарантію прозорості вмісту.

Представлення цих моделей надає розробникам і підприємствам інструменти для створення багатшого, виразнішого звуку, не покладаючись на фіксовані попередні налаштування голосу. Ця можливість особливо актуальна для галузей, які потребують нюансованих регіональних акцентів для локалізації медіа або послідовних голосів бренду для розмовних агентів.

Партнерство з такими компаніями, як Figma, HeyGen, Linguana, Wondercraft, 99.co і Ollang, вказує на негайне практичне застосування в прискоренні глобального дубляжу та потужності розмовних голосових агентів у масштабі. Це свідчить про рух до інтеграції розширених можливостей TTS у основні творчі та корпоративні робочі процеси.

Акцент на перевірці згоди для реплікації голосу та використання водяних знаків SynthID вирішує критичні проблеми етики та безпеки під час створення аудіо штучного інтелекту. Ці запобіжні заходи спрямовані на захист ідентичності голосового таланту та забезпечення прозорості вмісту, що стає все більш важливим, оскільки медіа, створені штучним інтелектом, стають все більш поширеними.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Інтерактивна перевірка концепції+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

Що дивитися далі

Слідкуйте за впровадженням цих моделей такими партнерськими компаніями, як Figma та HeyGen, для глобального дубляжу та локалізації медіа. Слідкуйте за незалежними оцінками захисту голосової реплікації та ефективності водяних знаків SynthID у виявленні мовлення, створеного ШІ. Крім того, подивіться, як редактор сценарію з двома динаміками в Google AI Studio використовується розробниками для створення складних аудіорозповідей.

Поспостерігайте за тим, як компанії-партнери інтегрують ці моделі у свої продукти, зокрема у сферах глобального дубляжу та локалізації медіа, щоб оцінити реальну продуктивність і сприйняття користувачами.

Відстежуйте незалежні сторонні оцінки механізмів згоди на голосову реплікацію та здатність виявляти водяні знаки SynthID, оскільки вони мають вирішальне значення для забезпечення безпеки та цілісності технології.

Слідкуйте за розробкою редактора сценарію з двома динаміками в Google AI Studio, оскільки ця функція представляє новий інтерфейс для керування діалогами, створеними штучним інтелектом, що може вплинути на підхід творців до аудіорозповіді.

Пов’язані посібники та вікторини

Пояснення моделей AIЕтика ШІАгенти ШІПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосарії
Знайшли це корисним?