Що сталося
Google DeepMind оголосив про випуск двох нових моделей синтезу мовлення: Gemini 3.8 Flash TTS і Gemini 3.8 Flash-Lite TTS. Ці моделі доступні відразу в Google AI Studio та через Gemini API, з інтеграцією для таких платформ, як Agora, LiveKit і Vercel. Випуск розширює сімейство Gemini Audio, додаючи можливості для генерації користувальницьких голосів персонажів і керування діалогами сцен із точним контролем над доставкою.
Google DeepMind представив Gemini 3.8 Flash TTS і Gemini 3.8 Flash-Lite TTS, описуючи їх як найвиразніші моделі аудіогенерації в сімействі Gemini. У оголошенні зазначено, що ці моделі перетворюють генерацію голосу зі статичних пресетів на динамічну творчу студію, дозволяючи створювати власні голоси персонажів і керувати сценічними діалогами.
Відсьогодні моделі доступні в Google AI Studio, де вони функціонують як робочий простір для голосового дизайну. Користувачі можуть запропонувати нові вокальні ідентифікації з нуля або відтворити власні голоси, а потім використовувати редактор сценарію з подвійним динаміком, щоб керувати подачею рядків за рядками. Доступ також надається через Gemini API, що дає змогу платформам розробників, таким як Agora, LiveKit, Pipecat і Vercel, створювати та розгортати засоби генерації мовлення.
Google стверджує, що Gemini 3.8 Flash TTS займає загальне місце №1 у Voice Design Hume AI з результатом 71,4 і лідирує в моделюванні акценту з результатом 60,8. Повідомляється, що обидві моделі займають позиції №1 і №2 у загальному індексі якості Hume AI. У сліпих оцінках людських уподобань на Voice Arena говориться, що моделі займають перші позиції в ключових глобальних мовах, включаючи японську, бразильську португальську, в’єтнамську, сучасну стандартну арабську, мексиканську іспанську та хінді, з підтримкою понад 100 мов.
Випуск містить спеціальні механізми безпеки для реплікації голосу, вимагаючи від користувачів надати запис усної згоди від власника голосу, який відповідає еталонному динаміку, перш ніж можна буде створити голос. Крім того, кожен аудіокліп, згенерований цими моделями, має водяний знак SynthID, непомітний водяний знак, призначений для того, щоб мовлення, створене штучним інтелектом, залишалося видимим, щоб запобігти дезінформації.
Деталі джерела: deepmind.google ↗
Чому це важливо
Цей запуск знаменує значний зсув у створенні голосу штучним інтелектом від статичних попередніх налаштувань до динамічного, настроюваного створення аудіо. Дозволяючи розробникам створювати абсолютно нові вокальні ідентифікації або копіювати певні голоси з перевіркою згоди, моделі відкривають нові можливості для локалізації медіа, розмовних агентів і створення творчого контенту. Включення водяних знаків SynthID усуває зростаючі занепокоєння щодо дезінформації аудіо, створеної штучним інтелектом, забезпечуючи технічну гарантію прозорості вмісту.
Представлення цих моделей надає розробникам і підприємствам інструменти для створення багатшого, виразнішого звуку, не покладаючись на фіксовані попередні налаштування голосу. Ця можливість особливо актуальна для галузей, які потребують нюансованих регіональних акцентів для локалізації медіа або послідовних голосів бренду для розмовних агентів.
Партнерство з такими компаніями, як Figma, HeyGen, Linguana, Wondercraft, 99.co і Ollang, вказує на негайне практичне застосування в прискоренні глобального дубляжу та потужності розмовних голосових агентів у масштабі. Це свідчить про рух до інтеграції розширених можливостей TTS у основні творчі та корпоративні робочі процеси.
Акцент на перевірці згоди для реплікації голосу та використання водяних знаків SynthID вирішує критичні проблеми етики та безпеки під час створення аудіо штучного інтелекту. Ці запобіжні заходи спрямовані на захист ідентичності голосового таланту та забезпечення прозорості вмісту, що стає все більш важливим, оскільки медіа, створені штучним інтелектом, стають все більш поширеними.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
crm_get_transaction(id='4092').In AI, what are a model's "parameters"?
Що дивитися далі
Слідкуйте за впровадженням цих моделей такими партнерськими компаніями, як Figma та HeyGen, для глобального дубляжу та локалізації медіа. Слідкуйте за незалежними оцінками захисту голосової реплікації та ефективності водяних знаків SynthID у виявленні мовлення, створеного ШІ. Крім того, подивіться, як редактор сценарію з двома динаміками в Google AI Studio використовується розробниками для створення складних аудіорозповідей.
Поспостерігайте за тим, як компанії-партнери інтегрують ці моделі у свої продукти, зокрема у сферах глобального дубляжу та локалізації медіа, щоб оцінити реальну продуктивність і сприйняття користувачами.
Відстежуйте незалежні сторонні оцінки механізмів згоди на голосову реплікацію та здатність виявляти водяні знаки SynthID, оскільки вони мають вирішальне значення для забезпечення безпеки та цілісності технології.
Слідкуйте за розробкою редактора сценарію з двома динаміками в Google AI Studio, оскільки ця функція представляє новий інтерфейс для керування діалогами, створеними штучним інтелектом, що може вплинути на підхід творців до аудіорозповіді.