Аудіо AI GUIDE

AI Voice Design з текстових описів

ШІ-дизайн голосу створює абсолютно новий синтетичний голос із письмового опису, як-от «теплий літній оповідач із легким хрипом», замість копіювання записів реальної людини.

  • 4 хвилини читання
  • Останнє оновлення
На цій сторінці4 хвилини читання
  1. Огляд
  2. Глибоке занурення
  3. Стратегічний вплив
  4. Майбутнє AI Voice Design на основі текстових описів
  5. Реалізація в реальному світі
  6. Ризики та огорожі
  7. Дорожня карта впровадження
  8. Продовжуйте досліджувати
  9. Часті запитання

Огляд

Він відрізняється від клонування голосу, яке відтворює певного динаміка за зразком аудіо. Це важливо, тому що творці можуть отримати характерні голоси для аудіокниг, ігор і програм, не клонуючи чиюсь особу, хоча розроблені голоси все одно потребують догляду та розголошення.

Глибоке занурення

Клонування голосу та дизайн голосу вирішують різні проблеми. Клонування бере еталонне аудіо певної особи та обумовлює модель перетворення тексту в мовлення на характеристики цього динаміка, щоб результат звучав як вони. Дизайн голосу починається зі слів. Система відображає опис віку, гендерної презентації, висоти, акценту, темпу, текстури та настрою на голос, якого раніше не існувало. Найважче – це навчальні дані. Щоб дізнатися, як описи пов’язані з голосами, моделі потрібна велика кількість мови в поєднанні з описами, а ручне маркування тисяч годин коштує дорого. Стаття 2024 року від Stability AI та Единбурзького університету показала обхідний шлях. Він автоматично вимірював такі атрибути, як висота звуку, швидкість мовлення, шум і реверберація, об’єднував їх із мітками динаміків, а мовна модель перетворювала їх на природно звучачі описи. Parler-TTS з відкритим кодом Hugging Face побудовано на цьому підході. Комерційні інструменти, такі як функція Voice Design ElevenLabs, генерують кілька голосів-кандидатів із підказки та дозволяють користувачам зберегти той, який їм подобається. Це допомагає відокремити ідентичність голосу (тембр, діапазон висоти, акцент) від подачі (емоції, темп, акцент). Деякі системи, такі як керовані моделі TTS OpenAI, дозволяють вам вказувати, як повинен говорити попередньо встановлений голос, що змінює подачу, але не створює нову ідентифікацію. Голосовий дизайн створює особистість. Обмеження реальні. Описи нечіткі, оскільки «теплий» означає різні речі для різних людей. Двічі генерувати з одного підказки зазвичай дають різні голоси. Акценти та вік, які рідко зустрічаються в навчальних даних, передаються менш переконливо. Поширеною помилкою є те, що створений голос ні на кого не схожий. Випадково це може звучати близько до реальної людини, і багато сервісів блокують підказки з іменами реальних людей. Розроблені голоси дозволяють уникнути більшості проблем із згодою клонування, але розкриття того, що аудіо є синтетичним, все одно має значення.

Стратегічний вплив

Доступ і охоплення

Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.

Вартість і бюджет

Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.

Швидкість і масштаб

Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.

Майбутнє AI Voice Design на основі текстових описів

Очікуйте більш точного контролю, наприклад, коригування створеного голосу вздовж повзунків за віком або диханням, кращої обробки недостатньо представлених акцентів і мов, а також більш жорсткого поділу між ідентичністю та доставкою. Ймовірно, також продовжуватимуть розвиватися заходи безпеки: фільтри, які блокують підказки щодо імен реальних людей, перевірка схожості з відомими голосами та водяні знаки аудіо або метадані про походження. Юридична обробка голосів, які лише нагадують реальну особу, не врегульована та відрізняється залежно від юрисдикції, тому професійні користувачі повинні зберігати документацію про те, як був створений голос.

Реалізація в реальному світі

Ігрова студія створює прототип персонажа, запрошуючи вередливого, повільно розмовляючого коваля середнього віку, а потім використовує чернетку голосу в ігрових тестах, перш ніж вирішити, чи вибрати людину-актора.

Виробник аудіокниги генерує кілька попередніх переглядів від «спокійної жінки-оповідачки років тридцяти з нейтральним акцентом, неквапливим темпом», вибирає один і зберігає його, щоб у кожному розділі звучав той самий голос.

Розробник використовує модель Parler-TTS з відкритим вихідним кодом із підказкою, яка описує мовця, який швидко розмовляє в тихій кімнаті, контролюючи як голос, так і умови запису за допомогою тексту.

Людина, яка використовує пристрій для генерування мови та не має записів власного голосу, створює такий, який відповідає її віку та регіональному акценту, замість того, щоб використовувати загальний голос за замовчуванням.

Ризики та огорожі

  • Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.

  • Точність може впасти через акценти, діалекти чи шумне середовище.

  • Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.

Дорожня карта впровадження

  1. Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.

  2. Перевірте якість на різних динаміках і фонових умовах.

  3. Визначте, коли людина повинна переглядати або затверджувати результати.

  4. Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI Voice Design from Text Descriptions quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часті запитання

Що таке AI Voice Design з текстових описів?

ШІ-дизайн голосу створює абсолютно новий синтетичний голос із письмового опису, як-от «теплий літній оповідач із легким хрипом», замість копіювання записів реальної людини. Він відрізняється від клонування голосу, яке відтворює певного динаміка за зразком аудіо. Це важливо, тому що творці можуть отримати характерні голоси для аудіокниг, ігор і програм, не клонуючи чиюсь особу, хоча розроблені голоси все одно потребують догляду та розголошення.

Яка основна відмінність між дизайном голосу та клонуванням голосу?

Умови клонування на записах реальної людини. Дизайн відображає письмовий опис на голос, якого раніше не існувало.

Чому навчальні дані є серйозною проблемою для моделей голосового дизайну?

Щоб дізнатися, як слова співвідносяться з голосами, потрібно багато пар мовлення-опис, і написання їх від руки не масштабується.

Як 2024 Stability AI та Единбурзький підхід створили описи в масштабі?

Виміряні атрибути були автоматично перетворені в описи природною мовою, що дозволило уникнути великомасштабного маркування вручну.

Що головним чином змінює вказівка, яка наказує попередньо встановленому голосу звучати більш збуджено?

Емоції керування або темп впливають на доставку. Ідентичність голосу, як-от його тембр і діапазон висоти, залишається незмінною.

Чому два покоління з одного опису можуть створювати різні голоси?

Опис відповідає багатьом можливим голосам, тому без фіксованого початкового числа або збереженого вбудовування кожен запуск виконується іншим зразком.