ДаліНаступний посібник
Відношення Вилучення з тексту
ШІ мови
Аудіо AI GUIDE
ШІ-дизайн голосу створює абсолютно новий синтетичний голос із письмового опису, як-от «теплий літній оповідач із легким хрипом», замість копіювання записів реальної людини.
Він відрізняється від клонування голосу, яке відтворює певного динаміка за зразком аудіо. Це важливо, тому що творці можуть отримати характерні голоси для аудіокниг, ігор і програм, не клонуючи чиюсь особу, хоча розроблені голоси все одно потребують догляду та розголошення.
Клонування голосу та дизайн голосу вирішують різні проблеми. Клонування бере еталонне аудіо певної особи та обумовлює модель перетворення тексту в мовлення на характеристики цього динаміка, щоб результат звучав як вони. Дизайн голосу починається зі слів. Система відображає опис віку, гендерної презентації, висоти, акценту, темпу, текстури та настрою на голос, якого раніше не існувало. Найважче – це навчальні дані. Щоб дізнатися, як описи пов’язані з голосами, моделі потрібна велика кількість мови в поєднанні з описами, а ручне маркування тисяч годин коштує дорого. Стаття 2024 року від Stability AI та Единбурзького університету показала обхідний шлях. Він автоматично вимірював такі атрибути, як висота звуку, швидкість мовлення, шум і реверберація, об’єднував їх із мітками динаміків, а мовна модель перетворювала їх на природно звучачі описи. Parler-TTS з відкритим кодом Hugging Face побудовано на цьому підході. Комерційні інструменти, такі як функція Voice Design ElevenLabs, генерують кілька голосів-кандидатів із підказки та дозволяють користувачам зберегти той, який їм подобається. Це допомагає відокремити ідентичність голосу (тембр, діапазон висоти, акцент) від подачі (емоції, темп, акцент). Деякі системи, такі як керовані моделі TTS OpenAI, дозволяють вам вказувати, як повинен говорити попередньо встановлений голос, що змінює подачу, але не створює нову ідентифікацію. Голосовий дизайн створює особистість. Обмеження реальні. Описи нечіткі, оскільки «теплий» означає різні речі для різних людей. Двічі генерувати з одного підказки зазвичай дають різні голоси. Акценти та вік, які рідко зустрічаються в навчальних даних, передаються менш переконливо. Поширеною помилкою є те, що створений голос ні на кого не схожий. Випадково це може звучати близько до реальної людини, і багато сервісів блокують підказки з іменами реальних людей. Розроблені голоси дозволяють уникнути більшості проблем із згодою клонування, але розкриття того, що аудіо є синтетичним, все одно має значення.
Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.
Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.
Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.
Очікуйте більш точного контролю, наприклад, коригування створеного голосу вздовж повзунків за віком або диханням, кращої обробки недостатньо представлених акцентів і мов, а також більш жорсткого поділу між ідентичністю та доставкою. Ймовірно, також продовжуватимуть розвиватися заходи безпеки: фільтри, які блокують підказки щодо імен реальних людей, перевірка схожості з відомими голосами та водяні знаки аудіо або метадані про походження. Юридична обробка голосів, які лише нагадують реальну особу, не врегульована та відрізняється залежно від юрисдикції, тому професійні користувачі повинні зберігати документацію про те, як був створений голос.
Ігрова студія створює прототип персонажа, запрошуючи вередливого, повільно розмовляючого коваля середнього віку, а потім використовує чернетку голосу в ігрових тестах, перш ніж вирішити, чи вибрати людину-актора.
Виробник аудіокниги генерує кілька попередніх переглядів від «спокійної жінки-оповідачки років тридцяти з нейтральним акцентом, неквапливим темпом», вибирає один і зберігає його, щоб у кожному розділі звучав той самий голос.
Розробник використовує модель Parler-TTS з відкритим вихідним кодом із підказкою, яка описує мовця, який швидко розмовляє в тихій кімнаті, контролюючи як голос, так і умови запису за допомогою тексту.
Людина, яка використовує пристрій для генерування мови та не має записів власного голосу, створює такий, який відповідає її віку та регіональному акценту, замість того, щоб використовувати загальний голос за замовчуванням.
Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.
Точність може впасти через акценти, діалекти чи шумне середовище.
Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.
Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.
Перевірте якість на різних динаміках і фонових умовах.
Визначте, коли людина повинна переглядати або затверджувати результати.
Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ШІ-дизайн голосу створює абсолютно новий синтетичний голос із письмового опису, як-от «теплий літній оповідач із легким хрипом», замість копіювання записів реальної людини. Він відрізняється від клонування голосу, яке відтворює певного динаміка за зразком аудіо. Це важливо, тому що творці можуть отримати характерні голоси для аудіокниг, ігор і програм, не клонуючи чиюсь особу, хоча розроблені голоси все одно потребують догляду та розголошення.
Умови клонування на записах реальної людини. Дизайн відображає письмовий опис на голос, якого раніше не існувало.
Щоб дізнатися, як слова співвідносяться з голосами, потрібно багато пар мовлення-опис, і написання їх від руки не масштабується.
Виміряні атрибути були автоматично перетворені в описи природною мовою, що дозволило уникнути великомасштабного маркування вручну.
Емоції керування або темп впливають на доставку. Ідентичність голосу, як-от його тембр і діапазон висоти, залишається незмінною.
Опис відповідає багатьом можливим голосам, тому без фіксованого початкового числа або збереженого вбудовування кожен запуск виконується іншим зразком.
Продовжуйте вчитися
Інші посібники, вибрані для цієї теми
ДаліНаступний посібник
Відношення Вилучення з тексту
ШІ мови