Аудио РУКОВОДСТВО ПО ИИ

Голосовой дизайн AI на основе текстовых описаний

Дизайн голоса с помощью искусственного интеллекта создает совершенно новый синтетический голос на основе письменного описания, например «теплый рассказчик пожилого мужчины с легким скрежетом», вместо копирования записей реального человека.

  • 4 минуты чтения
  • Последнее обновление
На этой странице4 минуты чтения
  1. Обзор
  2. Глубокое погружение
  3. Стратегическое воздействие
  4. Будущее AI-дизайна голоса на основе текстовых описаний
  5. Реальная реализация
  6. Риски и ограничения
  7. Дорожная карта реализации
  8. Продолжайте исследовать
  9. Часто задаваемые вопросы

Обзор

Он отличается от клонирования голоса, которое воспроизводит конкретного говорящего из образца звука. Это важно, поскольку авторы могут получить отличительные голоса для аудиокниг, игр и приложений, не клонируя чью-либо личность, хотя созданные голоса по-прежнему нуждаются в заботе и раскрытии.

Глубокое погружение

Клонирование голоса и дизайн голоса решают разные проблемы. Клонирование берет эталонный звук конкретного человека и согласовывает модель преобразования текста в речь с характеристиками этого говорящего, поэтому выходные данные звучат так же, как они. Голосовой дизайн начинается со слов. Система сопоставляет описание возраста, пола, высоты тона, акцента, темпа, текстуры и настроения голосу, которого ранее не существовало. Самое сложное — это обучающие данные. Чтобы узнать, как описания связаны с голосами, модели требуется большое количество речи в сочетании с описаниями, а ручная маркировка требует больших затрат. В статье Stability AI и Эдинбургского университета от 2024 года был показан обходной путь. Он автоматически измерял такие атрибуты, как высота тона, скорость речи, шум и реверберация, объединял их с названиями говорящих, а языковая модель превращала их в естественно звучащие описания. Parler-TTS с открытым исходным кодом Hugging Face построен на этом подходе. Коммерческие инструменты, такие как функция голосового дизайна ElevenLabs, генерируют несколько голосов-кандидатов из подсказки и позволяют пользователям сохранять тот, который им нравится. Это помогает отделить голосовую индивидуальность (тембр, диапазон высоты тона, акцент) от подачи (эмоции, темп, акцент). Некоторые системы, такие как управляемые модели TTS OpenAI, позволяют вам указать, как должен говорить заданный голос, что меняет подачу, но не создает новую личность. Голосовой дизайн сам создает идентичность. Ограничения реальны. Описания расплывчаты, поскольку слово «теплый» для разных людей означает разные вещи. Генерация дважды из одного и того же приглашения обычно дает разные голоса. Акценты и возраст, которые редко встречаются в данных обучения, отображаются менее убедительно. Распространенное заблуждение состоит в том, что созданный голос не может быть ни на кого похож. Случайно это может звучать как имя реального человека, и многие сервисы блокируют запросы, в которых упоминаются имена реальных людей. Созданные голоса позволяют избежать большинства проблем с согласием, связанных с клонированием, но раскрытие того, что звук является синтетическим, по-прежнему имеет значение.

Стратегическое воздействие

Доступ и охват

Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.

Стоимость и бюджет

Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.

Скорость и масштаб

Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.

Будущее AI-дизайна голоса на основе текстовых описаний

Ожидайте более точного контроля, такого как настройка заданного голоса с помощью ползунков по возрасту или хриплости, лучшую обработку недостаточно представленных акцентов и языков, а также более четкое разделение между идентичностью и доставкой. Меры безопасности, вероятно, тоже будут развиваться: фильтры, блокирующие подсказки об именах реальных людей, проверки на сходство с известными голосами, а также звуковые водяные знаки или метаданные о происхождении. Юридическое отношение к голосам, которые просто напоминают реального человека, не урегулировано и различается в зависимости от юрисдикции, поэтому профессиональные пользователи должны хранить документацию о том, как был создан голос.

Реальная реализация

Игровая студия создает прототип персонажа, предлагая грубоватого, медленно говорящего кузнеца средних лет, затем использует черновой голос в игровых тестах, прежде чем решить, брать ли на роль актера-человека.

Продюсер аудиокниги создает несколько превью «спокойной женщины-рассказчика лет тридцати с нейтральным акцентом, неторопливым темпом», выбирает одну и сохраняет ее, чтобы в каждой главе использовался один и тот же голос.

Разработчик использует модель Parler-TTS с открытым исходным кодом, в которой подсказка описывает говорящего, который быстро говорит в тихой комнате, контролируя как голос, так и условия записи с помощью текста.

Человек, который использует устройство, генерирующее речь, и не имеет записей собственного голоса, разрабатывает устройство, соответствующее его возрасту и региональному акценту, вместо использования общего стандартного устройства.

Риски и ограничения

  • Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.

  • Точность может снижаться из-за акцентов, диалектов или шумной обстановки.

  • Синтетический звук можно принять за аутентичную речь без четкой маркировки.

Дорожная карта реализации

  1. Получите явное согласие на захват, клонирование и повторное использование голоса.

  2. Проверьте качество звука при использовании различных динамиков и фоновых условий.

  3. Определите, когда человек должен проверять или утверждать результаты.

  4. Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AI Voice Design from Text Descriptions quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часто задаваемые вопросы

Что такое голосовой дизайн AI на основе текстовых описаний?

Дизайн голоса с помощью искусственного интеллекта создает совершенно новый синтетический голос на основе письменного описания, например «теплый рассказчик пожилого мужчины с легким скрежетом», вместо копирования записей реального человека. Он отличается от клонирования голоса, которое воспроизводит конкретного говорящего из образца звука. Это важно, поскольку авторы могут получить отличительные голоса для аудиокниг, игр и приложений, не клонируя чью-либо личность, хотя созданные голоса по-прежнему нуждаются в заботе и раскрытии.

В чем основная разница между голосовым дизайном и клонированием голоса?

Условия клонирования записей реального человека. Дизайн сопоставляет письменное описание голосу, которого раньше не существовало.

Почему данные обучения являются серьезной проблемой для моделей голосового дизайна?

Для изучения того, как слова соотносятся с голосами, требуется множество пар речевых описаний, и их написание вручную не масштабируется.

Как подход Stability AI 2024 года и Эдинбургский подход позволили создать масштабные описания?

Измеренные атрибуты были автоматически преобразованы в описания на естественном языке, что позволило избежать крупномасштабной ручной маркировки.

Инструкция, которая заставляет заранее заданный голос звучать более возбужденно, что в основном меняет?

Управление эмоциями или темпом влияет на доставку. Свойства голоса, такие как его тембр и диапазон высоты, остаются прежними.

Почему два поколения одного и того же описания могут давать разные голоса?

Описание соответствует множеству возможных голосов, поэтому без фиксированного начального числа или сохраненного внедрения каждый прогон выбирает другой.