ДалееСледующее руководство
Извлечение отношений из текста
Языковой ИИ
Аудио РУКОВОДСТВО ПО ИИ
Дизайн голоса с помощью искусственного интеллекта создает совершенно новый синтетический голос на основе письменного описания, например «теплый рассказчик пожилого мужчины с легким скрежетом», вместо копирования записей реального человека.
Он отличается от клонирования голоса, которое воспроизводит конкретного говорящего из образца звука. Это важно, поскольку авторы могут получить отличительные голоса для аудиокниг, игр и приложений, не клонируя чью-либо личность, хотя созданные голоса по-прежнему нуждаются в заботе и раскрытии.
Клонирование голоса и дизайн голоса решают разные проблемы. Клонирование берет эталонный звук конкретного человека и согласовывает модель преобразования текста в речь с характеристиками этого говорящего, поэтому выходные данные звучат так же, как они. Голосовой дизайн начинается со слов. Система сопоставляет описание возраста, пола, высоты тона, акцента, темпа, текстуры и настроения голосу, которого ранее не существовало. Самое сложное — это обучающие данные. Чтобы узнать, как описания связаны с голосами, модели требуется большое количество речи в сочетании с описаниями, а ручная маркировка требует больших затрат. В статье Stability AI и Эдинбургского университета от 2024 года был показан обходной путь. Он автоматически измерял такие атрибуты, как высота тона, скорость речи, шум и реверберация, объединял их с названиями говорящих, а языковая модель превращала их в естественно звучащие описания. Parler-TTS с открытым исходным кодом Hugging Face построен на этом подходе. Коммерческие инструменты, такие как функция голосового дизайна ElevenLabs, генерируют несколько голосов-кандидатов из подсказки и позволяют пользователям сохранять тот, который им нравится. Это помогает отделить голосовую индивидуальность (тембр, диапазон высоты тона, акцент) от подачи (эмоции, темп, акцент). Некоторые системы, такие как управляемые модели TTS OpenAI, позволяют вам указать, как должен говорить заданный голос, что меняет подачу, но не создает новую личность. Голосовой дизайн сам создает идентичность. Ограничения реальны. Описания расплывчаты, поскольку слово «теплый» для разных людей означает разные вещи. Генерация дважды из одного и того же приглашения обычно дает разные голоса. Акценты и возраст, которые редко встречаются в данных обучения, отображаются менее убедительно. Распространенное заблуждение состоит в том, что созданный голос не может быть ни на кого похож. Случайно это может звучать как имя реального человека, и многие сервисы блокируют запросы, в которых упоминаются имена реальных людей. Созданные голоса позволяют избежать большинства проблем с согласием, связанных с клонированием, но раскрытие того, что звук является синтетическим, по-прежнему имеет значение.
Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.
Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.
Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.
Ожидайте более точного контроля, такого как настройка заданного голоса с помощью ползунков по возрасту или хриплости, лучшую обработку недостаточно представленных акцентов и языков, а также более четкое разделение между идентичностью и доставкой. Меры безопасности, вероятно, тоже будут развиваться: фильтры, блокирующие подсказки об именах реальных людей, проверки на сходство с известными голосами, а также звуковые водяные знаки или метаданные о происхождении. Юридическое отношение к голосам, которые просто напоминают реального человека, не урегулировано и различается в зависимости от юрисдикции, поэтому профессиональные пользователи должны хранить документацию о том, как был создан голос.
Игровая студия создает прототип персонажа, предлагая грубоватого, медленно говорящего кузнеца средних лет, затем использует черновой голос в игровых тестах, прежде чем решить, брать ли на роль актера-человека.
Продюсер аудиокниги создает несколько превью «спокойной женщины-рассказчика лет тридцати с нейтральным акцентом, неторопливым темпом», выбирает одну и сохраняет ее, чтобы в каждой главе использовался один и тот же голос.
Разработчик использует модель Parler-TTS с открытым исходным кодом, в которой подсказка описывает говорящего, который быстро говорит в тихой комнате, контролируя как голос, так и условия записи с помощью текста.
Человек, который использует устройство, генерирующее речь, и не имеет записей собственного голоса, разрабатывает устройство, соответствующее его возрасту и региональному акценту, вместо использования общего стандартного устройства.
Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.
Точность может снижаться из-за акцентов, диалектов или шумной обстановки.
Синтетический звук можно принять за аутентичную речь без четкой маркировки.
Получите явное согласие на захват, клонирование и повторное использование голоса.
Проверьте качество звука при использовании различных динамиков и фоновых условий.
Определите, когда человек должен проверять или утверждать результаты.
Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Дизайн голоса с помощью искусственного интеллекта создает совершенно новый синтетический голос на основе письменного описания, например «теплый рассказчик пожилого мужчины с легким скрежетом», вместо копирования записей реального человека. Он отличается от клонирования голоса, которое воспроизводит конкретного говорящего из образца звука. Это важно, поскольку авторы могут получить отличительные голоса для аудиокниг, игр и приложений, не клонируя чью-либо личность, хотя созданные голоса по-прежнему нуждаются в заботе и раскрытии.
Условия клонирования записей реального человека. Дизайн сопоставляет письменное описание голосу, которого раньше не существовало.
Для изучения того, как слова соотносятся с голосами, требуется множество пар речевых описаний, и их написание вручную не масштабируется.
Измеренные атрибуты были автоматически преобразованы в описания на естественном языке, что позволило избежать крупномасштабной ручной маркировки.
Управление эмоциями или темпом влияет на доставку. Свойства голоса, такие как его тембр и диапазон высоты, остаются прежними.
Описание соответствует множеству возможных голосов, поэтому без фиксированного начального числа или сохраненного внедрения каждый прогон выбирает другой.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Извлечение отношений из текста
Языковой ИИ