VALL-E и языковые модели кодеков
VALL-E переосмыслил преобразование текста в речь как проблему языкового моделирования с помощью токенов аудиокодеков, что позволило клонировать голос всего за три секунды фрагмента.
Обзор
It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.
Глубокое погружение
VALL-E, анонсированный Microsoft в начале 2023 года, рассматривает синтез речи как моделирование языка. Вместо прогнозирования спектрограммы он прогнозирует дискретные акустические токены нейронного кодека (EnCodec), поэтому генерация становится прогнозированием следующего токена по звуковому словарю. Учитывая 3-секундную запись невидимого говорящего плюс целевой текст, VALL-E продолжает говорить голосом этого говорящего, сохраняя тембр и даже акустическую среду. Он обучался примерно на 60 000 часах речи, что значительно больше, чем на типичных наборах данных TTS, что дало ему надежное клонирование с нулевым выстрелом. Поскольку токены кодека являются многоуровневыми (через RVQ), VALL-E использует два этапа: авторегрессионная модель прогнозирует первый, грубый поток токенов, обусловленный подсказкой, а неавторегрессионная модель заполняет оставшиеся подробные токены. Этот рецепт кодека-LM вдохновил его преемников, таких как VALL-E 2, и многих моделей речевой основы.
Техническая информация
Хитрость заключается в гибридном декодировании по токенам иерархического кодека. На этапе авторегрессии по одному прогнозируются наиболее важные токены первой кодовой книги, фиксируя просодию и содержание. Остальные кодовые книги, которые добавляют мелкие акустические детали, прогнозируются параллельно с помощью неавторегрессионной модели, обусловленной первым потоком и подсказкой говорящего. Такое разделение обеспечивает высокое качество, избегая при этом затрат на последовательную генерацию каждого токена, а использование кодека означает, что речь и текст можно моделировать с помощью одного и того же преобразователя.
Стратегическое воздействие
Доступ и охват
Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.
Стоимость и бюджет
Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.
Скорость и масштаб
Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.
Будущее VALL-E и языковых моделей кодеков
Языковые модели кодеков объединяют речь с большими языковыми моделями, указывая на унифицированные системы, которые слушают, рассуждают и говорят в одной модели. Ожидайте большей стабильности и меньшего количества артефактов, создания потоковой передачи в реальном времени и более жесткого контроля над эмоциями и стилем. То же мощное клонирование, которое делает VALL-E полезным для обеспечения доступности и дублирования, также вызывает проблемы с дипфейками и согласием, поэтому водяные знаки, средства проверки голоса и политические ограничения становятся центральной частью развертывания этих систем.
Реальная реализация
Клонирование голоса из нескольких секунд аудио для персонализированных помощников или инструментов специальных возможностей, которые восстанавливают потерянный голос.
Локализация и дубляж видео на другие языки с сохранением тембра оригинального диктора
Создание выразительного, контекстно-зависимого повествования, сохраняющего акустическую среду записи.
Служит речевой основой в мультимодальных помощниках, которые одновременно понимают и воспроизводят разговорный звук.
Риски и ограничения
Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.
Точность может снижаться из-за акцентов, диалектов или шумной обстановки.
Синтетический звук можно принять за аутентичную речь без четкой маркировки.
Дорожная карта реализации
Получите явное согласие на захват, клонирование и повторное использование голоса.
Проверьте качество звука при использовании различных динамиков и фоновых условий.
Определите, когда человек должен проверять или утверждать результаты.
Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VALL-E and Codec Language Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Новые возможности больших языковых моделей
Часто задаваемые вопросы
What is VALL-E and Codec Language Models?
VALL-E переосмыслил преобразование текста в речь как проблему языкового моделирования с помощью токенов аудиокодеков, что позволило клонировать голос всего за три секунды фрагмента. Оно показало, что одни и те же текстовые LLM с предсказанием следующего токена могут генерировать удивительно естественную и выразительную речь.
Какая основная идея отличает VALL-E от более ранних систем преобразования текста в речь?
VALL-E переосмысливает TTS как предсказание следующего токена по дискретным токенам аудиокодека, рассматривая генерацию речи как языковую модель.
Сколько эталонного звука нужно VALL-E для клонирования голоса нового говорящего?
VALL-E может выполнять нулевое клонирование голоса из примерно 3-секундного сэмпла невидимого говорящего.
Какой нейронный кодек использует VALL-E для создания аудиотокенов?
VALL-E основан на EnCodec Meta, предсказывая его дискретные акустические токены для синтеза речи.
Почему ВАЛЛ-Э использует как авторегрессионную, так и неавторегрессивную стадию?
Токены кодека имеют иерархическую структуру через RVQ; VALL-E прогнозирует первый грубый поток авторегрессионно, а остальные подробные токены параллельно для повышения эффективности.
На каком примерно объеме речевых данных был обучен VALL-E, что позволило обеспечить надежное клонирование с нулевым выстрелом?
VALL-E обучался примерно на 60 000 часов речи, что намного больше, чем на типичных наборах данных TTS, что повысило его обобщение с нулевым выстрелом.