Аудио РУКОВОДСТВО ПО ИИ

MusicLM: иерархические семантические и акустические токены

MusicLM — это модель преобразования текста в музыку Google, которая генерирует длинный звук с помощью иерархии семантических токенов для музыкальной структуры и акустических токенов для детальности звука.

2 минуты чтенияПоследнее обновление

Глубокое погружение

Программа MusicLM, анонсированная Google в начале 2023 года, рассматривает генерацию музыки как прогнозирование последовательностей дискретных аудиотокенов, подобно тому, как языковая модель предсказывает слова. Он использует иерархию представлений: семантические токены (из модели под названием w2v-BERT) фиксируют высокоуровневые структуры, такие как мелодия и ритм, на длинных промежутках времени, а акустические токены (из нейронного кодека SoundStream) фиксируют мелкие детали, такие как тембр и текстура. На первом этапе из текстового приглашения генерируются семантические токены, затем на последующих этапах заполняются акустические детали, обусловленные этой семантикой. Кондиционирование текста происходит от MuLM/MuLan, совместного встраивания музыки и текста, обученного таким образом, чтобы описания и аудио располагались в одном пространстве. Такой поэтапный подход позволяет MusicLM оставаться музыкально последовательным в течение нескольких минут, а не смещаться через несколько секунд.

Техническая информация

Ключевая идея — отделение структуры от текстуры в иерархии токенов. Грубые семантические токены редки и медленно изменяются, поэтому преобразователь может моделировать долгосрочную форму без огромной длины последовательности. Акустические токены являются плотными и высокоскоростными, но их нужно прогнозировать только на основе уже фиксированной семантики, что делает каждый этап управляемым. Остаточное векторное квантование SoundStream создает многоуровневые акустические коды, которые окончательный декодер преобразует обратно в сигналы частотой 24 кГц.

Стратегическое воздействие

Доступ и охват

Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.

Стоимость и бюджет

Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.

Скорость и масштаб

Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.

Будущее MusicLM: иерархические семантические и акустические токены

Подход иерархических токенов MusicLM стал шаблоном для более поздних систем, таких как MusicGen, и коммерческих музыкальных инструментов. Ожидайте более четкой обработки мелодии (напевание мелодии, получение полной аранжировки), более длинных, полностью структурированных песен с куплетами и припевами, а также лучшего контроля над инструментами и тональностью. Сложные вопросы носят юридический и этический характер: лицензирование обучающих данных, согласие исполнителя и нанесение водяных знаков на сгенерированный звук, чтобы его можно было отличить от музыки, созданной человеком, теперь занимают центральное место в развертывании.

Реальная реализация

Превращение письменного описания сцены в музыку к фильму или трейлеру, например «эпическая оркестровая композиция с хором»

Создание фоновой музыки на основе подписи к изображению или даже описания картин для художественных инсталляций.

Превращение короткой напеваемой или насвистываемой мелодии в полностью инструментальную аранжировку.

Создание разнообразных музыкальных треков в разном темпе и настроении для создателей рекламы и контента.

Риски и ограничения

Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.

Точность может снижаться из-за акцентов, диалектов или шумной обстановки.

Синтетический звук можно принять за аутентичную речь без четкой маркировки.

Дорожная карта реализации

1

Получите явное согласие на захват, клонирование и повторное использование голоса.

2

Проверьте качество звука при использовании различных динамиков и фоновых условий.

3

Определите, когда человек должен проверять или утверждать результаты.

4

Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Генерация символической музыки

Часто задаваемые вопросы

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM — это модель преобразования текста в музыку Google, которая генерирует длинный звук с помощью иерархии семантических токенов для музыкальной структуры и акустических токенов для детальности звука.

Как MusicLM принципиально подходит к задаче создания музыки?

MusicLM представляет генерацию музыки как авторегрессионное предсказание по дискретным аудио-токенам, аналогично тому, как языковая модель предсказывает слова.

Какова роль семантических токенов в MusicLM?

Семантические токены (из w2v-BERT) фиксируют грубую, медленно меняющуюся структуру, такую ​​как мелодия и ритм, на протяжении длительных промежутков времени.

Какой компонент обеспечивает тонкие акустические детали, такие как тембр и текстура?

Акустические токены поступают из нейронного кодека SoundStream и кодируют мелкие детали, такие как тембр и текстура.

Как MusicLM связывает текстовую подсказку с музыкальным звуком?

MuLan обучен так, что текстовые описания и сопоставление аудио сопоставляются с близлежащими точками в общем пространстве встраивания, что позволяет кондиционировать текст.

Почему иерархический, поэтапный дизайн помогает в долгосрочной структуре?

Разреженные семантические токены изменяются медленно, поэтому Transformer может эффективно моделировать долгосрочную форму до того, как будут заполнены плотные акустические детали.