Аудио AI РЪКОВОДСТВО

MusicLM: Йерархични семантични и акустични токени

MusicLM е моделът за преобразуване на текст към музика на Google, който генерира аудио в дълга форма чрез йерархия от семантични токени за музикална структура и акустични токени за детайлност на звука.

2 min readПоследна актуализация

Дълбоко гмуркане

Обявен от Google Research в началото на 2023 г., MusicLM рамкира генерирането на музика като предсказващи поредици от отделни аудио токени, подобно на езиков модел предсказва думи. Той използва йерархия от представяния: семантичните токени (от модел, наречен w2v-BERT) улавят структура от високо ниво като мелодия и ритъм за дълги интервали, докато акустичните токени (от невронния кодек SoundStream) улавят фини детайли като тембър и текстура. Първият етап генерира семантични токени от текстовата подкана, след което по-късните етапи попълват акустични детайли, обусловени от тази семантика. Кондиционирането на текст идва от MuLM/MuLan, съвместно вграждане на музика и текст, обучено така, че описанията и аудиото да са в едно и също пространство. Този поетапен подход позволява на MusicLM да остане музикално постоянен в продължение на минути, вместо да се отклонява след няколко секунди.

Техническа информация

Ключовата идея е отделяне на структурата от текстурата в йерархията на токени. Грубите семантични токени са редки и бавно променящи се, така че Transformer може да моделира дългосрочна форма без огромна дължина на последователността. Акустичните токени са плътни и високоскоростни, но те трябва да бъдат предвидени само въз основа на вече фиксираната семантика, което прави всеки етап проследим. Остатъчното векторно квантуване на SoundStream произвежда наслоени акустични кодове, които крайният декодер превръща обратно в 24 kHz вълнови форми.

Стратегическо въздействие

Access and reach

Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.

Cost and budget

Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.

Speed and scale

Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.

Бъдещето на MusicLM: йерархични семантични и акустични токени

Йерархичният токен подход на MusicLM стана шаблон за по-късни системи като MusicGen и комерсиални музикални инструменти. Очаквайте по-строги условия на мелодията (тананикайте си мелодия, получете пълен аранжимент), по-дълги напълно структурирани песни със стихове и припеви и по-добро управление върху инструменти и тон. Трудните проблеми са правни и етични: лицензирането на данни за обучение, съгласието на изпълнител и генерираното аудио с водни знаци, така че да може да се разграничи от създадената от човека музика, сега са централни за внедряването.

Внедряване в реалния свят

Превръщане на писмено описание на сцена в музика за филм или трейлър, напр. „епична оркестрова конструкция с хор“

Генериране на фонова музика, обусловена от надпис на изображение или дори описания на картини за арт инсталации

Разширяване на кратка тананикаща или подсвирквана мелодия в напълно инструментален аранжимент

Произвеждане на разнообразни музикални записи с различни темпа и настроения за създатели на реклами и съдържание

Рискове и предпазни огради

Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.

Точността може да спадне при акценти, диалекти или шумна среда.

Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.

Пътна карта за изпълнение

1

Получете изрично съгласие за улавяне на глас, клониране и повторно използване.

2

Тествайте качеството при различни високоговорители и фонови условия.

3

Определете кога човек трябва да прегледа или одобри резултатите.

4

Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Символично музикално поколение

Frequently asked questions

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM е моделът за преобразуване на текст към музика на Google, който генерира аудио в дълга форма чрез йерархия от семантични токени за музикална структура и акустични токени за детайлност на звука.

Как MusicLM основно третира задачата за генериране на музика?

MusicLM рамкира генерирането на музика като авторегресивно предсказване върху отделни аудио токени, подобно на начина, по който езиков модел предсказва думи.

Каква е ролята на семантичните токени в MusicLM?

Семантичните токени (от w2v-BERT) улавят груба, бавно променяща се структура като мелодия и ритъм на дълги интервали.

Кой компонент осигурява фините акустични детайли като тембър и текстура?

Акустичните токени идват от невронния кодек SoundStream и кодират фини детайли като тембър и текстура.

Как MusicLM свързва текстова подкана с музикален звук?

MuLan е обучен така, че текстовите описания и съвпадащият аудио картографират близките точки в споделено пространство за вграждане, позволявайки кондициониране на текст.

Защо йерархичният, поетапен дизайн помага за дългосрочна структура?

Разредените семантични токени се променят бавно, така че Transformer може да моделира дългосрочна форма ефективно, преди да бъдат запълнени плътни акустични детайли.