Аудіо AI GUIDE

MusicLM: Ієрархічні семантичні та акустичні лексеми

MusicLM — це модель перетворення тексту в музику Google, яка генерує аудіо довгої форми за допомогою ієрархії семантичних токенів для музичної структури та акустичних токенів для деталізації звуку.

2 хвилини читанняОстаннє оновлення

Глибоке занурення

Анонсований Google Research на початку 2023 року, MusicLM розглядає створення музики як передбачення послідовностей окремих аудіотокенів, подібно до того, як мовна модель передбачає слова. Він використовує ієрархію представлень: семантичні токени (з моделі під назвою w2v-BERT) фіксують структуру високого рівня, як-от мелодію та ритм, протягом довгих проміжків, тоді як акустичні токени (з нейронного кодека SoundStream) фіксують дрібні деталі, як-от тембр і текстуру. Перший етап генерує семантичні маркери з текстового підказки, потім наступні етапи заповнюють акустичні деталі, зумовлені цією семантикою. Кондиціонування тексту походить від MuLM/MuLan, спільного вбудовування музики та тексту, навченого таким чином, щоб описи та аудіо були розміщені в одному просторі. Цей поетапний підхід дозволяє MusicLM залишатися музично послідовним протягом декількох хвилин, а не дрейфувати через кілька секунд.

Технічне розуміння

Ключова ідея полягає в тому, щоб відокремити структуру від текстури в ієрархії маркерів. Грубі семантичні лексеми розріджені та повільно змінюються, тому Transformer може моделювати довгострокову форму без величезної довжини послідовності. Акустичні лексеми є щільними та високошвидкісними, але їх потрібно лише передбачити залежно від уже фіксованої семантики, що робить кожен етап доступним. Залишкове векторне квантування SoundStream створює багатошарові акустичні коди, які кінцевий декодер перетворює назад у хвилі 24 кГц.

Стратегічний вплив

Доступ і охоплення

Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.

Вартість і бюджет

Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.

Швидкість і масштаб

Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.

Майбутнє MusicLM: ієрархічні семантичні та акустичні лексеми

Ієрархічний підхід MusicLM став шаблоном для пізніших систем, таких як MusicGen, і комерційних музичних інструментів. Очікуйте більш чіткого налаштування мелодії (наспівуйте мелодію, отримайте повне аранжування), довших повністю структурованих пісень із куплетами та приспівами та кращого керування інструментами та тональністю. Гострі питання є юридичними та етичними: ліцензування навчальних даних, згода виконавців і водяні знаки, згенеровані аудіо, щоб їх можна було відрізнити від музики, створеної людиною, зараз є ключовими для розгортання.

Реалізація в реальному світі

Перетворення письмового опису сцени на музику фільму чи трейлера, напр. "епічна оркестрова конструкція з хором"

Створення фонової музики на основі підпису до зображення або навіть опису картини для художніх інсталяцій

Розширення короткої наспівуваної або насвистаної мелодії в повністю інструментальне аранжування

Створення різноманітних музичних композицій із різним темпом і настроєм для реклами та творців контенту

Ризики та огорожі

Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.

Точність може впасти через акценти, діалекти чи шумне середовище.

Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.

Дорожня карта впровадження

1

Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.

2

Перевірте якість на різних динаміках і фонових умовах.

3

Визначте, коли людина повинна переглядати або затверджувати результати.

4

Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Символічне музичне покоління

Часті запитання

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM — це модель перетворення тексту в музику Google, яка генерує аудіо довгої форми за допомогою ієрархії семантичних токенів для музичної структури та акустичних токенів для деталізації звуку.

Як MusicLM принципово ставиться до завдання створення музики?

MusicLM розглядає генерацію музики як авторегресійне передбачення над дискретними аудіотокенами, подібно до того, як мовна модель передбачає слова.

Яка роль семантичних токенів у MusicLM?

Семантичні токени (від w2v-BERT) фіксують грубу, повільно змінну структуру, таку як мелодія та ритм протягом довгих проміжків.

Який компонент забезпечує тонку акустичну деталізацію, як-от тембр і текстуру?

Акустичні маркери надходять із нейронного кодека SoundStream і кодують такі дрібні деталі, як тембр і текстура.

Як MusicLM з’єднує текстову підказку з музичним аудіо?

MuLan навчено таким чином, щоб текстові описи та відповідний аудіо відображалися на найближчих точках у спільному просторі для вбудовування, уможливлюючи кондиціонування тексту.

Чому ієрархічний, поетапний дизайн допомагає довгостроковій структурі?

Розріджені семантичні токени змінюються повільно, тому Transformer може ефективно моделювати довгострокову форму до того, як буде заповнено щільні акустичні деталі.