Аудіо AI GUIDE

MusicGen

MusicGen — це модель штучного інтелекту Meta, яка генерує музику з текстового опису та, за бажанням, мелодії, яку ви наспівуєте або завантажуєте.

2 хвилини читанняОстаннє оновлення

Огляд

It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.

Глибоке занурення

Випущений Meta AI у 2023 році в рамках проекту AudioCraft, MusicGen перетворює підказки, як-от «бадьорий синті-поп-трек 80-х із потужною басовою лінією», у приблизно 12-секундні (з можливістю розширення) музичні кліпи. На відміну від багатоступеневих систем, MusicGen використовує єдину модель мови Transformer, яка передбачає аудіотокени, створені нейронним кодеком EnCodec Meta. Його розумним внеском є ​​шаблон чергування маркерів (так званий чергування із затримкою), який дозволяє одній моделі ефективно обробляти численні паралельні потоки маркерів EnCodec, уникаючи каскаду окремих моделей, необхідних попередніх підходів. MusicGen можна керувати двома способами одночасно: текстовим описом і еталонною мелодією, тож ви можете запитати «джазову версію» мелодії, яку ви наспівуєте. Meta відкрито опублікував код і ваги, підживлюючи хвилю інструментів і експериментів спільноти.

Технічне розуміння

MusicGen представляє аудіо як паралельні потоки окремих маркерів із кодека EnCodec, кожен потік фіксує різні деталі. Замість того, щоб моделювати потоки за допомогою окремих моделей, MusicGen перемежовує їх із контрольованими затримками, тож єдиний авторегресійний трансформатор прогнозує їх за один прохід. Кондиціонування тексту походить від текстового кодера T5, тоді як додаткове кондиціювання мелодії використовує хромаграму (профіль висоти звуку), тому модель слідує мелодії, не копіюючи її точний запис.

Стратегічний вплив

Доступ і охоплення

Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.

Вартість і бюджет

Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.

Швидкість і масштаб

Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.

Майбутнє MusicGen

Відкритий випуск MusicGen встановив базову лінію, яку наступники прагнуть перевершити завдяки довшому, високоякісному стереовиводу, а також точнішому контролю над структурою, інструментами та частинами пісень. Очікуйте тіснішої інтеграції з програмним забезпеченням для створення музики, інтерактивної генерації в реальному часі та кращих інструментів для редагування або розширення існуючих треків. Як і у випадку з іншою генеративною музикою, це загострює питання щодо авторських прав на навчальні дані, компенсації виконавцям і того, як позначати пісні, створені штучним інтелектом, на переповненому ринку.

Реалізація в реальному світі

Створення безоплатної фонової музики для відео YouTube із текстового підказки

Наспівує мелодію та запитує у MusicGen її повне оркестрове аранжування

Розробники ігор швидко створюють прототипи саундтреків рівнів у різних жанрах

Дослідники та любителі використовують ваги з відкритим кодом, щоб експериментувати з перетворенням тексту в музику

Ризики та огорожі

Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.

Точність може впасти через акценти, діалекти чи шумне середовище.

Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.

Дорожня карта впровадження

1

Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.

2

Перевірте якість на різних динаміках і фонових умовах.

3

Визначте, коли людина повинна переглядати або затверджувати результати.

4

Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicGen quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Примусове вирівнювання

Часті запитання

What is MusicGen?

MusicGen — це модель штучного інтелекту Meta, яка генерує музику з текстового опису та, за бажанням, мелодії, яку ви наспівуєте або завантажуєте. Це важливо, тому що воно поєднує високоякісне, кероване створення музики в єдину, відкрито випущену модель, якою можуть справді користуватися любителі та дослідники.

Які два види входу можуть керувати MusicGen одночасно?

MusicGen приймає текстову підказку та, за бажанням, мелодію, тому ви можете запитати стилістичну версію мелодії, яку ви надаєте.

Який нейронний кодек створює звукові маркери, передбачені MusicGen?

MusicGen моделює дискретні токени, згенеровані кодеком EnCodec Meta, який також декодує прогнозовані токени назад у аудіо.

У чому ключове спрощення архітектури MusicGen порівняно з попередніми підходами?

Перемежовуючи паралельні потоки маркерів EnCodec із контрольованими затримками, один авторегресійний трансформатор може моделювати їх за один прохід, уникаючи каскаду моделей.

Як MusicGen слідує наданій мелодії, не копіюючи точний запис?

Хромаграма фіксує, які класи висоти присутні з часом, дозволяючи MusicGen узгодити гармонію та контур мелодії без відтворення оригінального тембру.

Який проект і компанія випустили MusicGen?

MusicGen було випущено в 2023 році в рамках проекту AudioCraft Meta AI з відкритим кодом і вагами моделі.