Аудио AI РЪКОВОДСТВО

MusicGen

MusicGen е моделът на Meta с изкуствен интелект, който генерира музика от текстово описание и по избор мелодия, която си тананикате или качвате.

2 min readПоследна актуализация

Преглед

It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.

Дълбоко гмуркане

Издаден от Meta AI през 2023 г. като част от проекта AudioCraft, MusicGen превръща подкани като „оптимистична синт-поп песен от 80-те с въздействаща бас линия“ в приблизително 12-секундни (разширяеми) музикални клипове. За разлика от многостепенните системи, MusicGen използва един езиков модел на Transformer, който предвижда аудио токени, произведени от невронния кодек EnCodec на Meta. Неговият интелигентен принос е шаблон за преплитане на токени (наречен преплитане със закъснение), който позволява на един модел да обработва ефективно множеството паралелни потоци токени на EnCodec, като избягва каскадата от отделни модели, необходими по-ранни подходи. MusicGen може да се управлява едновременно по два начина: чрез текстово описание и чрез референтна мелодия, така че можете да поискате „джаз версия“ на мелодия, която си тананикате. Meta пусна кода и тежестите открито, подхранвайки вълна от инструменти и експерименти на общността.

Техническа информация

MusicGen представя аудиото като паралелни потоци от отделни токени от кодека EnCodec, като всеки поток улавя различен детайл. Вместо да моделира потоци с отделни модели, MusicGen ги преплита с контролирани закъснения, така че един авторегресивен трансформатор ги предсказва с едно преминаване. Кондиционирането на текста идва от текстов енкодер T5, докато опционалното кондициониране на мелодията използва хромаграма (профил на звука на звука), така че моделът следва мелодия, без да копира точния й запис.

Стратегическо въздействие

Access and reach

Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.

Cost and budget

Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.

Speed and scale

Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.

Бъдещето на MusicGen

Отвореното издание на MusicGen поставя базова линия, която наследниците се стремят да победят с по-дълъг, по-висок вярност и стерео изход, плюс по-фин контрол върху структурата, инструментите и секциите на песните. Очаквайте по-тясна интеграция в софтуера за музикално производство, интерактивно генериране в реално време и по-добри инструменти за редактиране или разширяване на съществуващи песни. Както при всяка генеративна музика, това изостря въпросите относно авторските права върху данните за обучение, възнаграждението на изпълнителя и как да етикетирате генерирани от AI песни в наводнен пазар.

Внедряване в реалния свят

Генериране на безплатна фонова музика за видеоклип в YouTube от текстова подкана

Тананикане на мелодия и искане на MusicGen за нейния пълен оркестров аранжимент

Разработчиците на игри създават бързо прототипи на саундтраци на ниво в различни жанрове

Изследователи и любители, работещи с тегла с отворен код, за да експериментират с текст към музика

Рискове и предпазни огради

Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.

Точността може да спадне при акценти, диалекти или шумна среда.

Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.

Пътна карта за изпълнение

1

Получете изрично съгласие за улавяне на глас, клониране и повторно използване.

2

Тествайте качеството при различни високоговорители и фонови условия.

3

Определете кога човек трябва да прегледа или одобри резултатите.

4

Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicGen quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Принудително подравняване

Frequently asked questions

What is MusicGen?

MusicGen е моделът на Meta с изкуствен интелект, който генерира музика от текстово описание и по избор мелодия, която си тананикате или качвате. Има значение, защото поставя висококачествено, контролируемо създаване на музика в един, открито пуснат модел, който любители и изследователи могат действително да управляват.

Какви два вида вход могат да управляват MusicGen едновременно?

MusicGen приема текстова подкана и, по избор, мелодия, така че можете да поискате стилистична версия на мелодия, която предоставяте.

Кой невронни кодек произвежда аудио токените, прогнозирани от MusicGen?

MusicGen моделира дискретни токени, генерирани от кодека EnCodec на Meta, който също декодира предвидените токени обратно в аудио.

Какво е ключовото опростяване на архитектурата на MusicGen спрямо по-ранните подходи?

Чрез преплитане на паралелните потоци от токени на EnCodec с контролирани закъснения, един авторегресивен трансформатор може да ги моделира с едно преминаване, избягвайки каскада от модели.

Как MusicGen следва предоставена мелодия, без да копира точния запис?

Хромаграма улавя кои класове на височина присъстват с течение на времето, позволявайки на MusicGen да съпостави хармонията и контура на мелодията, без да възпроизвежда оригиналния тембър.

Кой проект и компания пусна MusicGen?

MusicGen беше пуснат през 2023 г. като част от проекта AudioCraft на Meta AI с отворен код и тегло на модела.