Audio AI ÚTMUTATÓ

MusicGen

A MusicGen a Meta mesterséges intelligencia modellje, amely szöveges leírásból és opcionálisan egy dúdolt vagy feltöltött dallamból generál zenét.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.

Mély merülés

A Meta mesterséges intelligencia által 2023-ban az AudioCraft projekt részeként kiadott MusicGen az olyan felszólításokat, mint „egy lendületes, 80-as évekbeli szintipop szám, lendületes basszusvonallal”, nagyjából 12 másodperces (hosszabbítható) zenei klipekké alakítja. A többlépcsős rendszerekkel ellentétben a MusicGen egyetlen Transformer nyelvi modellt használ, amely megjósolja a Meta EnCodec neurális kodekje által előállított audio tokeneket. Okos hozzájárulása egy token-interleaving minta (úgynevezett késleltetési interleaving), amely lehetővé teszi, hogy egy modell hatékonyan kezelje az EnCodec több párhuzamos tokenfolyamát, elkerülve a korábban szükséges különálló modellek sorozatát. A MusicGen egyszerre kétféleképpen irányítható: szöveges leírással és referenciadallam segítségével, így kérhetsz egy dúdolt dallam „jazz verzióját”. Meta nyíltan kiadta a kódot és a súlyozást, ami közösségi eszközök és kísérletek hullámát gerjesztette.

Technikai betekintés

A MusicGen a hangot az EnCodec kodek diszkrét tokenek párhuzamos folyamaiként jeleníti meg, és mindegyik adatfolyam más-más részletet rögzít. Ahelyett, hogy külön modellekkel modellezné az adatfolyamokat, a MusicGen szabályozott késleltetésekkel interleaveli őket, így egyetlen autoregresszív Transformer egy menetben előrejelzi őket. A szövegkondicionálás egy T5 szövegkódolóból származik, míg az opcionális dallamkondicionálás kromagramot (a hang hangmagassági osztályú profilját) használ, így a modell egy dallamot követ anélkül, hogy lemásolná annak pontos felvételét.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A Music jövőjeGen

A MusicGen nyílt kiadása olyan alapvonalat állított fel, amelyet az utódok a hosszabb, nagyobb hanghűségű és sztereó kimenettel, valamint a szerkezet, a hangszerelés és a dalszekciók finomabb szabályozásával kívánnak felülmúlni. A zenei produkciós szoftverekbe való szorosabb integrációra, valós idejű interaktív generálásra és jobb eszközökre számíthat a meglévő számok szerkesztéséhez vagy bővítéséhez. Mint minden generatív zene, ez is kiélezi a képzési adatok szerzői jogával, az előadók kompenzációjával és az AI által generált dalok címkézésével kapcsolatos kérdéseket egy elárasztott piacon.

Valós megvalósítás

Jogdíjmentes háttérzene generálása YouTube-videóhoz szöveges promptból

Dúdolni egy dallamot, és a MusicGentől kérni egy teljes zenekari feldolgozást

A játékfejlesztők gyorsan prototípus-szintű hangsávokat készítenek különböző műfajokban

Kutatók és hobbibarátok nyílt forráskódú súlyokat használnak, hogy kísérletezzenek a szöveg-zene formátummal

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicGen quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is MusicGen?

A MusicGen a Meta mesterséges intelligencia modellje, amely szöveges leírásból és opcionálisan egy dúdolt vagy feltöltött dallamból generál zenét. Ez azért fontos, mert a kiváló minőségű, ellenőrizhető zenealkotást egyetlen, nyíltan kiadott modellbe helyezi, amelyet a hobbibarátok és kutatók valóban futtathatnak.

Milyen kétféle bemenet irányíthatja egyszerre a MusicGen-t?

A MusicGen elfogad egy szöveges felszólítást és opcionálisan egy dallamot is, így kérheti az Ön által megadott dallam stilisztikai változatát.

Melyik neurális kodek állítja elő a MusicGen által megjósolt audio tokeneket?

A MusicGen a Meta EnCodec kodekje által generált diszkrét tokeneket modellezi, amely szintén visszakódolja a megjósolt tokeneket hangba.

Mi a MusicGen legfontosabb építészeti egyszerűsítése a korábbi megközelítésekhez képest?

Az EnCodec párhuzamos token folyamainak szabályozott késleltetésekkel történő átlapolásával egy autoregresszív transzformátor egyetlen menetben modellezheti őket, elkerülve a modellek kaszkádját.

Hogyan követi a MusicGen a megadott dallamot anélkül, hogy lemásolná a pontos felvételt?

A kromagram rögzíti, hogy az idő múlásával mely hangmagasság-osztályok vannak jelen, így a MusicGen illeszkedik a dallam harmóniájához és kontúrjaihoz anélkül, hogy az eredeti hangszínt reprodukálná.

Melyik projekt és cég adta ki a MusicGen-t?

A MusicGen 2023-ban jelent meg a Meta AI AudioCraft projektjének részeként, nyílt kóddal és modellsúlyokkal.