Audio AI ÚTMUTATÓ

MusicLM: Hierarchikus szemantikai és akusztikus tokenek

A MusicLM a Google szöveg-zene modellje, amely hosszú formátumú hangot generál a zenei struktúra szemantikai tokenek hierarchiáján és a hangrészletek akusztikus tokenek hierarchiáján keresztül.

2 perc olvasásUtoljára frissítve

Mély merülés

A Google kutatás 2023 elején bejelentette, hogy a MusicLM a zenegenerációt diszkrét hangjelzők szekvenciáiként határozza meg, hasonlóan ahhoz, ahogy a nyelvi modell a szavakat. A reprezentációk hierarchiáját használja: a szemantikus tokenek (a w2v-BERT nevű modellből) magas szintű struktúrákat rögzítenek, például dallamokat és ritmusokat hosszú szakaszokon, míg az akusztikus tokenek (a SoundStream neurális kodekből) olyan finom részleteket rögzítenek, mint a hangszín és a textúra. Az első szakasz szemantikai tokeneket generál a szöveges promptból, majd a későbbi szakaszok kitöltik az akusztikai részleteket ezeknek a szemantikának megfelelően. A szövegkondicionálás a MuLM/MuLan-tól származik, amely egy közös zenei-szöveg beágyazás, így a leírások és a hanganyag ugyanabban a térben landol. Ez a szakaszos megközelítés lehetővé teszi, hogy a MusicLM zeneileg konzisztens maradjon percekig, ahelyett, hogy néhány másodperc után elsodródna.

Technikai betekintés

A kulcsötlet a szerkezet és a textúra szétválasztása egy token hierarchiában. A durva szemantikai tokenek ritkák és lassan változnak, így a Transformer képes hosszú távú formát modellezni hatalmas sorozathossz nélkül. Az akusztikus tokenek sűrűek és nagy sebességűek, de csak a már rögzített szemantikától függően kell előre jelezni őket, így minden szakasz követhetővé válik. A SoundStream maradék vektorkvantálása azokat a réteges akusztikus kódokat állítja elő, amelyeket a végső dekóder 24 kHz-es hullámformákká alakít vissza.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A zene jövőjeLM: Hierarchikus szemantikai és akusztikus tokenek

A MusicLM hierarchikus token megközelítése a későbbi rendszerek, például a MusicGen és a kereskedelmi zenei eszközök sablonjává vált. Feszesebb dallamkondicionálásra számíthat (dúdolj egy dallamot, kapj egy teljes hangszerelést), hosszabb, teljesen strukturált dalokat versekkel és refrénekkel, valamint jobb vezérelhetőséget a hangszerek és a billentyűk felett. A kényes kérdések jogi és etikai vonatkozásúak: a képzési adatok engedélyezése, az előadók beleegyezése és a vízjelekkel generált hanganyag, hogy meg lehessen különböztetni az ember által készített zenétől, most központi szerepet tölt be a bevezetésben.

Valós megvalósítás

Írott jelenetleírásból filmzené vagy előzetes kottává alakítani, pl. "Epikus zenekari épület kórussal"

Képaláíráshoz vagy akár festményleírásokhoz kötött háttérzene generálása művészeti installációkhoz

Rövid dúdolt vagy sípolt dallam kiterjesztése teljesen hangszeres feldolgozásra

Változatos stock-zenei számok készítése különböző tempójú és hangulatú reklám- és tartalomkészítők számára

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Szimbolikus zenegeneráció

Gyakran ismételt kérdések

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

A MusicLM a Google szöveg-zene modellje, amely hosszú formátumú hangot generál a zenei struktúra szemantikai tokenek hierarchiáján és a hangrészletek akusztikus tokenek hierarchiáján keresztül.

Hogyan kezeli alapvetően a MusicLM a zenegenerálás feladatát?

A MusicLM a zenegenerálást autoregresszív előrejelzésként állítja be diszkrét hangjelzők felett, hasonlóan ahhoz, ahogy a nyelvi modell előrejelzi a szavakat.

Mi a szemantikai tokenek szerepe a MusicLM-ben?

A szemantikus tokenek (a w2v-BERT-től) durva, lassan változó struktúrákat rögzítenek, például dallamot és ritmust hosszú szakaszokon.

Melyik komponens biztosítja a finom akusztikus részleteket, például a hangszínt és a textúrát?

Az akusztikus tokenek a SoundStream neurális kodekből származnak, és olyan finom részleteket kódolnak, mint a hangszín és a textúra.

Hogyan köti össze a MusicLM a szöveges promptot a zenei hanggal?

A MuLan úgy van kiképezve, hogy szöveges leírásokat és hangleírásokat adjon a közeli pontokhoz egy megosztott beágyazási területen, lehetővé téve a szöveg kondicionálását.

Miért segíti a hierarchikus, színpadi tervezés a hosszú távú struktúrát?

A ritka szemantikai tokenek lassan változnak, így a Transformer hatékonyan tudja modellezni a hosszú távú formát, mielőtt a sűrű akusztikus részletek kitöltődnek.