Zvukový průvodce AI

MusicLM: Hierarchické sémantické a akustické tokeny

MusicLM je model převodu textu na hudbu Google společnosti Google, který generuje dlouhý zvuk prostřednictvím hierarchie sémantických tokenů pro hudební strukturu a akustických tokenů pro zvukové detaily.

2 minuty čteníNaposledy aktualizováno

Hluboký ponor

MusicLM, oznámený výzkumem Google na začátku roku 2023, zarámuje generování hudby jako předvídání sekvencí diskrétních zvukových tokenů, podobně jako jazykový model předpovídá slova. Využívá hierarchii reprezentací: sémantické tokeny (z modelu zvaného w2v-BERT) zachycují strukturu na vysoké úrovni, jako je melodie a rytmus, v dlouhých rozpětích, zatímco akustické tokeny (z neurálního kodeku SoundStream) zachycují jemné detaily, jako je zabarvení a textura. První fáze generuje sémantické tokeny z textové výzvy, později vyplní akustické detaily podmíněné touto sémantikou. Úprava textu pochází z MuLM/MuLan, společného hudebního a textového vkládání natrénovaného tak, aby popisy a audio přistály ve stejném prostoru. Tento postupný přístup umožňuje MusicLM zůstat hudebně konzistentní po dobu několika minut, spíše než se unášet po několika sekundách.

Technický přehled

Klíčovou myšlenkou je oddělení struktury od textury napříč hierarchií tokenů. Hrubé sémantické tokeny jsou řídké a pomalu se mění, takže Transformer může modelovat dlouhodobou formu bez velké délky sekvence. Akustické tokeny jsou husté a mají vysokou rychlost, ale je třeba je předvídat pouze na základě již zafixované sémantiky, díky čemuž je každá fáze ovladatelná. Zbytková vektorová kvantizace SoundStreamu vytváří vrstvené akustické kódy, které finální dekodér převádí zpět na 24kHz průběhy.

Strategický dopad

Přístup a dosah

Zlepšuje dostupnost prostřednictvím přepisu, vyprávění a hlasových rozhraní.

Cena a rozpočet

Mediální týmy mohou dodávat vylepšený zvuk rychleji s menšími rozpočty.

Rychlost a měřítko

Systémy orientované na zákazníky mohou zpracovávat mluvené interakce ve větším měřítku.

Budoucnost MusicLM: Hierarchické sémantické a akustické tokeny

Hierarchický tokenový přístup MusicLM se stal šablonou pro pozdější systémy jako MusicGen a komerční hudební nástroje. Očekávejte přísnější úpravu melodie (bručení melodie, získejte kompletní aranžmá), delší plně strukturované písně se slokami a sbory a lepší ovladatelnost nad nástroji a tóninou. Ožehavé problémy jsou legální a etické: licenční údaje pro školení, souhlas interpreta a vodoznak generovaný zvuk, aby jej bylo možné odlišit od hudby vytvořené lidmi, jsou nyní ústředním bodem nasazení.

Real-World Implementace

Převedení napsaného popisu scény do filmu nebo traileru, např. „epická orchestrální stavba se sborem“

Generování hudby na pozadí podmíněné popisem obrázku nebo dokonce popisem malby pro umělecké instalace

Rozšíření krátké broukané nebo pískané melodie do plně instrumentovaného aranžmá

Produkce různých skladových hudebních skladeb v různých tempech a náladách pro tvůrce reklamy a obsahu

Rizika a zábradlí

Pokud chybí souhlas, zvyšuje se riziko zneužití hlasu a předstírání jiné identity.

Přesnost může klesat v přízvuku, dialektech nebo hlučném prostředí.

Syntetický zvuk lze bez jasného označení zaměnit za autentickou řeč.

Plán implementace

1

Získejte výslovný souhlas se zachycením hlasu, klonováním a opětovným použitím.

2

Otestujte kvalitu napříč různými reproduktory a podmínkami pozadí.

3

Definujte, kdy musí člověk zkontrolovat nebo schválit výstupy.

4

Označte syntetický zvuk a veďte záznamy o původu pro zajištění odpovědnosti.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Symbolická hudební generace

Často kladené otázky

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM je model převodu textu na hudbu Google společnosti Google, který generuje dlouhý zvuk prostřednictvím hierarchie sémantických tokenů pro hudební strukturu a akustických tokenů pro zvukové detaily.

Jak MusicLM zásadně zachází s úkolem generování hudby?

MusicLM rámuje generování hudby jako autoregresivní predikci přes diskrétní zvukové tokeny, podobně jako jazykový model předpovídá slova.

Jaká je role sémantických tokenů v MusicLM?

Sémantické tokeny (od w2v-BERT) zachycují hrubou, pomalu se měnící strukturu, jako je melodie a rytmus, v dlouhých intervalech.

Která složka poskytuje jemné akustické detaily, jako je zabarvení a textura?

Akustické tokeny pocházejí z neurálního kodeku SoundStream a kódují jemné detaily, jako je zabarvení a textura.

Jak MusicLM propojí textovou výzvu s hudebním zvukem?

MuLan je trénován tak, aby textové popisy a přiřazování zvuku mapovaly blízké body ve sdíleném prostoru pro vkládání, což umožňuje úpravu textu.

Proč hierarchický, fázovaný návrh pomáhá s dlouhodobou strukturou?

Řídké sémantické tokeny se mění pomalu, takže Transformer může efektivně modelovat dlouhodobou formu, než se zaplní husté akustické detaily.