Jukebox
Jukebox je neuronová síť OpenAI pro rok 2020, která generuje nezpracovaný hudební zvuk – doplněný o zpěv, nástroje a dokonce i texty ve stylu konkrétních umělců.
Přehled
It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.
Hluboký ponor
Jukebox, vydaný OpenAI v dubnu 2020, generuje hudbu jako syrový zvuk, nikoli jako symbolické poznámky, což znamená, že produkuje skutečný zvuk včetně vokálů. Bylo natrénováno na zhruba 1,2 milionu skladeb (asi polovina v angličtině) seškrábaných z webu, spárovaných s texty a metadaty z LyricWiki. Můžete to podmínit žánrem, stylem umělce a textem a bude to zpívat rozeznatelně (i když mlhavě) jako ten umělec. Výstupy běží několik minut. Háček je v rychlosti a věrnosti: generování bylo extrémně pomalé, vykreslení jediné minuty zvuku trvalo asi devět hodin a výsledky mají tlumenou, hlučnou kvalitu. Jukebox byl výzkum, ne leštěný produkt, ale přetvořil očekávání na to, co bylo možné.
Technický přehled
Jukebox komprimuje nezpracovaný zvuk pomocí automatických kodérů VQ-VAE ve třech časových rozlišeních, čímž přemění dlouhý průběh na mnohem kratší sekvenci diskrétních kódů. Autoregresivní transformátory pak předpovídají tyto kódy jeden po druhém v závislosti na umělci, žánru a textech a upsamplery přidávají vysokofrekvenční detaily. Dekódování kódů spodní úrovně zpět na průběh 44,1 kHz je to, co dělá generování tak pomalé, protože miliony zvukových vzorků musí být produkovány sekvenčně.
Strategický dopad
Přístup a dosah
Zlepšuje dostupnost prostřednictvím přepisu, vyprávění a hlasových rozhraní.
Cena a rozpočet
Mediální týmy mohou dodávat vylepšený zvuk rychleji s menšími rozpočty.
Rychlost a měřítko
Systémy orientované na zákazníky mohou zpracovávat mluvené interakce ve větším měřítku.
Budoucnost jukeboxu
Samotný Jukebox je nyní do značné míry historickým milníkem, který je nahrazen rychlejším šířením a modely latentního zvuku, jako jsou modely Suno a Udio, které během několika sekund generují skladby v kvalitě blízké CD. Jeho základní myšlenky – diskrétní zvukové tokeny a úprava textů – žijí dál v moderních systémech. Očekávejte, že budoucí modely surového zvuku budou neustále zkracovat generační čas, zostřovat čistotu vokálů a přidávat jemné ovládací prvky, zatímco otázky týkající se autorských práv, které Jukebox poprvé vznesl o školení o nahrávkách chráněných autorskými právy, budou jen sílit.
Real-World Implementace
Výzkumníci studující, jak mohou neuronové sítě modelovat nezpracovaný zvuk a hlasy zpěvu, používající Jukebox jako referenční architekturu.
Hudebníci a fandové vytvářejí děsivé, lo-fi 'AI covery', které zpívají nové texty v drsném stylu vybraného umělce.
Pedagogové demonstrují skok od generování not ve stylu MIDI k plné syntéze surového zvuku s vokály.
Zvukoví designéři a experimentální umělci sklízejí mlhavé, snové textury Jukeboxu jako surovinu pro remixování a koláže.
Rizika a zábradlí
Pokud chybí souhlas, zvyšuje se riziko zneužití hlasu a předstírání jiné identity.
Přesnost může klesat v přízvuku, dialektech nebo hlučném prostředí.
Syntetický zvuk lze bez jasného označení zaměnit za autentickou řeč.
Plán implementace
Získejte výslovný souhlas se zachycením hlasu, klonováním a opětovným použitím.
Otestujte kvalitu napříč různými reproduktory a podmínkami pozadí.
Definujte, kdy musí člověk zkontrolovat nebo schválit výstupy.
Označte syntetický zvuk a veďte záznamy o původu pro zajištění odpovědnosti.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jukebox quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Symbolická hudební generace
Často kladené otázky
What is Jukebox?
Jukebox je neuronová síť OpenAI pro rok 2020, která generuje nezpracovaný hudební zvuk – doplněný o zpěv, nástroje a dokonce i texty ve stylu konkrétních umělců. Byl to mezník, že umělá inteligence dokáže modelovat skutečný tvar vlny hudby v délce písně, nejen noty.
Čím se Jukebox liší od dřívějších systémů se symbolickou hudbou jako AI, které vydávají MIDI?
Jukebox modeluje skutečný zvuk hudby jako nezpracovaný zvuk, takže může produkovat vokály a tóny nástrojů, na rozdíl od symbolických systémů, které vydávají pouze data not.
Kdo a kdy zhruba vydal Jukebox?
OpenAI vydala Jukebox v dubnu 2020 jako výzkumný model pro generování hudby s vokály.
Jaké bylo hlavní praktické omezení Jukeboxu?
Protože Jukebox dekóduje surový audio vzorek po vzorku, trvalo mu řádově devět hodin, než vyprodukoval jedinou minutu hudby, což je pro použití v reálném čase nepraktické.
Jakou základní techniku používá Jukebox k tomu, aby byl dlouhý nezpracovaný zvuk pro své Transformery zvládnutelný?
Jukebox používá autoenkodéry VQ-VAE ke kompresi tvaru vlny do samostatných tokenů, které pak Transformers modeluje autoregresivně před převzorkováním zpět na zvuk.
Čím můžete podmínit výstup Jukeboxu?
Jukebox přijímá žánr, umělce k napodobování a texty a pokusí se tato slova zazpívat v tomto stylu.