Zvukový průvodce AI

MusicGen

MusicGen je model umělé inteligence Meta, který generuje hudbu z textového popisu a volitelně z melodie, kterou si zabručíte nebo nahrajete.

2 minuty čteníNaposledy aktualizováno

Přehled

It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.

Hluboký ponor

MusicGen, kterou vydala Meta AI v roce 2023 jako součást projektu AudioCraft, proměňuje výzvy jako „senzační synth-popová skladba 80. let s působivou basovou linkou“ na zhruba 12sekundové (rozšiřitelné) hudební klipy. Na rozdíl od vícestupňových systémů používá MusicGen jediný jazykový model Transformer, který předpovídá zvukové tokeny produkované neuronovým kodekem EnCodec společnosti Meta. Jeho chytrým přínosem je vzor prokládání tokenů (nazývaný zpoždění prokládání), který jednomu modelu umožňuje efektivně zpracovávat více paralelních tokenů EnCodec, čímž se vyhne kaskádě samostatných modelů, které byly potřeba dříve. MusicGen lze řídit dvěma způsoby najednou: textovým popisem a referenční melodií, takže můžete požádat o „jazzovou verzi“ melodie, kterou si pobrukujete. Meta zveřejnila kód a váhy otevřeně, čímž podnítila vlnu komunitních nástrojů a experimentů.

Technický přehled

MusicGen představuje zvuk jako paralelní proudy diskrétních tokenů z kodeku EnCodec, přičemž každý proud zachycuje jiné detaily. Namísto modelování proudů pomocí samostatných modelů je MusicGen prokládá řízenými zpožděními, takže je jediný autoregresivní transformátor předpovídá v jednom průchodu. Úprava textu pochází z textového kodéru T5, zatímco volitelná úprava melodie využívá chromagram (profil třídy tónů zvuku), takže model sleduje melodii, aniž by kopíroval přesný záznam.

Strategický dopad

Přístup a dosah

Zlepšuje dostupnost prostřednictvím přepisu, vyprávění a hlasových rozhraní.

Cena a rozpočet

Mediální týmy mohou dodávat vylepšený zvuk rychleji s menšími rozpočty.

Rychlost a měřítko

Systémy orientované na zákazníky mohou zpracovávat mluvené interakce ve větším měřítku.

Budoucnost MusicGen

Otevřená verze MusicGen nastavila základní linii, kterou chtějí následníci překonat delším, věrnějším a stereo výstupem, plus jemnější kontrola nad strukturou, instrumentací a sekcemi skladeb. Očekávejte těsnější integraci do softwaru pro produkci hudby, interaktivní generování v reálném čase a lepší nástroje pro úpravu nebo rozšiřování stávajících skladeb. Stejně jako u veškeré generativní hudby zostří otázky týkající se autorských práv k datům školení, kompenzací pro umělce a toho, jak označit skladby vytvořené umělou inteligencí na zaplaveném trhu.

Real-World Implementace

Generování bezplatné hudby na pozadí pro video YouTube z textové výzvy

Pobrukovat melodii a požádat MusicGen o její plné orchestrální aranžmá

Herní vývojáři rychle prototypují soundtracky různých žánrů

Výzkumníci a fandové provozující váhy s otevřeným zdrojovým kódem pro experimentování s převodem textu na hudbu

Rizika a zábradlí

Pokud chybí souhlas, zvyšuje se riziko zneužití hlasu a předstírání jiné identity.

Přesnost může klesat v přízvuku, dialektech nebo hlučném prostředí.

Syntetický zvuk lze bez jasného označení zaměnit za autentickou řeč.

Plán implementace

1

Získejte výslovný souhlas se zachycením hlasu, klonováním a opětovným použitím.

2

Otestujte kvalitu napříč různými reproduktory a podmínkami pozadí.

3

Definujte, kdy musí člověk zkontrolovat nebo schválit výstupy.

4

Označte syntetický zvuk a veďte záznamy o původu pro zajištění odpovědnosti.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicGen quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Často kladené otázky

What is MusicGen?

MusicGen je model umělé inteligence Meta, který generuje hudbu z textového popisu a volitelně z melodie, kterou si zabručíte nebo nahrajete. Záleží na tom, protože vkládá vysoce kvalitní a ovladatelnou tvorbu hudby do jediného, ​​otevřeně vydaného modelu, který mohou fandové a výzkumníci skutečně provozovat.

Jaké dva druhy vstupů mohou řídit MusicGen současně?

MusicGen přijímá textovou výzvu a volitelně melodii, takže si můžete vyžádat stylistickou verzi vámi poskytnuté melodie.

Který neurální kodek vytváří zvukové tokeny, které MusicGen předpovídá?

MusicGen modeluje diskrétní tokeny generované kodekem EnCodec Meta, který také dekóduje předpovězené tokeny zpět do zvuku.

Jaké je klíčové architektonické zjednodušení MusicGen oproti dřívějším přístupům?

Díky prokládání paralelních tokenů EnCodec s řízenými zpožděními je může jeden autoregresivní transformátor modelovat v jediném průchodu, čímž se vyhne kaskádě modelů.

Jak MusicGen následuje poskytnutou melodii bez kopírování přesné nahrávky?

Chromagram zachycuje, které třídy výšky tónu jsou přítomny v průběhu času, což umožňuje MusicGen sladit harmonii a obrys melodie, aniž by reprodukoval původní zabarvení.

Který projekt a společnost vydala MusicGen?

MusicGen byl vydán v roce 2023 jako součást projektu Meta AI AudioCraft s otevřeným kódem a váhami modelu.