Zvukový průvodce AI

Hudební značkování pomocí Transformers

Označování hudby využívá modely transformátorů k poslechu skladby a předpovídání popisných štítků, jako je žánr, nálada, nástroje a tempo.

2 minuty čteníNaposledy aktualizováno

Přehled

It powers search, recommendation, and auto-organization across huge music catalogs.

Hluboký ponor

Automatické označování hudby je problém klasifikace několika značek: jedna skladba může být najednou „rocková“, „energická“, „kytarová“ a „instrumentální“. Transformers se s tím vypořádají tak, že převedou zvuk na spektrogram (časově-frekvenční obraz) a provedou jeho části prostřednictvím vrstev sebepozornosti, podobně jako Vision Transformer zachází se skvrnami obrazu. Modely jako Audio Spectrogram Transformer (AST) a MERT se učí vzory s dlouhým dosahem přes celou stopu a zachycují, jak souvisí refrén se slokou minut od sebe. Mnoho z nich je předtrénováno, samokontroluje na milionech neoznačených klipů, a poté je doladěno na tagovaných datových sadách, jako je MagnaTagATune nebo Million Song Dataset. Protože se značky vzájemně nevylučují, poslední vrstva používá esovité výstupy hodnocené proti benchmarkům, jako je průměrná průměrná přesnost a ROC-AUC.

Technický přehled

Surový zvuk je převeden na log-Mel spektrogram, rozdělen do překrývajících se políček a lineárně vložen s pozičním kódováním. Vlastní pozornost umožňuje každému patchi vážit každý druhý patch, takže vzdálené hudební události ovlivňují každý tag. Na rozdíl od klasifikátorů obrázků s jedním štítkem se při označování hudby používá sigmoid na štítek spíše než jeden softmax, protože štítky se vyskytují současně. Předtrénování s vlastním dohledem (předpovídání maskovaných zvukových tokenů) poskytuje silnou reprezentaci před jemným doladěním na menších označených sadách.

Strategický dopad

Přístup a dosah

Zlepšuje dostupnost prostřednictvím přepisu, vyprávění a hlasových rozhraní.

Cena a rozpočet

Mediální týmy mohou dodávat vylepšený zvuk rychleji s menšími rozpočty.

Rychlost a měřítko

Systémy orientované na zákazníky mohou zpracovávat mluvené interakce ve větším měřítku.

Budoucnost hudebního značkování s Transformers

Tagování se prolíná s porozuměním přirozenému jazyku, takže můžete místo pevných žánrových tlačítek hledat „zasněné lo-fi s vinylovým praskáním pro studium“. Kontrastní audio-textové modely, jako je CLAP, zarovnávají hudbu a popisy do jednoho prostoru, což umožňuje tagy s nulovým záběrem, které se při školení nikdy nevyskytovaly. Očekávejte bohatší, podrobnější popisky, lepší zpracování fusion žánrů a značkování na zařízení pro zachování soukromí. Debaty o právech a přiřazování kolem školení o katalozích chráněných autorským právem budou určovat, jaká data mohou tyto modely používat.

Real-World Implementace

Automatické generování značek žánrů a nálad, takže streamovací služby mohou vytvářet seznamy skladeb „zaměření“ nebo „cvičení“

Nechat hudební knihovny, aby vynořily skladby „skvostné akustické kytary“ pro editory videa, kteří hledají synchronizační licence

Pohání motory doporučení, které najdou zvukově podobné skladby nad rámec toho, co uživatelé výslovně ohodnotili

Automatická organizace kolekce vzorků producenta podle detekovaného nástroje, tóniny a tempa

Rizika a zábradlí

Pokud chybí souhlas, zvyšuje se riziko zneužití hlasu a předstírání jiné identity.

Přesnost může klesat v přízvuku, dialektech nebo hlučném prostředí.

Syntetický zvuk lze bez jasného označení zaměnit za autentickou řeč.

Plán implementace

1

Získejte výslovný souhlas se zachycením hlasu, klonováním a opětovným použitím.

2

Otestujte kvalitu napříč různými reproduktory a podmínkami pozadí.

3

Definujte, kdy musí člověk zkontrolovat nebo schválit výstupy.

4

Označte syntetický zvuk a veďte záznamy o původu pro zajištění odpovědnosti.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Music Tagging with Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Automatické označování hudby

Často kladené otázky

What is Music Tagging with Transformers?

Označování hudby využívá modely transformátorů k poslechu skladby a předpovídání popisných štítků, jako je žánr, nálada, nástroje a tempo. Umožňuje vyhledávání, doporučování a automatickou organizaci napříč obrovskými hudebními katalogy.

Proč je označování hudby považováno za problém s více značkami?

Skladba může být současně rocková, energická a kytarová, takže na jednu skladbu se vztahuje více značek.

Jakou vstupní reprezentaci obvykle používají transformátorové taggery?

Zvuk se převede na časově-frekvenční spektrogram, poté se opraví a přivede přes sebepozorování jako obrazové záplaty.

Proč modely hudebních značek používají sigmoidní výstup na značku namísto jednoho softmaxu?

Softmax vynutí součet pravděpodobností do jedné (jediná volba); sigmoid umožňuje, aby každá značka byla nezávisle pravdivá.

Jaká je role předtréninku s vlastním dohledem pro modely jako MERT?

Předtrénování maskované zvukové predikce přes velké neoznačené korpusy vytváří reprezentace později doladěné na označených datech.

Která datová sada se běžně používá k doladění a srovnávání hudebních taggerů?

MagnaTagATune a Million Song Dataset jsou standardní značkové hudební benchmarky; MNIST a ImageNet jsou sady obrázků.