Zene címkézés Transformers segítségével
A zenei címkézés transzformátormodelleket használ a dal meghallgatására, és olyan leíró címkék előrejelzésére, mint a műfaj, a hangulat, a hangszerek és a tempó.
Áttekintés
It powers search, recommendation, and auto-organization across huge music catalogs.
Mély merülés
A zene automatikus címkézése több kiadós besorolási probléma: egy szám egyszerre lehet „rock”, „energetikus”, „gitáros” és „instrumentális”. A transzformátorok úgy kezelik ezt, hogy a hangot spektrogrammá (idő-frekvenciás képpé) alakítják, és foltjait önfigyelő rétegeken keresztül táplálják, hasonlóan ahhoz, ahogy a Vision Transformer a képfoltokat kezeli. Az olyan modellek, mint az Audio Spectrogram Transformer (AST) és a MERT, hosszú hatótávolságú mintákat tanulnak meg egy teljes sávon keresztül, és megörökítik, hogyan viszonyul egy kórus egy versszakhoz percnyi különbséggel. Sokan vannak előképzett önfelügyelve több millió címkézetlen klipen, majd finomhangolják a címkézett adatkészleteken, mint például a MagnaTagATune vagy a Million Song Dataset. Mivel a címkék nem zárják ki egymást, az utolsó réteg szigmoid kimeneteket használ, amelyeket olyan benchmarkok alapján értékelnek, mint az átlagos átlagos pontosság és a ROC-AUC.
Technikai betekintés
A nyers hangot a rendszer log-Mel spektrogrammá alakítja, átfedő foltokra osztja fel, és pozíciókódolásokkal lineárisan beágyazza. Az önfigyelem lehetővé teszi, hogy minden javítás minden más foltot mérlegeljen, így a távoli zenei események befolyásolják az egyes címkéket. Az egycímkés képosztályozókkal ellentétben a zenei címkézés címkénként szigmoidot alkalmaz, nem pedig egy softmax-ot, mivel a címkék együtt fordulnak elő. Az önfelügyelt előképzés (maszkolt hangjelzők előrejelzése) erőteljes megjelenítést ad a finomhangolás előtt a kisebb címkézett készleteken.
Stratégiai hatás
Hozzáférés és elérés
Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.
Költség és költségvetés
A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.
Sebesség és méretarány
Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.
A zenei címkézés jövője a Transformers segítségével
A címkézés egybeolvad a természetes nyelv megértésével, így a rögzített műfaji gombok helyett az „álmodozó lo-fi bakelit recsegéssel tanuláshoz” kifejezésre kereshet. A kontrasztos hangszöveg-modellek, mint például a CLAP, egy helyre igazítják a zenét és a leírásokat, lehetővé téve az edzéseken soha nem látott zero-shot címkéket. Gazdagabb, részletesebb címkékre, a fúziós műfajok jobb kezelésére és az eszközön történő címkézésre számíthat az adatvédelem érdekében. A szerzői joggal védett katalógusokkal kapcsolatos képzés körüli jogok és forrásmegjelölési viták határozzák meg, hogy ezek a modellek milyen adatokat használhatnak fel.
Valós megvalósítás
Műfaji és hangulati címkék automatikus generálása, így a streaming szolgáltatások „fókusz” vagy „edzés” lejátszási listákat hozhatnak létre
Lehetővé teszi a zenei könyvtárak számára, hogy „jó hangulatú akusztikus gitár” számokat jelenítsenek meg a szinkronizálási licencet kereső videószerkesztők számára
Erőteljes ajánlómotorok, amelyek hangzásban hasonló dalokat találnak a felhasználók által kifejezetten értékelteken felül
A gyártó mintagyűjtésének automatikus rendszerezése észlelt hangszer, kulcs és tempó szerint
Kockázatok és védőkorlátok
A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.
A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.
A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.
Végrehajtási ütemterv
Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.
Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.
Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.
Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Music Tagging with Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Zene automatikus címkézése
Gyakran ismételt kérdések
What is Music Tagging with Transformers?
A zenei címkézés transzformátormodelleket használ a dal meghallgatására, és olyan leíró címkék előrejelzésére, mint a műfaj, a hangulat, a hangszerek és a tempó. Hatalmas zenei katalógusokban keresést, ajánlást és automatikus rendszerezést tesz lehetővé.
Miért kezelik a zenei címkézést többkiadós problémaként?
Egy dal egyszerre lehet rockos, energikus és gitárvezérelt, így egy számra több címke is vonatkozik.
Milyen bemeneti reprezentációt használnak a transzformátorcímkézők?
A hangot idő-frekvencia spektrogrammá alakítják, majd foltozzák, és önfigyelem segítségével, mint a képfoltok, táplálják.
Miért használnak a zenei címkézési modellek címkénként szigmoid kimenetet egy softmax helyett?
A Softmax arra kényszeríti a valószínűségeket, hogy összegezzen egyet (egyetlen választás); A sigmoid lehetővé teszi, hogy minden címke egymástól függetlenül igaz legyen.
Mi a szerepe az önfelügyelt előképzésnek olyan modelleknél, mint a MERT?
A nagy, címkézetlen korpuszokon végzett maszkolt hang-előrejelzés előképzése a címkézett adatokon később finomhangolt reprezentációkat készít.
Melyik adatkészletet használják általában a zenei címkék finomhangolására és összehasonlítására?
A MagnaTagATune és a Million Song Dataset szabványos címkézett zenei referenciaértékek; Az MNIST és az ImageNet képkészletek.