Audio AI ÚTMUTATÓ

Zene automatikus címkézése

A zene automatikus címkézése gépi tanulást használ egy dal meghallgatására, és automatikusan leíró címkéket, például műfajt, hangulatot, hangszereket és tempót csatol hozzá.

2 perc olvasásUtoljára frissítve

Áttekintés

It powers the search, recommendation, and organization features behind every major streaming service.

Mély merülés

A zenei automatikus címkézés a címkézést többkiadós besorolási problémaként kezeli: egyetlen szám egyszerre lehet „rock”, „energetikus” és „gitárvezérelt”. A modern rendszerek a nyers hangot mel-spektrogrammá (a hang idő-frekvenciás képévé) alakítják át, és egy konvolúciós vagy transzformátor alapú neurális hálózaton keresztül táplálják, amely olyan adatkészleteken van, mint a MagnaTagATune, a Million Song Dataset vagy az MTG-Jamendo. A modell minden lehetséges címkéhez egy valószínűséget ad ki. Mivel az ember által felvitt címkék zajosak és hiányosak, a képzés kihívást jelent, és a címkék kiegyensúlyozatlanok. Ugyanez a gerinchálózat egyre inkább az önfelügyelt hangmodellekből származik, így egyetlen reprezentáció táplálja a címkézést, az ajánlásokat és a hasonlóságok keresését, ahelyett, hogy minden címkéhez külön modellt építene.

Technikai betekintés

A hangot rövid, egymást átfedő képkockákra osztják, a rövid idejű Fourier-transzformáció segítségével alakítják át, és az emberi hangmagasság-érzékelést utánzó mel-skálára képezik le. A CNN úgy olvassa ezt a spektrogramot, mint egy képet, és szűrőket tanul a harmonikus mintákhoz, ritmushoz és hangszínhez. Az utolsó réteg szigmoid aktiválást (nem softmaxot) használ, mivel a címkék függetlenek és nem kizárólagosak, és több száz lehetséges címkén keresztül bináris keresztentrópiával van optimalizálva.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A zenei automatikus címkézés jövője

Az automatikus címkézés a nyílt szókészletű, szöveges lekérdezhető rendszerek felé tolódik el, amelyek olyan hangnyelvi modellekre épülnek, mint a CLAP, ahol a felhasználók előre definiált címkék nélkül keresnek „álomtanulmányi szinti sávra”. Várható szorosabb kapcsolat a generatív zenei eszközökkel, a ritka műfajok és a nem nyugati zenék jobb kezelése, valamint az eszközön történő címkézés a magánélet védelme érdekében. A következő határt a feliratozási modellek jelentik, amelyek egy zeneszám teljes, természetes nyelvű leírását írják le különálló címkék helyett.

Valós megvalósítás

A Spotify és hasonló szolgáltatások műfaji és hangulati címkékkel látják el az új feltöltéseket a „Discover Weekly” stílusajánlások érdekében

Produkciós zenei könyvtárak, amelyek lehetővé teszik a videószerkesztők számára, hogy több millió számot szűrjenek „felemelő vállalati” vagy „feszült filmes”

DJ-szoftver automatikusan észleli a BPM-et, a kulcsot és az energiát, így a zeneszámok automatikusan rendezhetők és ütemezhetők

Zenei licencelési platformok, amelyek megcímkézik a hangszerelést és a hangulatot, hogy a dalokat a hirdetési tájékoztatókhoz illesszék

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Music Auto-Tagging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Zene címkézés Transformers segítségével

Gyakran ismételt kérdések

What is Music Auto-Tagging?

A zene automatikus címkézése gépi tanulást használ egy dal meghallgatására, és automatikusan leíró címkéket, például műfajt, hangulatot, hangszereket és tempót csatol hozzá. Ez hajtja a keresési, ajánlási és szervezési funkciókat minden nagyobb streaming szolgáltatás mögött.

Miért használ a zene automatikus címkézése szigmoid aktiválásokat a kimeneti rétegében a softmax helyett?

Az automatikus címkézés több címkéből áll: egy szám egyszerre lehet „rock”, „energetikus” és „gitáros”, tehát minden címkének saját független valószínűsége van a szigmoidon keresztül.

Milyen bemeneti reprezentációt táplál be a legtöbb modern automatikus címkéző modell a neurális hálózatába?

A hangot általában mel-spektrogrammá alakítják át, egy idő-frekvenciás képpé, amelyet a CNN ugyanúgy képes feldolgozni, mint egy fényképet.

Miért a mel skálát használják a sima lineáris frekvencia skála helyett?

A mel skála a frekvenciákat az emberi hangmagasság érzékeléséhez igazítja, nagyobb felbontást adva a fülünket leginkább érdeklő alacsonyabb frekvenciáknak.

Mi jelent nagy kihívást az automatikus címkézési modellek valós adatkészleteken való betanítása során?

A tömegből származó címkék következetlenek, és sok érvényes címke egyszerűen hiányzik, és egyes címkék sokkal gyakrabban jelennek meg, mint mások, ami megnehezíti a tanulást.

Melyik adatkészletet használják általában a zenei automatikus címkéző rendszerek betanításához és összehasonlításához?

A MagnaTagATune a Million Song Dataset-tel és az MTG-Jamendo-val együtt a zenei címkézés szabványos referenciaértéke. Az ImageNet a képekhez, a SQuAD a szöveges minőségbiztosításhoz és a LibriSpeech a beszédhez.