Tagowanie muzyki za pomocą Transformers
Tagowanie muzyki wykorzystuje modele transformatorów do słuchania utworu i przewidywania opisowych etykiet, takich jak gatunek, nastrój, instrumenty i tempo.
Przegląd
It powers search, recommendation, and auto-organization across huge music catalogs.
Głębokie nurkowanie
Automatyczne tagowanie muzyki to problem związany z klasyfikacją wielu wytwórni: jeden utwór może być jednocześnie „rockowy”, „energetyczny”, „gitarowy” i „instrumentalny”. Transformatory radzą sobie z tym, przekształcając dźwięk w spektrogram (obraz czasowo-częstotliwościowy) i przepuszczając jego fragmenty przez warstwy samouważności, podobnie jak transformator wizyjny przetwarza fragmenty obrazu. Modele takie jak Audio Spectrogram Transformer (AST) i MERT uczą się wzorców dalekiego zasięgu na całej ścieżce, rejestrując związek refrenu z wersetem oddalonym o kilka minut. Wiele z nich jest wstępnie szkolonych, samodzielnie nadzorowanych na milionach nieoznaczonych klipów, a następnie dostrajanych na podstawie oznakowanych zestawów danych, takich jak MagnaTagATune lub Million Song Dataset. Ponieważ znaczniki nie wykluczają się wzajemnie, ostatnia warstwa wykorzystuje wyniki sigmoidalne oceniane w oparciu o punkty odniesienia, takie jak średnia średnia precyzja i ROC-AUC.
Wgląd techniczny
Surowy dźwięk jest konwertowany na spektrogram log-Mel, dzielony na nakładające się fragmenty i osadzany liniowo za pomocą kodowania pozycyjnego. Samouważność pozwala każdemu patchowi ważyć każdy inny patch, więc odległe wydarzenia muzyczne wpływają na każdy tag. W przeciwieństwie do klasyfikatorów obrazów z pojedynczą etykietą, tagowanie muzyczne stosuje sigmoidę na tag, a nie jeden softmax, ponieważ etykiety współwystępują. Samonadzorowane szkolenie wstępne (przewidywanie zamaskowanych tokenów audio) zapewnia mocne reprezentacje przed dostrojeniem w mniejszych, oznakowanych zestawach.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość tagowania muzyki za pomocą Transformers
Tagowanie łączy się ze zrozumieniem języka naturalnego, dzięki czemu możesz wyszukiwać „wymarzone lo-fi z trzaskiem winylu do nauki” zamiast przycisków z ustalonymi gatunkami. Kontrastowe modele audio-tekstowe, takie jak CLAP, łączą muzykę i opisy w jednej przestrzeni, umożliwiając stosowanie tagów zero-shot, których nigdy nie widziano w szkoleniach. Spodziewaj się bogatszych, bardziej szczegółowych etykiet, lepszej obsługi gatunków fusion i tagowania na urządzeniu w celu zapewnienia prywatności. Debaty na temat praw i atrybucji dotyczące szkoleń dotyczących katalogów chronionych prawem autorskim będą miały wpływ na to, jakie dane będą mogły wykorzystywać te modele.
Implementacja w świecie rzeczywistym
Automatyczne generowanie tagów gatunku i nastroju, dzięki czemu usługi przesyłania strumieniowego mogą tworzyć playlisty „skupiające się” lub „treningowe”.
Umożliwianie bibliotekom muzycznym udostępniania „optymistycznych utworów gitary akustycznej” edytorom wideo poszukującym licencji na synchronizację
Zasilanie silników rekomendacyjnych, które znajdują utwory podobne brzmieniowo, wykraczające poza to, co wyraźnie ocenili użytkownicy
Automatyczne organizowanie kolekcji sampli producenta według wykrytego instrumentu, tonacji i tempa
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Music Tagging with Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Automatyczne tagowanie muzyki
Często zadawane pytania
What is Music Tagging with Transformers?
Tagowanie muzyki wykorzystuje modele transformatorów do słuchania utworu i przewidywania opisowych etykiet, takich jak gatunek, nastrój, instrumenty i tempo. Umożliwia wyszukiwanie, rekomendowanie i automatyczną organizację w ogromnych katalogach muzycznych.
Dlaczego tagowanie muzyki jest traktowane jako problem wielu wytwórni?
Utwór może być jednocześnie rockowy, energetyczny i gitarowy, więc do jednego utworu można zastosować wiele tagów.
Jakiej reprezentacji wejściowej zwykle używają znaczniki transformatorów?
Dźwięk jest konwertowany na spektrogram czasowo-częstotliwościowy, następnie poprawiany i przesyłany poprzez samouważność, podobnie jak plamy obrazu.
Dlaczego modele tagowania muzyki używają sigmoidalnego wyjścia na tag zamiast jednego softmax?
Softmax wymusza sumowanie prawdopodobieństw do jednego (jeden wybór); sigmoid pozwala, aby każdy znacznik był niezależnie prawdziwy.
Jaka jest rola samonadzorowanego szkolenia wstępnego w przypadku modeli takich jak MERT?
Wstępne uczenie się na podstawie przewidywania zamaskowanego dźwięku w dużych, nieoznakowanych korpusach tworzy reprezentacje, które są później dostrajane na podstawie oznakowanych danych.
Który zbiór danych jest powszechnie używany do dostrajania i porównywania tagerów muzycznych?
MagnaTagATune i Million Song Dataset to standardowe testy porównawcze muzyki ze znacznikami; MNIST i ImageNet to zestawy obrazów.