PRZEWODNIK AI audio

Tagowanie muzyki za pomocą Transformers

Tagowanie muzyki wykorzystuje modele transformatorów do słuchania utworu i przewidywania opisowych etykiet, takich jak gatunek, nastrój, instrumenty i tempo.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It powers search, recommendation, and auto-organization across huge music catalogs.

Głębokie nurkowanie

Automatyczne tagowanie muzyki to problem związany z klasyfikacją wielu wytwórni: jeden utwór może być jednocześnie „rockowy”, „energetyczny”, „gitarowy” i „instrumentalny”. Transformatory radzą sobie z tym, przekształcając dźwięk w spektrogram (obraz czasowo-częstotliwościowy) i przepuszczając jego fragmenty przez warstwy samouważności, podobnie jak transformator wizyjny przetwarza fragmenty obrazu. Modele takie jak Audio Spectrogram Transformer (AST) i MERT uczą się wzorców dalekiego zasięgu na całej ścieżce, rejestrując związek refrenu z wersetem oddalonym o kilka minut. Wiele z nich jest wstępnie szkolonych, samodzielnie nadzorowanych na milionach nieoznaczonych klipów, a następnie dostrajanych na podstawie oznakowanych zestawów danych, takich jak MagnaTagATune lub Million Song Dataset. Ponieważ znaczniki nie wykluczają się wzajemnie, ostatnia warstwa wykorzystuje wyniki sigmoidalne oceniane w oparciu o punkty odniesienia, takie jak średnia średnia precyzja i ROC-AUC.

Wgląd techniczny

Surowy dźwięk jest konwertowany na spektrogram log-Mel, dzielony na nakładające się fragmenty i osadzany liniowo za pomocą kodowania pozycyjnego. Samouważność pozwala każdemu patchowi ważyć każdy inny patch, więc odległe wydarzenia muzyczne wpływają na każdy tag. W przeciwieństwie do klasyfikatorów obrazów z pojedynczą etykietą, tagowanie muzyczne stosuje sigmoidę na tag, a nie jeden softmax, ponieważ etykiety współwystępują. Samonadzorowane szkolenie wstępne (przewidywanie zamaskowanych tokenów audio) zapewnia mocne reprezentacje przed dostrojeniem w mniejszych, oznakowanych zestawach.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość tagowania muzyki za pomocą Transformers

Tagowanie łączy się ze zrozumieniem języka naturalnego, dzięki czemu możesz wyszukiwać „wymarzone lo-fi z trzaskiem winylu do nauki” zamiast przycisków z ustalonymi gatunkami. Kontrastowe modele audio-tekstowe, takie jak CLAP, łączą muzykę i opisy w jednej przestrzeni, umożliwiając stosowanie tagów zero-shot, których nigdy nie widziano w szkoleniach. Spodziewaj się bogatszych, bardziej szczegółowych etykiet, lepszej obsługi gatunków fusion i tagowania na urządzeniu w celu zapewnienia prywatności. Debaty na temat praw i atrybucji dotyczące szkoleń dotyczących katalogów chronionych prawem autorskim będą miały wpływ na to, jakie dane będą mogły wykorzystywać te modele.

Implementacja w świecie rzeczywistym

Automatyczne generowanie tagów gatunku i nastroju, dzięki czemu usługi przesyłania strumieniowego mogą tworzyć playlisty „skupiające się” lub „treningowe”.

Umożliwianie bibliotekom muzycznym udostępniania „optymistycznych utworów gitary akustycznej” edytorom wideo poszukującym licencji na synchronizację

Zasilanie silników rekomendacyjnych, które znajdują utwory podobne brzmieniowo, wykraczające poza to, co wyraźnie ocenili użytkownicy

Automatyczne organizowanie kolekcji sampli producenta według wykrytego instrumentu, tonacji i tempa

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Music Tagging with Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Automatyczne tagowanie muzyki

Często zadawane pytania

What is Music Tagging with Transformers?

Tagowanie muzyki wykorzystuje modele transformatorów do słuchania utworu i przewidywania opisowych etykiet, takich jak gatunek, nastrój, instrumenty i tempo. Umożliwia wyszukiwanie, rekomendowanie i automatyczną organizację w ogromnych katalogach muzycznych.

Dlaczego tagowanie muzyki jest traktowane jako problem wielu wytwórni?

Utwór może być jednocześnie rockowy, energetyczny i gitarowy, więc do jednego utworu można zastosować wiele tagów.

Jakiej reprezentacji wejściowej zwykle używają znaczniki transformatorów?

Dźwięk jest konwertowany na spektrogram czasowo-częstotliwościowy, następnie poprawiany i przesyłany poprzez samouważność, podobnie jak plamy obrazu.

Dlaczego modele tagowania muzyki używają sigmoidalnego wyjścia na tag zamiast jednego softmax?

Softmax wymusza sumowanie prawdopodobieństw do jednego (jeden wybór); sigmoid pozwala, aby każdy znacznik był niezależnie prawdziwy.

Jaka jest rola samonadzorowanego szkolenia wstępnego w przypadku modeli takich jak MERT?

Wstępne uczenie się na podstawie przewidywania zamaskowanego dźwięku w dużych, nieoznakowanych korpusach tworzy reprezentacje, które są później dostrajane na podstawie oznakowanych danych.

Który zbiór danych jest powszechnie używany do dostrajania i porównywania tagerów muzycznych?

MagnaTagATune i Million Song Dataset to standardowe testy porównawcze muzyki ze znacznikami; MNIST i ImageNet to zestawy obrazów.