PRZEWODNIK AI audio

Automatyczne tagowanie muzyki

Automatyczne tagowanie muzyki wykorzystuje uczenie maszynowe do słuchania utworu i automatycznego dołączania opisowych etykiet, takich jak gatunek, nastrój, instrumenty i tempo.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It powers the search, recommendation, and organization features behind every major streaming service.

Głębokie nurkowanie

Automatyczne tagowanie muzyki traktuje etykietowanie jako problem klasyfikacji wielu wytwórni: pojedynczy utwór może być jednocześnie „rockowy”, „energetyczny” i „napędzany gitarą”. Nowoczesne systemy przekształcają surowy dźwięk w spektrogram mel (obraz dźwięku w czasie i częstotliwości) i przepuszczają go przez splotową lub opartą na transformatorze sieć neuronową trenowaną na zbiorach danych takich jak MagnaTagATune, Million Song Dataset lub MTG-Jamendo. Model podaje prawdopodobieństwo dla każdego możliwego znacznika. Ponieważ znaczniki stosowane przez człowieka są zaszumione i niekompletne, szkolenie jest trudne, a etykiety są niezrównoważone. Ten sam szkielet w coraz większym stopniu opiera się na samonadzorowanych modelach audio, więc pojedyncza reprezentacja obsługuje tagowanie, rekomendacje i wyszukiwanie podobieństw, zamiast budować oddzielny model dla każdego tagu.

Wgląd techniczny

Dźwięk jest dzielony na krótkie, nakładające się klatki, przekształcany za pomocą krótkotrwałej transformaty Fouriera i mapowany na skalę mel, która naśladuje percepcję wysokości tonu przez człowieka. CNN odczytuje ten spektrogram jak obraz, ucząc się filtrów wzorców harmonicznych, rytmu i barwy. Ostatnia warstwa wykorzystuje aktywacje sigmoidalne (nie softmax), ponieważ znaczniki są niezależne i niewyłączne oraz są zoptymalizowane pod kątem binarnej entropii krzyżowej na setkach możliwych etykiet.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość automatycznego tagowania muzyki

Automatyczne tagowanie zmierza w stronę systemów z otwartym słownictwem i możliwością wyszukiwania tekstu, zbudowanych na modelach języka audio, takich jak CLAP, w których użytkownicy wyszukują „wymarzoną ścieżkę syntezatorową do nauki” bez predefiniowanych tagów. Spodziewaj się ściślejszego powiązania z generatywnymi narzędziami muzycznymi, lepszej obsługi rzadkich gatunków i muzyki niezachodniej oraz tagowania na urządzeniu w celu zapewnienia prywatności. Modele napisów, które zapisują pełny opis utworu w języku naturalnym, a nie oddzielne znaczniki, to kolejna granica.

Implementacja w świecie rzeczywistym

Spotify i podobne serwisy oznaczają nowe przesłane treści według gatunku i nastroju, aby uzyskać rekomendacje w stylu „Discover Weekly”.

Biblioteki muzyki produkcyjnej umożliwiające edytorom wideo filtrowanie milionów standardowych utworów według „podnoszących na duchu korporacyjnych” lub „napiętych filmów”

Oprogramowanie dla DJ-ów automatycznie wykrywające BPM, tonację i energię, dzięki czemu utwory mogą być sortowane i dopasowywane automatycznie

Platformy licencjonujące muzykę oznaczające instrumentację i nastrój w celu dopasowania utworów do treści reklam

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Music Auto-Tagging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Tagowanie muzyki za pomocą Transformers

Często zadawane pytania

What is Music Auto-Tagging?

Automatyczne tagowanie muzyki wykorzystuje uczenie maszynowe do słuchania utworu i automatycznego dołączania opisowych etykiet, takich jak gatunek, nastrój, instrumenty i tempo. Obsługuje funkcje wyszukiwania, rekomendacji i organizacji stojące za każdą większą usługą przesyłania strumieniowego.

Dlaczego automatyczne tagowanie muzyki wykorzystuje aktywacje sigmoidalne w warstwie wyjściowej zamiast softmax?

Automatyczne tagowanie obsługuje wiele etykiet: utwór może być jednocześnie „rockowy”, „energetyczny” i „gitarowy”, więc każdy tag potrzebuje własnego, niezależnego prawdopodobieństwa za pośrednictwem sigmoidy.

Jaką reprezentację wejściową większość nowoczesnych modeli automatycznego tagowania wprowadza do swojej sieci neuronowej?

Dźwięk jest zwykle konwertowany na spektrogram mel, czyli obraz czasowo-częstotliwościowy, który CNN może przetwarzać podobnie jak fotografię.

Dlaczego używana jest skala mel zamiast zwykłej liniowej skali częstotliwości?

Skala Mel rozmieszcza częstotliwości tak, aby odpowiadały ludzkiemu postrzeganiu wysokości dźwięku, zapewniając większą rozdzielczość niższym częstotliwościom, na których najbardziej zależy naszym uszom.

Jakie jest główne wyzwanie podczas uczenia modeli automatycznego tagowania na rzeczywistych zbiorach danych?

Tagi pochodzące od tłumów są niespójne i po prostu brakuje wielu prawidłowych tagów, a niektóre tagi pojawiają się znacznie częściej niż inne, co utrudnia naukę.

Który zbiór danych jest powszechnie używany do uczenia i testowania systemów automatycznego tagowania muzyki?

MagnaTagATune, wraz ze zbiorem danych Million Song i MTG-Jamendo, jest standardowym punktem odniesienia dla tagowania muzyki. ImageNet służy do obrazów, SQuAD do kontroli jakości tekstu, a LibriSpeech do mowy.