Wyszukiwanie informacji muzycznych
Wyszukiwanie informacji muzycznych (MIR) to dziedzina, która uczy komputery analizowania, rozumienia i wyszukiwania muzyki na podstawie sygnałów audio i zapisów nutowych.
Przegląd
It powers everything from Shazam-style song identification to Spotify's recommendations and automatic music tagging.
Głębokie nurkowanie
Wyszukiwanie informacji muzycznych opiera się na przetwarzaniu sygnałów, uczeniu maszynowym i muzykologii. Badacze wyodrębniają z dźwięku takie cechy, jak spektrogram, współczynniki cepstralne częstotliwości mel (MFCC), wektory chrominancji i tempo, aby uchwycić wysokość, barwę, rytm i harmonię. Na ich podstawie systemy MIR wykonują takie zadania, jak śledzenie rytmu, wykrywanie tonacji, klasyfikacja gatunków, wyodrębnianie melodii, identyfikacja coverów utworów i rekomendowanie muzyki. Coroczna konferencja ISMIR i kampania ewaluacyjna MIREX napędzają postęp od 2000 roku. Współczesny MIR w coraz większym stopniu wykorzystuje głębokie uczenie się, uczenie sieci splotowych i transformatorowych bezpośrednio na spektrogramach oraz samonadzorowane osadzanie dźwięku, zastępując wiele ręcznie opracowanych funkcji, jednocześnie nadal opierając się na koncepcjach teorii muzyki do etykietowania i interpretacji wyników.
Wgląd techniczny
Większość potoków MIR rozpoczyna się od konwersji dźwięku na reprezentację czasowo-częstotliwościową przy użyciu krótkotrwałej transformaty Fouriera, często zniekształconej do skali częstotliwości mel lub logarytmicznej, która odzwierciedla ludzki słuch. Funkcje Chroma łączą wszystkie oktawy w 12 klas wysokości dźwięku do zadań związanych z harmonią, podczas gdy MFCC kompresują barwę. Sieć neuronowa lub klasyfikator następnie odwzorowuje te reprezentacje na etykiety takie jak tempo, tonacja lub gatunek. Ocena wykorzystuje metryki specyficzne dla zadania, takie jak miara F do śledzenia uderzeń.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość wyszukiwania informacji muzycznych
MIR zmierza w stronę dużych, samodzielnie nadzorowanych modeli audio, które uczą się ogólnych reprezentacji muzycznych z milionów nieoznakowanych utworów, a następnie dostosowują się do konkretnych zadań na podstawie niewielkiej ilości oznaczonych danych. Spodziewaj się ściślejszej integracji z generatywnymi modelami muzyki, wyszukiwania muzyki w języku naturalnym („znajdź optymistyczny utwór jazzowy za pomocą pędzli”) i lepszej obsługi niezachodnich tradycji, które zaniedbują standardowe modele chrominancji i kluczowych. Systemy multimodalne łączące dźwięk, teksty, partytury i metadane sprawią, że rekomendacje i odkrywanie będą znacznie bardziej dopracowane i spersonalizowane.
Implementacja w świecie rzeczywistym
Shazam i podobne aplikacje identyfikują piosenkę na podstawie dźwiękowego nagrania telefonicznego za pomocą odcisków palców
Spotify i Apple Music generują rekomendacje i automatyczne playlisty na podstawie wyuczonego podobieństwa dźwięków
Automatyczne tagowanie nastroju, gatunku i instrumentów dla ogromnych bibliotek muzyki produkcyjnej i zasobów audio
Wykrywanie wersji tytułowych i potencjalnych odpowiedników praw autorskich na platformach takich jak YouTube Content ID
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Music Information Retrieval quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Automatyczne tagowanie muzyki
Często zadawane pytania
What is Music Information Retrieval?
Wyszukiwanie informacji muzycznych (MIR) to dziedzina, która uczy komputery analizowania, rozumienia i wyszukiwania muzyki na podstawie sygnałów audio i zapisów nutowych. Obsługuje wszystko, od identyfikacji utworów w stylu Shazam po rekomendacje Spotify i automatyczne tagowanie muzyki.
Jakich cech chrominancji używa się głównie do przechwytywania w formacie MIR?
Funkcja Chroma składa energię ze wszystkich oktaw na 12 klas wysokości dźwięku, dzięki czemu doskonale nadaje się do analizy harmonii, akordów i tonacji.
Która transformacja jest najczęściej pierwszym krokiem w przekształcaniu dźwięku w reprezentację czasowo-częstotliwościową?
Krótkoczasowa transformata Fouriera tworzy spektrogram, będący podstawą większości funkcji i modeli MIR.
Na czym aplikacja taka jak Shazam identyfikuje utwór?
Fingerprinting tworzy kompaktowe, odporne na zakłócenia skróty szczytów audio, które są dopasowywane do indeksowanej bazy danych.
Która doroczna konferencja jest najbardziej kojarzona z badaniami MIR?
Centralnym miejscem spotkań w tej dziedzinie jest ISMIR, konferencja Międzynarodowego Towarzystwa Wyszukiwania Informacji Muzycznych.
Jaka jest kluczowa zaleta samonadzorowanych modeli audio w nowoczesnym MIR?
Samonadzorowane uczenie się wydobywa ogólną strukturę muzyczną z nieoznakowanego dźwięku, redukując potrzebę stosowania kosztownych, ręcznie opisywanych zbiorów danych.