PRZEWODNIK AI audio

Automatyczna transkrypcja muzyki

Automatyczna transkrypcja muzyki (AMT) przekształca surowe nagranie audio muzyki w zapis symboliczny, taki jak nuty, MIDI lub rolka fortepianu.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It tackles one of the hardest problems in audio AI: untangling many overlapping notes played at once.

Głębokie nurkowanie

Systemy AMT nasłuchują kształtu fali audio i wysyłają informację, jakie nuty są odtwarzane, kiedy się rozpoczynają, jak długo trwają, a czasami także na jakim instrumencie je gra. Podstawowym wyzwaniem jest polifonia: gdy kilka nut brzmi jednocześnie, ich harmoniczne nakładają się i rozmywają w widmie częstotliwości, więc pojedyncze C i G mogą być trudne do oddzielenia od pojedynczej głośniejszej nuty. Nowoczesne systemy konwertują dźwięk na reprezentację czasowo-częstotliwościową, taką jak spektrogram mel lub transformacja Constant-Q, a następnie wykorzystują głębokie sieci neuronowe do przewidywania początków, przesunięć i wysokości nut. Model Onsets and Frames firmy Google był przełomem w transkrypcji fortepianów, podczas gdy nowsze modele transformatorów, takie jak MT3, umożliwiają transkrypcję wielu instrumentów jednocześnie.

Wgląd techniczny

Kluczowym spostrzeżeniem jest oddzielenie wykrywania początku od wykrywania wysokości skoku na poziomie klatki. Modele takie jak Onsets i Frames wykorzystują jedną głowicę sieciową do dokładnego określenia momentu rozpoczęcia nuty (ostre, energetyczne wydarzenie), a drugą do śledzenia wysokości dźwięków w każdej klatce. Przewidywania początku następnie bramkują dane wyjściowe klatek, radykalnie redukując fałszywe nuty. Transformacja Constant-Q pomaga, ponieważ logarytmicznie rozdziela przedziały częstotliwości, dopasowując wysokość tonów muzycznych oddalonych o oktawę.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość automatycznej transkrypcji muzyki

AMT przechodzi od fortepianu solowego w stronę niezawodnej transkrypcji wieloinstrumentalnej i pełnopasmowej, w tym perkusji, wokalu i technik ekspresyjnych, takich jak zakręty i vibrato. Architektury transformatorów wyszkolone na dużych syntetycznych i wyrównanych zbiorach danych wypełniają tę lukę. Oczekuj ściślejszej integracji z separacją źródeł, transkrypcją w czasie rzeczywistym podczas występów na żywo oraz narzędziami, które rejestrują mikrotiming i dynamikę, a nie tylko nuty. Celem długoterminowym jest system, który zamieni dowolne nagranie w edytowalną, czytelną dla człowieka partyturę.

Implementacja w świecie rzeczywistym

AnthemScore i podobne aplikacje konwertujące nagrania MP3 na edytowalne nuty dla muzyków uczących się piosenek ze słuchu

Ekstrakcja MIDI z nagrania fortepianu, dzięki czemu producent może zmienić brzmienie lub kwantyzować wykonanie w DAW

Narzędzia do edukacji muzycznej, które porównują nuty grane przez ucznia z partyturą, aby wskazać błędne lub pominięte nuty

Muzykolodzy przepisując nagrania historyczne lub improwizowane (takie jak solówki jazzowe) na zapis w celu analizy

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Automatic Music Transcription quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Symboliczne pokolenie muzyki

Często zadawane pytania

What is Automatic Music Transcription?

Automatyczna transkrypcja muzyki (AMT) przekształca surowe nagranie audio muzyki w zapis symboliczny, taki jak nuty, MIDI lub rolka fortepianu. Rozwiązuje jeden z najtrudniejszych problemów sztucznej inteligencji audio: rozplątanie wielu nakładających się nut granych jednocześnie.

Co przede wszystkim generuje automatyczna transkrypcja muzyki?

AMT konwertuje nagranie audio na zapis symboliczny, taki jak MIDI, rolka fortepianu lub nuty opisujące grane nuty.

Dlaczego transkrypcja muzyki polifonicznej jest szczególnie trudna?

Kiedy jednocześnie brzmi wiele nut, ich harmonie nakładają się na siebie, co utrudnia oddzielenie poszczególnych tonów.

Co było godnego uwagi w modelu Początków i Ramek Google?

W funkcjach Onsets i Frames jedna głowica umożliwiała wykrywanie precyzyjnych początków nut, a druga – utrzymywanie wysokich tonów, przy czym nastawienia sterowały sygnałem wyjściowym klatki.

Dlaczego transformacja Constant-Q jest przydatna w muzyce?

Wysokość tonów muzycznych jest rozmieszczona logarytmicznie (oktawy mają podwójną częstotliwość), a przedziały CQT z odstępami logarytmicznymi są naturalnie do tego dopasowane.

Do czego odnosi się „początek” w transkrypcji?

Początek to ostry, energiczny moment, w którym rozpoczyna się nuta, który jest łatwiejszy do precyzyjnego zlokalizowania niż jego podtrzymanie.