Oszacowanie paku CREPE
CREPE to model głębokiego uczenia się, który szacuje częstotliwość podstawową (wysokość) monofonicznego sygnału audio bezpośrednio na podstawie jego surowego kształtu fali.
Przegląd
It set a new accuracy standard for pitch tracking, especially on noisy or difficult recordings.
Głębokie nurkowanie
CREPE (Convolutional Representation for Pitch Estimation), wprowadzone w 2018 roku przez Kima, Salamona, Li i Bello, przewiduje wysokość dźwięku o pojedynczej nucie (monofonicznego), takiego jak głos śpiewany lub instrument solowy. W przeciwieństwie do klasycznych algorytmów, takich jak YIN czy pYIN, które opierają się na autokorelacji sygnału, CREPE jest głęboką splotową siecią neuronową trenowaną bezpośrednio na ramkach audio w dziedzinie czasu. Ujmuje szacowanie tonu jako problem klasyfikacyjny: generuje rozkład prawdopodobieństwa w 360 przedziałach wysokości dźwięku obejmujących mniej więcej sześć oktaw, każdy oddalony od siebie o 20 centów. Kosz z najwyższą aktywacją, udoskonalony lokalną średnią ważoną, daje szacowaną częstotliwość plus wynik pewności. CREPE okazało się znacznie solidniejsze niż metody przetwarzania sygnału, zwłaszcza w warunkach hałasu, i obecnie jest standardowym elementem wielu procesów analizy muzyki i mowy.
Wgląd techniczny
CREPE pobiera ramkę audio zawierającą 1024 próbki i przepuszcza ją przez sześć ułożonych w stos warstw splotowych, kończąc na warstwie wyjściowej składającej się z 360 jednostek z aktywacjami sigmoidalnymi. Każda jednostka odpowiada wysokości tonu oddalonej od siebie o 20 centów w około sześciu oktawach. Sieć jest trenowana przy użyciu binarnej entropii krzyżowej względem celu zamazanego Gaussa, wyśrodkowanego na rzeczywistym boisku. Podsumowując, przewidywana częstotliwość jest lokalną średnią ważoną aktywacji wokół przedziału szczytowego, a wysokość piku służy jako wartość ufności.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość szacowania skoku CREPE
Szacowanie wysokości dźwięku zmierza w kierunku wspólnych modeli obsługujących polifonię (wiele jednoczesnych dźwięków), mniejszych opóźnień w przypadku strojenia w czasie rzeczywistym i automatycznej harmonii oraz mniejszych sieci destylowanych działających na telefonach i urządzeniach wbudowanych. Dane wyjściowe CREPE są w coraz większym stopniu wykorzystywane w dalszych zadaniach, takich jak automatyczna transkrypcja, korekcja głosu i ekspresyjna analiza wydajności. Samonadzorowane i wielozadaniowe podejście, które uczy się wysokości dźwięku wraz z barwą i artykulacją, prawdopodobnie rozszerzy dokładność w stylu CREPE poza czysty dźwięk monofoniczny.
Implementacja w świecie rzeczywistym
Śledzenie głosu piosenkarza w celu uzyskania informacji zwrotnych dotyczących strojenia w czasie rzeczywistym w aplikacjach do treningu wokalnego
Sterowanie narzędziami do automatycznego dostrajania i korekcji wysokości dźwięku za pomocą dokładnych krzywych częstotliwości podstawowej
Transkrypcja melodii instrumentów solowych na format MIDI lub nuty
Analiza intonacji i wibrato w edukacji muzycznej i badaniach wykonawczych
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CREPE Pitch Estimation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
TTS ze sterowaniem FastPitch Pitch
Często zadawane pytania
What is CREPE Pitch Estimation?
CREPE to model głębokiego uczenia się, który szacuje częstotliwość podstawową (wysokość) monofonicznego sygnału audio bezpośrednio na podstawie jego surowego kształtu fali. Ustanawia nowy standard dokładności śledzenia wysokości dźwięku, szczególnie w przypadku hałaśliwych lub trudnych nagrań.
Co CREPE szacuje na podstawie sygnału audio?
CREPE przewiduje częstotliwość podstawową, tj. postrzeganą wysokość dźwięku monofonicznego.
CREPE przeznaczony jest przede wszystkim do jakiego rodzaju dźwięku?
CREPE szacuje wysokość dźwięku dla sygnałów monofonicznych, takich jak pojedynczy głos lub instrument solowy.
W jaki sposób CREPE wewnętrznie formułuje zadanie oszacowania wysokości tonu?
CREPE generuje rozkład prawdopodobieństwa dla 360 pojemników, traktując oszacowanie jako klasyfikację.
Co CREPE przyjmuje jako swój bezpośredni wkład?
W przeciwieństwie do metod opartych na spektrogramach, CREPE działa na surowych klatkach przebiegów poprzez warstwy splotowe.
W jakiej przybliżonej odległości znajdują się pojemniki na śmieci firmy CREPE?
CREPE wykorzystuje 360 pojemników oddalonych od siebie o 20 centów, co daje rozdzielczość poniżej półtonu w około sześciu oktawach.