PRZEWODNIK AI audio

Oszacowanie paku CREPE

CREPE to model głębokiego uczenia się, który szacuje częstotliwość podstawową (wysokość) monofonicznego sygnału audio bezpośrednio na podstawie jego surowego kształtu fali.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It set a new accuracy standard for pitch tracking, especially on noisy or difficult recordings.

Głębokie nurkowanie

CREPE (Convolutional Representation for Pitch Estimation), wprowadzone w 2018 roku przez Kima, Salamona, Li i Bello, przewiduje wysokość dźwięku o pojedynczej nucie (monofonicznego), takiego jak głos śpiewany lub instrument solowy. W przeciwieństwie do klasycznych algorytmów, takich jak YIN czy pYIN, które opierają się na autokorelacji sygnału, CREPE jest głęboką splotową siecią neuronową trenowaną bezpośrednio na ramkach audio w dziedzinie czasu. Ujmuje szacowanie tonu jako problem klasyfikacyjny: generuje rozkład prawdopodobieństwa w 360 przedziałach wysokości dźwięku obejmujących mniej więcej sześć oktaw, każdy oddalony od siebie o 20 centów. Kosz z najwyższą aktywacją, udoskonalony lokalną średnią ważoną, daje szacowaną częstotliwość plus wynik pewności. CREPE okazało się znacznie solidniejsze niż metody przetwarzania sygnału, zwłaszcza w warunkach hałasu, i obecnie jest standardowym elementem wielu procesów analizy muzyki i mowy.

Wgląd techniczny

CREPE pobiera ramkę audio zawierającą 1024 próbki i przepuszcza ją przez sześć ułożonych w stos warstw splotowych, kończąc na warstwie wyjściowej składającej się z 360 jednostek z aktywacjami sigmoidalnymi. Każda jednostka odpowiada wysokości tonu oddalonej od siebie o 20 centów w około sześciu oktawach. Sieć jest trenowana przy użyciu binarnej entropii krzyżowej względem celu zamazanego Gaussa, wyśrodkowanego na rzeczywistym boisku. Podsumowując, przewidywana częstotliwość jest lokalną średnią ważoną aktywacji wokół przedziału szczytowego, a wysokość piku służy jako wartość ufności.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość szacowania skoku CREPE

Szacowanie wysokości dźwięku zmierza w kierunku wspólnych modeli obsługujących polifonię (wiele jednoczesnych dźwięków), mniejszych opóźnień w przypadku strojenia w czasie rzeczywistym i automatycznej harmonii oraz mniejszych sieci destylowanych działających na telefonach i urządzeniach wbudowanych. Dane wyjściowe CREPE są w coraz większym stopniu wykorzystywane w dalszych zadaniach, takich jak automatyczna transkrypcja, korekcja głosu i ekspresyjna analiza wydajności. Samonadzorowane i wielozadaniowe podejście, które uczy się wysokości dźwięku wraz z barwą i artykulacją, prawdopodobnie rozszerzy dokładność w stylu CREPE poza czysty dźwięk monofoniczny.

Implementacja w świecie rzeczywistym

Śledzenie głosu piosenkarza w celu uzyskania informacji zwrotnych dotyczących strojenia w czasie rzeczywistym w aplikacjach do treningu wokalnego

Sterowanie narzędziami do automatycznego dostrajania i korekcji wysokości dźwięku za pomocą dokładnych krzywych częstotliwości podstawowej

Transkrypcja melodii instrumentów solowych na format MIDI lub nuty

Analiza intonacji i wibrato w edukacji muzycznej i badaniach wykonawczych

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CREPE Pitch Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

TTS ze sterowaniem FastPitch Pitch

Często zadawane pytania

What is CREPE Pitch Estimation?

CREPE to model głębokiego uczenia się, który szacuje częstotliwość podstawową (wysokość) monofonicznego sygnału audio bezpośrednio na podstawie jego surowego kształtu fali. Ustanawia nowy standard dokładności śledzenia wysokości dźwięku, szczególnie w przypadku hałaśliwych lub trudnych nagrań.

Co CREPE szacuje na podstawie sygnału audio?

CREPE przewiduje częstotliwość podstawową, tj. postrzeganą wysokość dźwięku monofonicznego.

CREPE przeznaczony jest przede wszystkim do jakiego rodzaju dźwięku?

CREPE szacuje wysokość dźwięku dla sygnałów monofonicznych, takich jak pojedynczy głos lub instrument solowy.

W jaki sposób CREPE wewnętrznie formułuje zadanie oszacowania wysokości tonu?

CREPE generuje rozkład prawdopodobieństwa dla 360 pojemników, traktując oszacowanie jako klasyfikację.

Co CREPE przyjmuje jako swój bezpośredni wkład?

W przeciwieństwie do metod opartych na spektrogramach, CREPE działa na surowych klatkach przebiegów poprzez warstwy splotowe.

W jakiej przybliżonej odległości znajdują się pojemniki na śmieci firmy CREPE?

CREPE wykorzystuje 360 ​​pojemników oddalonych od siebie o 20 centów, co daje rozdzielczość poniżej półtonu w około sześciu oktawach.