PRZEWODNIK AI audio

Współczynniki cepstralne częstotliwości Mel

Współczynniki cepstralne częstotliwości Mel (MFCC) to zwarty zestaw liczb, które podsumowują kształt widma częstotliwości dźwięku w sposób, w jaki odbierają je ludzkie uszy.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

For decades they were the workhorse feature for speech recognition, speaker identification, and music analysis.

Głębokie nurkowanie

MFCC konwertują krótki fragment dźwięku na około 13 liczb, które oddają jego barwę. Rurociąg pobiera kształt fali, dzieli go na klatki o długości około 25 ms, oblicza widmo mocy za pomocą transformaty Fouriera, a następnie wypacza oś częstotliwości na skalę mel, która rozdziela pasma w taki sam sposób, jak robi to ślimak: znacznie poniżej 1 kHz i grubo powyżej. Energie mel są kompresowane logarytmicznie (naśladując percepcję głośności) i na koniec przepuszczane przez dyskretną transformację kosinusową, która je dekoreluje i koncentruje informacje w kilku pierwszych współczynnikach. Rezultatem jest odporność na hałas i wysokość głośników, dlatego klasyczne systemy mowy z ukrytym modelem Markowa i modelem mieszanki Gaussa prawie powszechnie opierały się na MFCC przed głębokim uczeniem.

Wgląd techniczny

Skala mel przybliża percepcję wysokości dźwięku przy mel = 2595 log10(1 + f/700), więc równe stopnie mel brzmią w jednakowych odstępach. Ostatnia dyskretna transformata kosinusowa (DCT) to krok „cepstralny”: traktuje widmo log-mel jako sygnał i oddziela powoli zmieniający się kształt przewodu głosowego (niskie współczynniki cepstralne, część, którą zachowujemy) od harmonicznych o szybkiej wysokości (wysokie współczynniki, zwykle odrzucane), starannie izolując tożsamość fonetyczną od wysokości dźwięku głośnika.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość współczynników cepstralnych częstotliwości Mel

Kompleksowe głębokie sieci w coraz większym stopniu uczą się funkcji bezpośrednio z surowych przebiegów lub spektrogramów log-mel, pomijając DCT, więc czyste MFCC odchodzą od najnowocześniejszego ASR. Mimo to pozostają popularne w przypadku lekkich zadań wykonywanych na urządzeniu i wymagających małej ilości danych: wykrywania słów kluczowych, wykrywania aktywności głosowej, odcisków palców audio i bioakustyki. Oczekuj, że MFCC utrzymają się jako wydajna, możliwa do interpretacji linia bazowa, nawet jeśli w dużych modelach dominują wyuczone front-endy.

Implementacja w świecie rzeczywistym

Funkcje akustyczne dla klasycznych systemów rozpoznawania mowy HMM-GMM, takich jak wczesne systemy Sphinx i HTK

Weryfikacja mówiącego i diaryzacja, rozróżnianie, kto rozmawia podczas rozmowy

Klasyfikacja gatunków muzycznych i pobieranie odcisków palców utworów (dopasowywanie barwy w stylu Shazam)

Wykrywanie usterek maszyn lub wezwań zwierząt na podstawie dźwięku w monitoringu przemysłowym i bioakustycznym

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mel-Frequency Cepstral Coefficients quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is Mel-Frequency Cepstral Coefficients?

Współczynniki cepstralne częstotliwości Mel (MFCC) to zwarty zestaw liczb, które podsumowują kształt widma częstotliwości dźwięku w sposób, w jaki odbierają je ludzkie uszy. Przez dziesięciolecia były podstawową funkcją rozpoznawania mowy, identyfikacji mówiącego i analizy muzyki.

Do czego odnosi się „mel” w MFCC?

Skala mel wypacza częstotliwość, tak że równe kroki brzmią dla ludzi z jednakową odległością, drobno rozmieszczone przy niskich częstotliwościach i grubo przy wysokich.

Która transformacja jest stosowana jako ostatnia w celu uzyskania współczynników cepstralnych?

Po obliczeniu energii log-mel dyskretna transformata kosinusowa dekoreluje je i pakuje informacje do kilku pierwszych współczynników.

Dlaczego MFCC są stosunkowo odporne na wysokość dźwięku głośnika?

Niskie współczynniki cepstralne wychwytują obwiednię przewodu głosowego (treść fonetyczną), podczas gdy wysokie współczynniki wychwytują wysokość dźwięku, więc utrzymywanie niskich współczynników zmniejsza nacisk.

Mniej więcej, ile współczynników MFCC jest zwykle przechowywanych na klatkę?

Powszechnym wyborem jest około 13 współczynników, czasami powiększonych o ich delty, które w zwięzły sposób podsumowują barwę.

Dlaczego log jest stosowany do energii pasma mel?

Odbiór głośności przez człowieka jest w przybliżeniu logarytmiczny, więc kompresja log sprawia, że ​​funkcje lepiej odpowiadają percepcji i stabilizują zakres dynamiczny.