PRZEWODNIK AI audio

Funkcje banku filtrów i PLP

Funkcje banku filtrów i percepcyjnego przewidywania liniowego (PLP) to sposoby podsumowywania sygnału mowy w zwarte, percepcyjnie znaczące liczby, z których mogą korzystać modele uczenia maszynowego.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

They matter because they let speech recognizers focus on the parts of sound humans actually hear, discarding irrelevant detail.

Głębokie nurkowanie

Aby przekształcić surowy dźwięk w funkcje, sygnał jest dzielony na krótkie klatki i przepuszczany przez zestaw nakładających się filtrów rozmieszczonych w skali Mel, która naśladuje nieliniową czułość częstotliwościową ucha. Sumowanie energii w każdym filtrze daje cechy banku filtrów log-mel, dominujące dane wejściowe dla nowoczesnych modeli głębokiej mowy. PLP, opracowany przez Hynka Hermansky'ego, dodaje więcej psychoakustyki: stosuje pasma krytyczne w skali kory, krzywą równej głośności ważącą częstotliwości tak, jak robi to ucho, oraz kompresję natężenia do głośności pierwiastka sześciennego, a następnie dopasowuje model wielobiegunowy (predykcja liniowa) w celu wygładzenia widma. Rezultatem jest niskowymiarowa reprezentacja odporna na różnice w głośnikach i kanałach. MFCC są bliskimi kuzynami, które dodają transformację cosinusową w celu dekorelacji wyników banku filtrów.

Wgląd techniczny

Kluczową ideą jest wypaczenie percepcji: herc liniowy jest ponownie mapowany na skalę melową lub szczekową, dzięki czemu filtry są wąskie przy niskich częstotliwościach i szerokie przy wysokich, co odpowiada rozdzielczości ślimaka. Preemfaza równej głośności PLP i model kompresji pierwiastkowej PLP pokazują, jak postrzeganie głośności przez ucho jest nieliniowe. Ostatni etap przewidywania liniowego dopasowuje gładką obwiednię widmową, rejestrując kształt przewodu głosowego, jednocześnie tłumiąc harmoniczne wysokości dźwięku, które różnią się w zależności od głośników.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość funkcji banku filtrów i PLP

Głębokie sieci neuronowe coraz częściej preferują surowe banki filtrów log-mel od mocno opracowanych funkcji PLP lub MFCC, ponieważ sieć uczy się własnych transformacji lepiej niż ręcznie zaprojektowana dekorelacja. Granicę stanowią interfejsy, których można się nauczyć, takie jak SincNet i wav2vec, które działają na surowych przebiegach. Mimo to banki filtrów mel pozostają wszechobecne jako stabilne i tanie dane wejściowe, a zasady percepcyjne stojące za PLP w dalszym ciągu informują, w jaki sposób inżynierowie projektują i interpretują te wyuczone reprezentacje.

Implementacja w świecie rzeczywistym

Obliczanie 40 funkcji banku filtrów log-mel na ramkę jako dane wejściowe do sieci neuronowej zamieniającej mowę na tekst

Wykorzystanie funkcji PLP w odpornych na zakłócenia systemach poleceń głosowych dla samochodów

Potoki rozpoznawania mówców, które opierają się na percepcyjnie zniekształconych cechach widmowych

Wykrywanie słów kluczowych na urządzeniach o niskim poborze mocy, gdzie funkcje kompaktowego banku filtrów zmniejszają obliczenia

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Filterbank and PLP Features quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Sondowanie liniowe i ocena funkcji zamrożonych

Często zadawane pytania

What is Filterbank and PLP Features?

Funkcje banku filtrów i percepcyjnego przewidywania liniowego (PLP) to sposoby podsumowywania sygnału mowy w zwarte, percepcyjnie znaczące liczby, z których mogą korzystać modele uczenia maszynowego. Mają znaczenie, ponieważ pozwalają modułom rozpoznawania mowy skupić się na fragmentach dźwięku, które ludzie faktycznie słyszą, pomijając nieistotne szczegóły.

Dlaczego banki filtrów mowy są rozmieszczone w skali mel lub kory, a nie w hercach liniowych?

Skale mel i kory odpowiadają rozdzielczości ludzkiego ślimaka, która jest lepsza przy niskich częstotliwościach i grubsza przy wysokich częstotliwościach.

Do czego służy etap przewidywania liniowego w PLP?

PLP pasuje do modelu wielobiegunowego, aby wytworzyć gładką obwiednię widmową, przechwytując charakterystykę przewodu głosowego, jednocześnie tłumiąc harmoniczne wysokości dźwięku zależne od głośnika.

Który typ funkcji stanowi dominujący wkład w nowoczesne modele głębokiego rozpoznawania mowy?

Funkcje banku filtrów Log-mel stanowią standardowe, kompaktowe i znaczące percepcyjnie dane wejściowe dla współczesnych modeli głębokiej mowy.

Czym MFCC różnią się od surowych funkcji banku filtrów log-mel?

MFCC stosują dyskretną transformację kosinusową na energiach banku filtrów log-mel, aby dekorelować je w zwarte współczynniki.

Jaki element percepcyjny zawiera PLP, czego nie zawierają podstawowe banki filtrów Mel?

PLP dodaje preemfazę o równej głośności i pierwiastkową kompresję intensywności do głośności, aby lepiej modelować percepcję głośności przez człowieka.