Wskaźniki jakości mowy PESQ i STOI
PESQ i STOI to standardowe obiektywne wskaźniki, które oceniają, jak dobrze brzmi przetworzona mowa i jak bardzo jest ona zrozumiała, bez konieczności stosowania ludzkich słuchaczy.
Przegląd
They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.
Głębokie nurkowanie
PESQ (Perceptual Evaluation of Speech Quality), standaryzowany jako ITU-T P.862, przewiduje postrzeganą jakość mowy, głównie na potrzeby testowania telefonów i kodeków. Porównuje czysty sygnał referencyjny ze zdegradowanym i generuje wynik w skali podobnej do MOS (w przybliżeniu od -0,5 do 4,5), modelując ludzką percepcję słuchową. Zamiast tego STOI (Short-Time Objective Intelligibility), wprowadzony w 2010 roku, przewiduje zrozumiałość: ile słów faktycznie zrozumiałby słuchacz. Koreluje krótkotrwałe obwiednie czasowe czystej i przetworzonej mowy w różnych pasmach częstotliwości, uzyskując wynik od 0 do 1. Obydwa są metrykami inwazyjnymi (opartymi na referencjach). PESQ odpowiada „czy to brzmi dobrze?” podczas gdy STOI odpowiada „czy możesz to zrozumieć?” Razem stanowią one domyślne narzędzia oceny systemów wzmacniania mowy, usuwania szumów i usuwania pogłosu.
Wgląd techniczny
Obie metryki są inwazyjne: dopasowują czyste odniesienie do zdegradowanego sygnału przed punktacją. PESQ odwzorowuje oba sygnały na psychoakustyczną skalę głośności (pasma kory), oblicza zaburzenia percepcji w czasie i regresuje je do wartości podobnej do MOS. STOI dzieli mowę na pasma o długości jednej trzeciej oktawy, pobiera krótkie segmenty obwiedni ~400 ms, obcina je i normalizuje, a następnie oblicza korelację pomiędzy obwiedniami odniesienia i zdegradowanymi. Uśrednienie tych korelacji daje wynik zrozumiałości 0 do 1.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość wskaźników jakości mowy PESQ i STOI
Ponieważ PESQ i STOI potrzebują czystego odniesienia, badania zmierzają w stronę nieinwazyjnych i pozbawionych odniesień wskaźników, takich jak DNSMOS i NISQA, które oceniają jakość wyłącznie na podstawie zdegradowanego sygnału przy użyciu sieci neuronowych. Nowsze modele głębokiego uczenia się są również szkolone w zakresie bezpośredniego przewidywania ludzkiego MOS. Mimo to PESQ i STOI pozostają ugruntowanymi wzorcami, a kluczowym trendem jest umożliwienie ich różnicowania, dzięki czemu można je stosować bezpośrednio jako funkcje strat szkoleniowych dla sieci wzmacniających mowę, a nie tylko jako oceny po fakcie.
Implementacja w świecie rzeczywistym
Porównanie modeli wzmacniania mowy i tłumienia hałasu na standardowych zestawach testowych
Porównanie jakości kodeków telefonicznych i VoIP podczas projektowania sieci
Dostrajanie przetwarzania aparatów słuchowych i implantów ślimakowych w celu uzyskania maksymalnej zrozumiałości
Walidacja algorytmów usuwania pogłosu w potokach konferencyjnych i asystentów głosowych
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the PESQ and STOI Speech Quality Metrics quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Jakość syntezy mowy
Często zadawane pytania
What is PESQ and STOI Speech Quality Metrics?
PESQ i STOI to standardowe obiektywne wskaźniki, które oceniają, jak dobrze brzmi przetworzona mowa i jak bardzo jest ona zrozumiała, bez konieczności stosowania ludzkich słuchaczy. Pozwalają inżynierom automatycznie testować kodeki, reduktory szumów i modele poprawiające mowę.
Co przede wszystkim mierzy PESQ?
PESQ (ITU-T P.862) przewiduje postrzeganą jakość mowy w skali podobnej do MOS.
Co przede wszystkim przewiduje STOI?
STOI ocenia zrozumiałość, czyli stopień zrozumiałości mowy, w skali od 0 do 1.
Zarówno PESQ, jak i STOI są określane jako wskaźniki „inwazyjne”. Co to znaczy?
Metryki natrętne porównują zdegradowany sygnał z czystym sygnałem odniesienia w celu obliczenia wyniku.
Jaki jest przybliżony zakres wyników STOI?
STOI generuje wartość z zakresu od 0 do 1, gdzie wyższa oznacza bardziej zrozumiałą.
Jakiej skali częstotliwości percepcyjnej PESQ modeluje ludzki słuch?
PESQ odwzorowuje sygnały na reprezentację głośności psychoakustycznej przy użyciu przetwarzania pasma Barka.