Audio AI ÚTMUTATÓ

PESQ és STOI beszédminőségi mérőszámok

A PESQ és a STOI szabványos objektív mérőszámok, amelyek emberi hallgatóság nélkül értékelik, hogy a feldolgozott beszéd milyen jól hangzik és mennyire érthető.

2 perc olvasásUtoljára frissítve

Áttekintés

They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.

Mély merülés

A PESQ (Perceptual Evaluation of Speech Quality), az ITU-T P.862 szabvány szerint, előrejelzi a beszéd észlelt minőségét, főként telefonos és kodek teszteléshez. Összehasonlítja a tiszta referenciajelet a leromlottal, és egy MOS-szerű skálán (körülbelül -0,5 és 4,5 közötti) pontszámot ad ki, modellezve az emberi hallási észlelést. A 2010-ben bevezetett STOI (Short-Time Objective Inligibility) ehelyett az érthetőséget jósolja: hány szót értene meg a hallgató. Korrelálja a tiszta és feldolgozott beszéd rövid időbeli burkológörbéit a frekvenciasávok között, így 0-tól 1-ig terjedő pontszámot ad. Mindkettő intruzív (referencia-alapú) metrika. A PESQ azt válaszolja, hogy "jól hangzik?" míg STOI azt válaszolja, hogy "megérted?" Együtt ezek a beszédjavító, zajtalanító és visszaverő rendszerek alapértelmezett kiértékelő eszközei.

Technikai betekintés

Mindkét mérőszám tolakodó: a tiszta referenciát a leromlott jelhez igazítják a pontozás előtt. A PESQ mindkét jelet leképezi egy pszichoakusztikus hangossági skálára (Bark-sávok), kiszámítja az észlelési zavarokat az idő múlásával, és visszafejti azt egy MOS-szerű értékre. A STOI felosztja a beszédet egyharmad oktávos sávokra, rövid ~400 ms-os burkológörbe-szegmenseket vesz fel, levágja és normalizálja azokat, majd kiszámítja a referencia és a degradált burkológörbe közötti összefüggést. Az összefüggések átlagolásával 0-tól 1-hez érthetőségi pontszámot kapunk.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A PESQ és a STOI beszédminőségi mérőszámok jövője

Mivel a PESQ-nak és a STOI-nak tiszta referenciára van szüksége, a kutatás a nem tolakodó, hivatkozásoktól mentes metrikák felé tolódik el, mint például a DNSMOS és a NISQA, amelyek neurális hálózatok segítségével pusztán a leromlott jelből mérik a minőséget. Az újabb mélytanulási modelleket az emberi MOS közvetlen előrejelzésére is kiképezték. Ennek ellenére a PESQ és a STOI továbbra is beépült benchmarkok maradnak, és egy kulcsfontosságú tendencia az, hogy megkülönböztethetővé teszik őket, így közvetlenül használhatók képzési veszteség funkcióként a beszédjavító hálózatokban, nem pedig csak utólagos értékelésként.

Valós megvalósítás

Beszédjavító és zajelnyomó modellek összehasonlítása szabványos tesztkészleteken

A telefon és a VoIP kodek minőségének összehasonlítása a hálózattervezés során

A hallókészülék és a cochleáris implantátum feldolgozás hangolása a maximális érthetőség érdekében

A deverberációs algoritmusok érvényesítése konferencia- és hangsegéd-folyamatokban

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PESQ and STOI Speech Quality Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

A beszédszintézis minősége

Gyakran ismételt kérdések

What is PESQ and STOI Speech Quality Metrics?

A PESQ és a STOI szabványos objektív mérőszámok, amelyek emberi hallgatóság nélkül értékelik, hogy a feldolgozott beszéd milyen jól hangzik és mennyire érthető. Lehetővé teszik a mérnökök számára, hogy automatikusan összehasonlítsák a kodekeket, zajcsökkentőket és beszédjavító modelleket.

Mit mér elsősorban a PESQ?

A PESQ (ITU-T P.862) MOS-szerű skálán jelzi előre az észlelt beszédminőséget.

Mit jósol a STOI elsősorban?

A STOI 0-tól 1-ig terjedő skálán becsüli meg az érthetőséget, vagyis azt, hogy mennyire érthető a beszéd.

Mind a PESQ-t, mind a STOI-t „beavatkozó” mérőszámként írják le. Ez mit jelent?

A tolakodó mérőszámok összehasonlítják a leromlott jelet egy tiszta referenciával a pontszám kiszámításához.

Mi a STOI hozzávetőleges pontszámtartománya?

A STOI 0 és 1 közötti értéket ad ki, ahol a magasabb érthetőbbet jelent.

A PESQ milyen észlelési frekvencia skálával modellálja az emberi hallást?

A PESQ a jeleket Bark-band feldolgozás segítségével pszichoakusztikus hangerő-reprezentációra képezi le.