Audio AI GUIDE

PESQ og STOI talekvalitetsmålinger

PESQ og STOI er standard objektive beregninger som viser hvor god bearbeidet tale høres ut og hvor forståelig den er, uten å trenge menneskelige lyttere.

2 min lesingSist oppdatert

Oversikt

They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.

Dypdykk

PESQ (Perceptual Evaluation of Speech Quality), standardisert som ITU-T P.862, forutsier den oppfattede kvaliteten på tale, hovedsakelig for telefon- og kodektesting. Den sammenligner et rent referansesignal med et degradert og gir en poengsum på en MOS-lignende skala (omtrent -0,5 til 4,5), og modellerer menneskelig auditiv persepsjon. STOI (Short-Time Objective Intelligibility), introdusert i 2010, forutsier i stedet forståelighet: hvor mange ord en lytter faktisk ville forstå. Den korrelerer kortvarige tidskonvolutter av ren og behandlet tale på tvers av frekvensbånd, og gir en poengsum fra 0 til 1. Begge er påtrengende (referansebaserte) beregninger. PESQ svarer 'høres det bra ut?' mens STOI svarer 'kan du forstå det?' Sammen er de standardevalueringsverktøyene for taleforbedrings-, denoising- og dereverberation-systemer.

Teknisk innsikt

Begge beregningene er påtrengende: de justerer en ren referanse med det degraderte signalet før scoring. PESQ kartlegger begge signalene på en psykoakustisk lydstyrkeskala (Bark-bånd), beregner perseptuell forstyrrelse over tid og regresserer den til en MOS-lignende verdi. STOI deler tale i en tredjedels oktavbånd, tar korte ~400 ms konvoluttsegmenter, klipper og normaliserer dem, og beregner deretter korrelasjonen mellom referanse og degraderte konvolutter. Gjennomsnitt av disse korrelasjonene gir 0-til-1 forståelighetspoeng.

Strategisk innvirkning

Access and reach

Det forbedrer tilgjengeligheten gjennom transkripsjon, fortellerstemme og stemmegrensesnitt.

Cost and budget

Medieteam kan sende polert lyd raskere med mindre budsjetter.

Speed and scale

Kundevendte systemer kan behandle talte interaksjoner i større skala.

Fremtiden til PESQ og STOI talekvalitetsmålinger

Fordi PESQ og STOI trenger en ren referanse, skifter forskningen mot ikke-påtrengende, referansefrie beregninger som DNSMOS og NISQA som scorer kvalitet fra det degraderte signalet alene ved bruk av nevrale nettverk. Nyere dyplæringsmodeller er også opplært til å forutsi menneskelig MOS direkte. Likevel er PESQ og STOI fortsatt forankrede benchmarks, og en nøkkeltrend er å gjøre dem differensierbare, slik at de kan brukes direkte som treningstapsfunksjoner for taleforbedrende nettverk i stedet for bare som etterfølgende evalueringer.

Real-World Implementering

Benchmarking av taleforbedrende og støydempende modeller på standard testsett

Sammenligning av telefon- og VoIP-kodekkvalitet under nettverksutvikling

Tuning av høreapparat og cochlea-implantatbehandling for maksimal forståelighet

Validerer dereverberation-algoritmer i konferanse- og stemmeassistent-pipelines

Risikoer og rekkverk

Risikoen for stemmemisbruk og etterligning øker når samtykke mangler.

Nøyaktigheten kan falle på tvers av aksenter, dialekter eller støyende omgivelser.

Syntetisk lyd kan forveksles med autentisk tale uten tydelig merking.

Veikart for implementering

1

Innhent eksplisitt samtykke for stemmefangst, kloning og gjenbruk.

2

Test kvalitet på tvers av forskjellige høyttalere og bakgrunnsforhold.

3

Definer når et menneske må gjennomgå eller godkjenne utdata.

4

Merk syntetisk lyd og oppbevar herkomstregistreringer for ansvarlighet.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PESQ and STOI Speech Quality Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Ofte stilte spørsmål

What is PESQ and STOI Speech Quality Metrics?

PESQ og STOI er standard objektive beregninger som viser hvor god bearbeidet tale høres ut og hvor forståelig den er, uten å trenge menneskelige lyttere. De lar ingeniører måle kodeker, støydempere og taleforbedrende modeller automatisk.

Hva måler PESQ primært?

PESQ (ITU-T P.862) forutsier oppfattet talekvalitet på en MOS-lignende skala.

Hva forutsier STOI primært?

STOI estimerer forståelighet, dvs. hvor forståelig talen er, på en 0-til-1 skala.

Både PESQ og STOI beskrives som "påtrengende" beregninger. Hva betyr det?

Påtrengende beregninger sammenligner det degraderte signalet med en ren referanse for å beregne en poengsum.

Hva er det omtrentlige poengområdet til STOI?

STOI gir ut en verdi mellom 0 og 1, der høyere betyr mer forståelig.

PESQ modellerer menneskelig hørsel ved å bruke hvilken type perseptuell frekvensskala?

PESQ kartlegger signaler til en psykoakustisk lydstyrkerepresentasjon ved hjelp av Bark-band-behandling.