GHID audio AI

PESQ și STOI Speech Quality Metrics

PESQ și STOI sunt metrici obiective standard care evaluează cât de bine sună vorbirea procesată și cât de ușor de înțeles este, fără a avea nevoie de ascultători umani.

2 minute de lecturăUltima actualizare

Prezentare generală

They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.

Scufundare în profunzime

PESQ (Perceptual Evaluation of Speech Quality), standardizat ca ITU-T P.862, prezice calitatea percepută a vorbirii, în principal pentru testarea prin telefon și codec. Compară un semnal de referință curat cu unul degradat și emite un scor pe o scară asemănătoare MOS (aproximativ -0,5 până la 4,5), modelând percepția auditivă umană. STOI (Short-Time Objective Intelligibility), introdus în 2010, prezice în schimb inteligibilitatea: câte cuvinte ar înțelege de fapt un ascultător. Acesta corelează anvelope temporale de scurtă durată de vorbire curată și procesată pe benzile de frecvență, producând un scor de la 0 la 1. Ambele sunt metrici intruzive (bazate pe referințe). PESQ răspunde „sună bine?” în timp ce STOI răspunde „poți să înțelegi?” Împreună, acestea sunt instrumentele implicite de evaluare pentru sistemele de îmbunătățire a vorbirii, dezgomot și dereverberare.

Perspectivă tehnică

Ambele valori sunt intruzive: aliniază o referință curată cu semnalul degradat înainte de a marca. PESQ mapează ambele semnale pe o scară de intensitate psihoacustică (benzi Bark), calculează perturbarea perceptivă în timp și o regresează la o valoare asemănătoare MOS. STOI împarte vorbirea în benzi de o treime de octavă, preia segmente scurte de plic de ~400 ms, le decupează și le normalizează, apoi calculează corelația dintre referință și plicurile degradate. Medierea acestor corelații conduce la scorul de inteligibilitate 0 la 1.

Impact strategic

Acces și acoperire

Îmbunătățește accesibilitatea prin transcriere, narațiune și interfețe vocale.

Cost și buget

Echipele media pot livra audio mai rapid cu bugete mai mici.

Viteză și scară

Sistemele orientate către clienți pot procesa interacțiunile vorbite la scară mai mare.

Viitorul PESQ și STOI Speech Quality Metrics

Deoarece PESQ și STOI au nevoie de o referință curată, cercetarea se îndreaptă către metrici non-intruzive, fără referințe, cum ar fi DNSMOS și NISQA, care evaluează calitatea doar din semnalul degradat folosind rețele neuronale. Modelele mai noi de învățare profundă sunt, de asemenea, antrenate pentru a prezice direct MOS uman. Totuși, PESQ și STOI rămân repere înrădăcinate, iar o tendință cheie le face diferențiabile, astfel încât să poată fi utilizate direct ca funcții de pierdere de antrenament pentru rețelele de îmbunătățire a vorbirii, mai degrabă decât doar ca evaluări ulterioare.

Implementare în lumea reală

Evaluarea comparativă a modelelor de îmbunătățire a vorbirii și de suprimare a zgomotului pe seturi de testare standard

Compararea calității telefonului și a codecului VoIP în timpul ingineriei rețelei

Ajustarea procesării aparatelor auditive și a implantului cohlear pentru inteligibilitate maximă

Validarea algoritmilor de dereverberare în conductele de conferințe și asistenți vocali

Riscuri și balustrade

Riscurile de utilizare greșită a vocii și uzurpare a identității cresc atunci când lipsește consimțământul.

Precizia poate scădea în accente, dialecte sau medii zgomotoase.

Audio sintetic poate fi confundat cu vorbire autentică fără etichetare clară.

Foaia de parcurs de implementare

1

Obțineți consimțământul explicit pentru captarea, clonarea și reutilizarea vocii.

2

Testați calitatea pe diverse difuzoare și condiții de fundal.

3

Definiți când un om trebuie să revizuiască sau să aprobe rezultatele.

4

Etichetați sunetul sintetic și păstrați înregistrări de proveniență pentru responsabilitate.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PESQ and STOI Speech Quality Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Calitatea sintezei vorbirii

Întrebări frecvente

What is PESQ and STOI Speech Quality Metrics?

PESQ și STOI sunt metrici obiective standard care evaluează cât de bine sună vorbirea procesată și cât de ușor de înțeles este, fără a avea nevoie de ascultători umani. Acestea le permit inginerilor să analizeze automat codecurile, reductoarele de zgomot și modelele de îmbunătățire a vorbirii.

Ce măsoară în primul rând PESQ?

PESQ (ITU-T P.862) prezice calitatea percepută a vorbirii pe o scară asemănătoare MOS.

Ce prezice în primul rând STOI?

STOI estimează inteligibilitatea, adică cât de înțeles este discursul, pe o scară de la 0 la 1.

Atât PESQ, cât și STOI sunt descrise ca fiind metrici „intruzive”. Ce înseamnă asta?

Valorile intruzive compară semnalul degradat cu o referință curată pentru a calcula un scor.

Care este intervalul de scor aproximativ al STOI?

STOI emite o valoare între 0 și 1, unde mai mare înseamnă mai inteligibil.

PESQ modelează auzul uman folosind ce fel de scară de frecvență perceptivă?

PESQ mapează semnalele pe o reprezentare psihoacustică a sonorității utilizând procesarea în bandă Bark.