Metrik Kualitas Ucapan PESQ dan STOI
PESQ dan STOI adalah metrik objektif standar yang menilai seberapa baik proses ucapan terdengar dan seberapa mudah dimengerti, tanpa memerlukan pendengar manusia.
Ikhtisar
They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.
Menyelam Lebih Dalam
PESQ (Perceptual Evaluation of Speech Quality), yang distandarisasi sebagai ITU-T P.862, memprediksi kualitas ucapan yang dirasakan, terutama untuk pengujian telepon dan codec. Ini membandingkan sinyal referensi yang bersih dengan sinyal yang terdegradasi dan menghasilkan skor pada skala mirip MOS (kira-kira -0,5 hingga 4,5), yang memodelkan persepsi pendengaran manusia. STOI (Short-Time Objective Intelligibility), yang diperkenalkan pada tahun 2010, justru memprediksi kejelasan: berapa banyak kata yang benar-benar dapat dipahami oleh pendengar. Ini mengkorelasikan selubung temporal jangka pendek dari ucapan yang bersih dan diproses di seluruh pita frekuensi, sehingga menghasilkan skor dari 0 hingga 1. Keduanya merupakan metrik yang mengganggu (berbasis referensi). PESQ menjawab 'apakah kedengarannya bagus?' sedangkan STOI menjawab 'bisakah kamu memahaminya?' Keduanya merupakan alat evaluasi default untuk sistem peningkatan suara, denoising, dan dereverberasi.
Wawasan Teknis
Kedua metrik tersebut bersifat intrusif: keduanya menyelaraskan referensi yang bersih dengan sinyal yang terdegradasi sebelum memberikan skor. PESQ memetakan kedua sinyal ke dalam skala kenyaringan psikoakustik (Bark band), menghitung gangguan persepsi dari waktu ke waktu, dan mengembalikannya ke nilai mirip MOS. STOI membagi ucapan menjadi pita sepertiga oktaf, mengambil segmen amplop pendek ~400 ms, memotong dan menormalkannya, lalu menghitung korelasi antara amplop referensi dan terdegradasi. Rata-rata korelasi tersebut menghasilkan skor kejelasan 0 banding 1.
Dampak Strategis
Access and reach
Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.
Cost and budget
Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.
Kecepatan dan skala
Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.
Masa Depan Metrik Kualitas Ucapan PESQ dan STOI
Karena PESQ dan STOI memerlukan referensi yang bersih, penelitian beralih ke metrik non-intrusif dan bebas referensi seperti DNSMOS dan NISQA yang menilai kualitas dari sinyal yang terdegradasi saja menggunakan jaringan saraf. Model pembelajaran mendalam yang lebih baru juga dilatih untuk memprediksi MOS manusia secara langsung. Meski begitu, PESQ dan STOI tetap menjadi tolok ukur yang kuat, dan tren utamanya adalah membuat keduanya dapat dibedakan sehingga dapat digunakan secara langsung sebagai fungsi kehilangan pelatihan untuk jaringan peningkatan kemampuan bicara, bukan hanya sebagai evaluasi setelah kejadian.
Implementasi Dunia Nyata
Membandingkan model penyempurnaan ucapan dan peredam bising pada set pengujian standar
Membandingkan kualitas codec telepon dan VoIP selama rekayasa jaringan
Menyetel alat bantu dengar dan pemrosesan implan koklea untuk kejelasan maksimal
Memvalidasi algoritme deverberasi dalam saluran konferensi dan asisten suara
Risiko & Pagar Pembatas
Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.
Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.
Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.
Peta Jalan Implementasi
Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.
Uji kualitas di beragam speaker dan kondisi latar belakang.
Tentukan kapan manusia harus meninjau atau menyetujui keluaran.
Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the PESQ and STOI Speech Quality Metrics quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Kualitas Sintesis Ucapan
Pertanyaan yang sering diajukan
What is PESQ and STOI Speech Quality Metrics?
PESQ dan STOI adalah metrik objektif standar yang menilai seberapa baik proses ucapan terdengar dan seberapa mudah dimengerti, tanpa memerlukan pendengar manusia. Mereka memungkinkan para insinyur melakukan benchmark codec, peredam kebisingan, dan model penyempurnaan ucapan secara otomatis.
Apa yang terutama diukur oleh PESQ?
PESQ (ITU-T P.862) memprediksi kualitas ucapan yang dirasakan pada skala mirip MOS.
Apa yang terutama diprediksi oleh STOI?
STOI memperkirakan kejelasan, yaitu seberapa mudah dipahami suatu ucapan, pada skala 0 banding 1.
Baik PESQ maupun STOI digambarkan sebagai metrik yang 'mengganggu'. Maksudnya itu apa?
Metrik intrusif membandingkan sinyal yang terdegradasi dengan referensi bersih untuk menghitung skor.
Berapa perkiraan kisaran skor STOI?
STOI menghasilkan nilai antara 0 dan 1, yang mana semakin tinggi berarti semakin mudah dipahami.
PESQ memodelkan pendengaran manusia menggunakan skala frekuensi persepsi yang bagaimana?
PESQ memetakan sinyal ke representasi kenyaringan psikoakustik menggunakan pemrosesan Bark-band.