PANDUAN Audio AI

Metrik Kualitas Ucapan PESQ dan STOI

PESQ dan STOI adalah metrik objektif standar yang menilai seberapa baik proses ucapan terdengar dan seberapa mudah dimengerti, tanpa memerlukan pendengar manusia.

2 min readTerakhir diperbarui

Ikhtisar

They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.

Menyelam Lebih Dalam

PESQ (Perceptual Evaluation of Speech Quality), yang distandarisasi sebagai ITU-T P.862, memprediksi kualitas ucapan yang dirasakan, terutama untuk pengujian telepon dan codec. Ini membandingkan sinyal referensi yang bersih dengan sinyal yang terdegradasi dan menghasilkan skor pada skala mirip MOS (kira-kira -0,5 hingga 4,5), yang memodelkan persepsi pendengaran manusia. STOI (Short-Time Objective Intelligibility), yang diperkenalkan pada tahun 2010, justru memprediksi kejelasan: berapa banyak kata yang benar-benar dapat dipahami oleh pendengar. Ini mengkorelasikan selubung temporal jangka pendek dari ucapan yang bersih dan diproses di seluruh pita frekuensi, sehingga menghasilkan skor dari 0 hingga 1. Keduanya merupakan metrik yang mengganggu (berbasis referensi). PESQ menjawab 'apakah kedengarannya bagus?' sedangkan STOI menjawab 'bisakah kamu memahaminya?' Keduanya merupakan alat evaluasi default untuk sistem peningkatan suara, denoising, dan dereverberasi.

Wawasan Teknis

Kedua metrik tersebut bersifat intrusif: keduanya menyelaraskan referensi yang bersih dengan sinyal yang terdegradasi sebelum memberikan skor. PESQ memetakan kedua sinyal ke dalam skala kenyaringan psikoakustik (Bark band), menghitung gangguan persepsi dari waktu ke waktu, dan mengembalikannya ke nilai mirip MOS. STOI membagi ucapan menjadi pita sepertiga oktaf, mengambil segmen amplop pendek ~400 ms, memotong dan menormalkannya, lalu menghitung korelasi antara amplop referensi dan terdegradasi. Rata-rata korelasi tersebut menghasilkan skor kejelasan 0 banding 1.

Dampak Strategis

Access and reach

Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.

Cost and budget

Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.

Kecepatan dan skala

Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.

Masa Depan Metrik Kualitas Ucapan PESQ dan STOI

Karena PESQ dan STOI memerlukan referensi yang bersih, penelitian beralih ke metrik non-intrusif dan bebas referensi seperti DNSMOS dan NISQA yang menilai kualitas dari sinyal yang terdegradasi saja menggunakan jaringan saraf. Model pembelajaran mendalam yang lebih baru juga dilatih untuk memprediksi MOS manusia secara langsung. Meski begitu, PESQ dan STOI tetap menjadi tolok ukur yang kuat, dan tren utamanya adalah membuat keduanya dapat dibedakan sehingga dapat digunakan secara langsung sebagai fungsi kehilangan pelatihan untuk jaringan peningkatan kemampuan bicara, bukan hanya sebagai evaluasi setelah kejadian.

Implementasi Dunia Nyata

Membandingkan model penyempurnaan ucapan dan peredam bising pada set pengujian standar

Membandingkan kualitas codec telepon dan VoIP selama rekayasa jaringan

Menyetel alat bantu dengar dan pemrosesan implan koklea untuk kejelasan maksimal

Memvalidasi algoritme deverberasi dalam saluran konferensi dan asisten suara

Risiko & Pagar Pembatas

Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.

Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.

Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.

Peta Jalan Implementasi

1

Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.

2

Uji kualitas di beragam speaker dan kondisi latar belakang.

3

Tentukan kapan manusia harus meninjau atau menyetujui keluaran.

4

Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PESQ and STOI Speech Quality Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Kualitas Sintesis Ucapan

Pertanyaan yang sering diajukan

What is PESQ and STOI Speech Quality Metrics?

PESQ dan STOI adalah metrik objektif standar yang menilai seberapa baik proses ucapan terdengar dan seberapa mudah dimengerti, tanpa memerlukan pendengar manusia. Mereka memungkinkan para insinyur melakukan benchmark codec, peredam kebisingan, dan model penyempurnaan ucapan secara otomatis.

Apa yang terutama diukur oleh PESQ?

PESQ (ITU-T P.862) memprediksi kualitas ucapan yang dirasakan pada skala mirip MOS.

Apa yang terutama diprediksi oleh STOI?

STOI memperkirakan kejelasan, yaitu seberapa mudah dipahami suatu ucapan, pada skala 0 banding 1.

Baik PESQ maupun STOI digambarkan sebagai metrik yang 'mengganggu'. Maksudnya itu apa?

Metrik intrusif membandingkan sinyal yang terdegradasi dengan referensi bersih untuk menghitung skor.

Berapa perkiraan kisaran skor STOI?

STOI menghasilkan nilai antara 0 dan 1, yang mana semakin tinggi berarti semakin mudah dipahami.

PESQ memodelkan pendengaran manusia menggunakan skala frekuensi persepsi yang bagaimana?

PESQ memetakan sinyal ke representasi kenyaringan psikoakustik menggunakan pemrosesan Bark-band.