คู่มือเสียง AI

ตัวชี้วัดคุณภาพคำพูด PESQ และ STOI

PESQ และ STOI เป็นหน่วยวัดวัตถุประสงค์มาตรฐานที่ให้คะแนนว่าเสียงคำพูดที่ได้รับการประมวลผลดีเพียงใด และเข้าใจได้ง่ายเพียงใด โดยไม่จำเป็นต้องใช้ผู้ฟังที่เป็นมนุษย์

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.

เจาะลึก

PESQ (การประเมินการรับรู้คุณภาพคำพูด) ที่ได้รับมาตรฐานเป็น ITU-T P.862 คาดการณ์คุณภาพการพูดที่รับรู้ โดยส่วนใหญ่ใช้สำหรับการทดสอบทางโทรศัพท์และตัวแปลงสัญญาณ โดยจะเปรียบเทียบสัญญาณอ้างอิงที่ชัดเจนกับสัญญาณที่ลดระดับลง และให้คะแนนในระดับคล้าย MOS (ประมาณ -0.5 ถึง 4.5) ซึ่งเป็นการจำลองการรับรู้ทางการได้ยินของมนุษย์ STOI (Short-Time Objective Intelligibility) เปิดตัวในปี 2010 แทนที่จะทำนายความเข้าใจว่า ผู้ฟังจะเข้าใจคำศัพท์ได้กี่คำ โดยเชื่อมโยงขอบเขตเวลาสั้นๆ ของคำพูดที่สะอาดและประมวลผลข้ามย่านความถี่ โดยสร้างคะแนนตั้งแต่ 0 ถึง 1 ทั้งสองแบบเป็นตัวชี้วัดที่รบกวน (อิงตามการอ้างอิง) PESQ ตอบว่า 'ฟังดูดีไหม' ในขณะที่ STOI ตอบว่า 'คุณเข้าใจไหม' เมื่อรวมกันแล้วเป็นเครื่องมือประเมินเริ่มต้นสำหรับระบบปรับปรุงเสียงพูด ลดเสียงรบกวน และลดเสียงก้อง

ข้อมูลเชิงลึกทางเทคนิค

ตัวชี้วัดทั้งสองมีการรบกวน: โดยจะจัดแนวการอ้างอิงที่ชัดเจนกับสัญญาณที่ลดลงก่อนที่จะให้คะแนน PESQ จับคู่สัญญาณทั้งสองบนระดับความดังทางจิต (แถบเสียงเห่า) คำนวณการรบกวนในการรับรู้เมื่อเวลาผ่านไป และลดค่ากลับเป็นค่าที่คล้ายกับ MOS STOI แบ่งคำพูดออกเป็นแบนด์หนึ่งในสามอ็อกเทฟ ใช้เซ็กเมนต์เอนเวโลปสั้นประมาณ 400 มิลลิวินาที คลิปและปรับให้เป็นมาตรฐาน จากนั้นคำนวณความสัมพันธ์ระหว่างเอนเวโลปอ้างอิงและเอนเวโลปที่ลดระดับลง การหาค่าเฉลี่ยความสัมพันธ์เหล่านั้นจะทำให้ได้คะแนนความเข้าใจ 0 ต่อ 1

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการวัดคุณภาพคำพูด PESQ และ STOI

เนื่องจาก PESQ และ STOI ต้องการการอ้างอิงที่ชัดเจน การวิจัยจึงเปลี่ยนไปสู่หน่วยวัดที่ไม่ล่วงล้ำและไม่มีการอ้างอิง เช่น DNSMOS และ NISQA ที่จะให้คะแนนคุณภาพจากสัญญาณที่ลดลงเพียงอย่างเดียวโดยใช้โครงข่ายประสาทเทียม โมเดลการเรียนรู้เชิงลึกรุ่นใหม่ยังได้รับการฝึกอบรมให้ทำนาย MOS ของมนุษย์ได้โดยตรงอีกด้วย ถึงกระนั้น PESQ และ STOI ยังคงเป็นเกณฑ์มาตรฐานที่ยึดมั่น และแนวโน้มสำคัญคือการทำให้สิ่งเหล่านี้แตกต่าง ดังนั้นจึงสามารถนำมาใช้โดยตรงเป็นฟังก์ชันการสูญเสียการฝึกอบรมสำหรับเครือข่ายการปรับปรุงคำพูด แทนที่จะเป็นเพียงการประเมินตามความเป็นจริงเท่านั้น

การใช้งานจริงในโลกแห่งความเป็นจริง

การเปรียบเทียบแบบจำลองการเพิ่มคุณภาพเสียงพูดและการลดเสียงรบกวนในชุดทดสอบมาตรฐาน

การเปรียบเทียบคุณภาพตัวแปลงสัญญาณโทรศัพท์และ VoIP ในระหว่างวิศวกรรมเครือข่าย

ปรับแต่งการประมวลผลเครื่องช่วยฟังและประสาทหูเทียมเพื่อความชัดเจนสูงสุด

การตรวจสอบอัลกอริธึมการลดเสียงก้องในไปป์ไลน์การประชุมและระบบช่วยเหลือด้วยเสียง

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PESQ and STOI Speech Quality Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

คุณภาพการสังเคราะห์เสียงพูด

คำถามที่พบบ่อย

What is PESQ and STOI Speech Quality Metrics?

PESQ และ STOI เป็นหน่วยวัดวัตถุประสงค์มาตรฐานที่ให้คะแนนว่าเสียงคำพูดที่ได้รับการประมวลผลดีเพียงใด และเข้าใจได้ง่ายเพียงใด โดยไม่จำเป็นต้องใช้ผู้ฟังที่เป็นมนุษย์ โดยให้วิศวกรกำหนดมาตรฐานตัวแปลงสัญญาณ ตัวลดเสียงรบกวน และโมเดลการปรับปรุงเสียงพูดโดยอัตโนมัติ

PESQ วัดอะไรเป็นหลัก?

PESQ (ITU-T P.862) คาดการณ์คุณภาพเสียงพูดที่รับรู้ในระดับที่คล้ายกับ MOS

STOI ทำนายอะไรเป็นหลัก?

STOI ประเมินความสามารถในการเข้าใจ เช่น คำพูดที่เข้าใจได้ในระดับ 0 ต่อ 1

ทั้ง PESQ และ STOI ได้รับการอธิบายว่าเป็นตัวชี้วัดที่ 'ล่วงล้ำ' นั่นหมายความว่าอย่างไร?

ตัวชี้วัดที่รบกวนจะเปรียบเทียบสัญญาณที่ลดลงกับการอ้างอิงที่ชัดเจนเพื่อคำนวณคะแนน

ช่วงคะแนนโดยประมาณของ STOI คือเท่าไร?

STOI ส่งออกค่าระหว่าง 0 ถึง 1 โดยที่สูงกว่าหมายถึงเข้าใจได้มากขึ้น

PESQ จำลองการได้ยินของมนุษย์โดยใช้ระดับความถี่การรับรู้ประเภทใด

แผนที่ PESQ จะส่งสัญญาณไปยังการแสดงความดังทางจิตโดยใช้การประมวลผล Bark-band