การประเมินคะแนนความคิดเห็นเฉลี่ย
คะแนนความคิดเห็นเฉลี่ย (MOS) คือคะแนนเฉลี่ย 1 ต่อ 5 จากผู้ฟังที่เป็นมนุษย์ ซึ่งจะวัดว่าเสียงสังเคราะห์หรือถ่ายทอดได้ดีเพียงใด
ภาพรวม
It is the gold-standard yardstick for judging text-to-speech, voice cloning, and audio codecs, because ultimately humans, not machines, are the audience.
เจาะลึก
MOS มาจากการทดสอบเครือข่ายโทรศัพท์ที่ได้มาตรฐานโดย ITU (Recommendation P.800) ผู้ฟังได้ยินคลิปเสียงสั้นๆ และให้คะแนนแต่ละคลิปตามระดับห้าคะแนน: 5 = ดีเยี่ยม 4 = ดี 3 = ยุติธรรม 2 = แย่ 1 = แย่ การให้คะแนน MOS โดยเฉลี่ยจากคลิปและผู้ฟังจำนวนมาก ตัวแปรต่างๆ กำหนดเป้าหมายคำถามเฉพาะ: MOS-LQS สำหรับคุณภาพโดยรวม, การเปรียบเทียบ MOS (CMOS) สำหรับการตั้งค่า A/B และ MUSHRA สำหรับการเปรียบเทียบโคเดกแบบละเอียด ในการวิจัยคำพูดของ AI สมัยใหม่ MOS เป็นตัวชี้วัดหลักสำหรับระบบต่างๆ เช่น WaveNet, Tacotron และ VALL-E เนื่องจากการประเมินโดยมนุษย์ทำได้ช้าและมีค่าใช้จ่ายสูง ขณะนี้โมเดล MOS ที่คาดการณ์ไว้ (DNSMOS, UTMOS, NISQA) จะประเมินคะแนนโดยอัตโนมัติ แม้ว่า MOS ของมนุษย์จะยังคงเป็นข้อมูลอ้างอิงที่เชื่อถือได้ก็ตาม
ข้อมูลเชิงลึกทางเทคนิค
การศึกษา MOS ที่เหมาะสมจะควบคุมเงื่อนไขการฟัง: หูฟังที่ปรับเทียบแล้ว ความดังคงที่ ลำดับคลิปแบบสุ่ม และเรตเตอร์ที่เพียงพอ (มักจะ 20+) ต่อตัวอย่าง ดังนั้นค่าเฉลี่ยจึงมีความเสถียรทางสถิติ นักวิจัยรายงานช่วงความเชื่อมั่น 95% เนื่องจากช่องว่าง MOS 0.1 อาจทำให้เกิดสัญญาณรบกวนได้ สิ่งสำคัญที่สุดคือ MOS ไม่ใช่การวัดทางกายภาพโดยสมบูรณ์ โดยยึดตามคลิปและคำแนะนำเฉพาะเจาะจงในเซสชันนั้น ดังนั้นคะแนนจากการศึกษาต่างๆ จึงไม่สามารถเปรียบเทียบโดยตรงได้
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของการประเมินคะแนนความคิดเห็นเฉลี่ย
ตัวทำนาย MOS อัตโนมัติกำลังพัฒนาอย่างรวดเร็วและได้รับการฝึกอบรมเกี่ยวกับองค์กรขนาดใหญ่ที่มนุษย์ประเมินไว้ ช่วยให้ทีมคัดกรองตัวอย่างหลายพันตัวอย่างในราคาถูกก่อนการทดสอบขั้นสุดท้ายกับมนุษย์ คาดหวังคะแนนหลายมิติที่สมบูรณ์ยิ่งขึ้น ซึ่งจะแยกความเป็นธรรมชาติ ความชัดเจน ความคล้ายคลึงของผู้พูด และอารมณ์ แทนที่จะเป็นตัวเลขที่เบลอเพียงตัวเดียว เนื่องจากคำพูดเชิงกำเนิดใกล้เคียงกับความเท่าเทียมของมนุษย์ การประเมินจึงเปลี่ยนไปสู่การทดสอบการตั้งค่าและการตรวจจับสิ่งแปลกปลอมที่ละเอียดอ่อน เนื่องจาก MOS แบบดิบจะอิ่มตัวเกือบ 4.5 และไม่สามารถแยกแยะระบบระดับสูงได้อีกต่อไป
การใช้งานจริงในโลกแห่งความเป็นจริง
การเปรียบเทียบเสียงอ่านออกเสียงข้อความ 2 เสียงสำหรับแอปนำทางโดยขอให้ผู้ฟังให้คะแนนความเป็นธรรมชาติ 1-5
การเปรียบเทียบตัวแปลงสัญญาณเสียงแบบนิวรัลใหม่กับ MP3 ที่บิตเรตเดียวกันโดยใช้การให้คะแนนของผู้ฟัง
ตรวจสอบคุณภาพเอาต์พุตของโมเดลการโคลนเสียงก่อนปรับใช้ในผลิตภัณฑ์หนังสือเสียง
วิศวกรโทรคมนาคมให้คะแนนคุณภาพการโทรผ่านเครือข่าย VoIP ใหม่เพื่อรับรองว่าตรงตามเป้าหมาย 4.0 MOS
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mean Opinion Score Evaluation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
ข้อมูลเบื้องต้นเกี่ยวกับการประเมิน AI
คำถามที่พบบ่อย
What is Mean Opinion Score Evaluation?
คะแนนความคิดเห็นเฉลี่ย (MOS) คือคะแนนเฉลี่ย 1 ต่อ 5 จากผู้ฟังที่เป็นมนุษย์ ซึ่งจะวัดว่าเสียงสังเคราะห์หรือถ่ายทอดได้ดีแค่ไหน มันเป็นมาตรฐานระดับมาตรฐานทองคำในการตัดสินการอ่านออกเสียงข้อความ การโคลนเสียง และตัวแปลงสัญญาณเสียง เพราะท้ายที่สุดแล้ว มนุษย์คือผู้ฟัง ไม่ใช่เครื่องจักร
คะแนนความคิดเห็นเฉลี่ย 5 แสดงถึงอะไรในระดับมาตรฐาน
ในระดับคะแนนหมวดหมู่สัมบูรณ์ห้าจุดของ ITU มาตรฐาน 5 หมายถึงดีเยี่ยม และ 1 หมายถึงแย่
เหตุใดการศึกษาของ MOS จึงใช้ผู้ฟังจำนวนมากต่อคลิปเสียง
การให้คะแนนส่วนบุคคลเป็นเรื่องส่วนตัวและมีผลกระทบ ดังนั้น การหาค่าเฉลี่ยของผู้ประเมินหลายๆ คนจึงได้คะแนนที่คงที่ทางสถิติพร้อมช่วงความเชื่อมั่นที่รายงานได้
องค์กรใดกำหนดมาตรฐานวิธีการ MOS ดั้งเดิมสำหรับคุณภาพเสียง
สหภาพโทรคมนาคมระหว่างประเทศกำหนดการทดสอบ MOS ในข้อแนะนำ P.800 ซึ่งเดิมมีไว้สำหรับคุณภาพเสียงพูดทางโทรศัพท์
ข้อจำกัดที่สำคัญในการเปรียบเทียบค่า MOS จากการศึกษาสองเรื่องที่แยกกันคืออะไร
เนื่องจากการให้คะแนนขึ้นอยู่กับตัวอย่าง เฉพาะจุดยึด และกลุ่ม Listener จึงไม่สามารถเปรียบเทียบหมายเลข MOS สัมบูรณ์จากเซสชันต่างๆ ได้อย่างน่าเชื่อถือ
ตัวทำนาย MOS อัตโนมัติเช่น DNSMOS หรือ UTMOS แก้ปัญหาอะไรได้บ้าง
แบบจำลอง MOS ที่คาดการณ์ไว้ได้รับการฝึกฝนเกี่ยวกับการให้คะแนนโดยมนุษย์ประมาณคะแนนโดยอัตโนมัติ ช่วยให้ทีมคัดกรองตัวอย่างจำนวนมากได้ในราคาถูกก่อนการประเมินขั้นสุดท้ายโดยมนุษย์