Đánh giá điểm ý kiến trung bình
Điểm ý kiến trung bình (MOS) là xếp hạng trung bình từ 1 đến 5 từ người nghe để đo mức độ tốt của âm thanh được tổng hợp hoặc truyền đi.
Tổng quan
It is the gold-standard yardstick for judging text-to-speech, voice cloning, and audio codecs, because ultimately humans, not machines, are the audience.
Lặn sâu
MOS xuất phát từ thử nghiệm mạng điện thoại được ITU tiêu chuẩn hóa (Khuyến nghị P.800). Người nghe nghe các đoạn âm thanh ngắn và đánh giá từng đoạn âm thanh theo thang điểm năm: 5 = xuất sắc, 4 = tốt, 3 = khá, 2 = kém, 1 = kém. Tính trung bình nhiều xếp hạng trên nhiều clip và người nghe sẽ mang lại MOS. Các biến thể nhắm đến các câu hỏi cụ thể: MOS-LQS cho chất lượng tổng thể, MOS so sánh (CMOS) cho ưu tiên A/B và MUSHRA để so sánh codec chi tiết. Trong nghiên cứu giọng nói AI hiện đại, MOS là thước đo tiêu biểu cho các hệ thống như WaveNet, Tacotron và VALL-E. Do việc đánh giá con người diễn ra chậm và tốn kém nên các mô hình MOS dự đoán (DNSMOS, UTMOS, NISQA) hiện tự động ước tính điểm số, mặc dù MOS con người vẫn là tài liệu tham khảo đáng tin cậy.
Hiểu biết kỹ thuật
Một nghiên cứu MOS thích hợp sẽ kiểm soát các điều kiện nghe: tai nghe đã hiệu chỉnh, âm lượng cố định, thứ tự clip ngẫu nhiên và đủ người đánh giá (thường là 20+) cho mỗi mẫu để mức trung bình ổn định về mặt thống kê. Các nhà nghiên cứu báo cáo khoảng tin cậy 95% vì khoảng cách 0,1 MOS có thể gây nhiễu. Điều quan trọng là MOS không phải là một phép đo vật lý tuyệt đối; nó được cố định bởi các clip và hướng dẫn cụ thể trong phần đó, vì vậy điểm số từ các nghiên cứu khác nhau không thể so sánh trực tiếp được.
Tác động chiến lược
Truy cập và tiếp cận
Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.
Chi phí và ngân sách
Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.
Tốc độ và tỷ lệ
Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.
Tương lai của việc đánh giá điểm số ý kiến trung bình
Bộ dự đoán MOS tự động đang được cải thiện nhanh chóng và được đào tạo trên các tập hợp lớn do con người đánh giá, cho phép các nhóm sàng lọc hàng nghìn mẫu với chi phí thấp trước khi tiến hành thử nghiệm cuối cùng trên con người. Mong đợi điểm số phong phú hơn, đa chiều giúp tách biệt tính tự nhiên, tính dễ hiểu, độ tương tự của người nói và cảm xúc thay vì một con số mờ nhạt. Khi lời nói sinh sản gần ngang bằng với con người, việc đánh giá đang chuyển sang các thử nghiệm ưu tiên và phát hiện các thành phần tinh tế, vì MOS thô đã bão hòa gần 4,5 và không còn có thể phân biệt các hệ thống hàng đầu.
Triển khai trong thế giới thực
So sánh hai giọng nói chuyển văn bản thành giọng nói của một ứng dụng điều hướng bằng cách yêu cầu người nghe đánh giá độ tự nhiên từ 1 đến 5
Đo điểm chuẩn của bộ giải mã âm thanh thần kinh mới so với MP3 ở cùng tốc độ bit bằng cách sử dụng xếp hạng của người nghe
Xác thực chất lượng đầu ra của mô hình nhân bản giọng nói trước khi triển khai trong sản phẩm sách nói
Các kỹ sư viễn thông chấm điểm chất lượng cuộc gọi qua mạng VoIP mới để chứng nhận mạng này đáp ứng mục tiêu MOS 4.0
Rủi ro & lan can
Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.
Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.
Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.
Lộ trình thực hiện
Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.
Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.
Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.
Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mean Opinion Score Evaluation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Khái niệm cơ bản về đánh giá AI
Câu hỏi thường gặp
What is Mean Opinion Score Evaluation?
Điểm ý kiến trung bình (MOS) là xếp hạng trung bình từ 1 đến 5 từ người nghe để đo mức độ tốt của âm thanh được tổng hợp hoặc truyền đi. Đây là thước đo tiêu chuẩn vàng để đánh giá khả năng chuyển văn bản thành giọng nói, sao chép giọng nói và codec âm thanh, bởi vì cuối cùng thì con người, chứ không phải máy móc, mới là khán giả.
Điểm Ý kiến Trung bình là 5 thể hiện điều gì trên thang đo tiêu chuẩn?
Trên thang đánh giá danh mục tuyệt đối năm điểm tiêu chuẩn của ITU, 5 có nghĩa là xuất sắc và 1 có nghĩa là kém.
Tại sao các nghiên cứu của MOS sử dụng nhiều người nghe cho mỗi clip âm thanh?
Xếp hạng riêng lẻ mang tính chủ quan và ồn ào, do đó, tính trung bình của nhiều người xếp hạng sẽ mang lại điểm số ổn định về mặt thống kê với khoảng tin cậy có thể báo cáo.
Tổ chức nào đã tiêu chuẩn hóa phương pháp MOS ban đầu cho chất lượng âm thanh?
Liên minh Viễn thông Quốc tế đã xác định thử nghiệm MOS trong Khuyến nghị P.800, ban đầu dành cho chất lượng giọng nói qua điện thoại.
Hạn chế chính của việc so sánh các giá trị MOS từ hai nghiên cứu riêng biệt là gì?
Bởi vì xếp hạng phụ thuộc vào mẫu, neo và nhóm người nghe cụ thể nên số MOS tuyệt đối từ các phiên khác nhau không thể được so sánh một cách đáng tin cậy.
Các công cụ dự đoán MOS tự động như DNSMOS hoặc UTMOS giải quyết được vấn đề gì?
Các mô hình MOS dự đoán được đào tạo về xếp hạng của con người sẽ tự động ước tính điểm số, cho phép các nhóm sàng lọc nhiều mẫu với chi phí thấp trước khi đưa ra đánh giá cuối cùng về con người.