平均意見得分評估
平均意見分數 (MOS) 是人類聽眾的 1 到 5 平均評分,用於衡量合成或傳輸的音訊聲音的好壞程度。
概述
It is the gold-standard yardstick for judging text-to-speech, voice cloning, and audio codecs, because ultimately humans, not machines, are the audience.
深入探討
MOS 來自 ITU 標準化的電話網路測試(建議 P.800)。聽眾聽到簡短的音訊片段,並以五分制對每個片段進行評分:5 = 優秀,4 = 良好,3 = 一般,2 = 差,1 = 差。對許多剪輯和聽眾的許多評分進行平均即可得出 MOS。變體針對特定問題:MOS-LQS 用於整體質量,比較 MOS (CMOS) 用於 A/B 偏好,MUSHRA 用於細粒度編解碼器比較。在現代人工智慧語音研究中,MOS 是 WaveNet、Tacotron 和 VALL-E 等系統的主要指標。由於人工評估緩慢且成本高昂,預測 MOS 模型(DNSMOS、UTMOS、NISQA)現在可以自動估計分數,儘管人工 MOS 仍然是值得信賴的參考。
技術洞察
適當的 MOS 研究控制聆聽條件:校準耳機、固定響度、隨機剪輯順序以及每個樣本足夠的評估者(通常超過 20 個),因此平均值在統計上是穩定的。研究人員報告了 95% 的置信區間,因為 0.1 MOS 間隙可能是噪音。至關重要的是,MOS 並不是絕對的物理測量;它以該會話中的特定剪輯和說明為基礎,因此不同研究的分數不能直接比較。
戰略影響
交通與覆蓋範圍
它透過轉錄、旁白和語音介面提高了可訪問性。
成本與預算
媒體團隊可以用更少的預算更快地交付精美的音訊。
速度與規模
面向客戶的系統可以處理更大規模的語音互動。
平均意見評分評估的未來
自動 MOS 預測器正在快速改進,並在大型人類評級語料庫上進行訓練,使團隊可以在最終的人類測試之前以低廉的成本篩選數千個樣本。期望有更豐富、多維的分數來區分自然度、清晰度、說話者相似度和情感,而不是一個模糊的數字。隨著生成語音接近人類水平,評估正在轉向偏好測試和檢測微妙的偽影,因為原始 MOS 接近 4.5 飽和並且無法再區分頂級系統。
現實世界的實施
透過要求聽眾對自然度進行評分 1-5 來比較導航應用程式的兩種文字轉語音
使用聽眾評級以相同位元率對新的神經音訊編解碼器與 MP3 進行基準測試
在有聲書產品中部署之前驗證語音克隆模型的輸出品質
電信工程師對新 VoIP 網路的通話品質進行評分,以證明其滿足 4.0 MOS 目標
風險與防護欄
如果未徵得同意,語音濫用和冒充風險就會增加。
由於口音、方言或嘈雜的環境,準確性可能會下降。
如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。
實施路線圖
獲得語音捕獲、克隆和重用的明確同意。
測試不同揚聲器和背景條件下的品質。
定義人員必須審查或批准輸出的時間。
標記合成音訊並保留來源記錄以供問責。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mean Opinion Score Evaluation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Mean Opinion Score Evaluation?
平均意見分數 (MOS) 是人類聽眾的 1 到 5 平均評分,用於衡量合成或傳輸的音訊聲音的好壞程度。它是判斷文字轉語音、語音複製和音訊編解碼器的黃金標準,因為最終觀眾是人類,而不是機器。
在標準量表中,平均意見分數 5 代表什麼?
在標準國際電聯五點絕對類別評級量表中,5 表示優秀,1 表示差。
為什麼 MOS 研究在每個音訊片段中使用許多聽眾?
個人評級是主觀且嘈雜的,因此對許多評級者進行平均會產生統計上穩定的分數,並具有可報告的置信區間。
哪個組織標準化了原始 MOS 音訊品質方法?
國際電信聯盟在 P.800 建議書中定義了 MOS 測試,最初用於電話語音品質。
比較兩個獨立研究的 MOS 值的主要限制是什麼?
由於評分取決於特定樣本、錨點和聽眾池,因此無法可靠地比較不同會話的絕對 MOS 數。
DNSMOS 或 UTMOS 等自動 MOS 預測器可以解決什麼問題?
經過人類評分訓練的預測 MOS 模型會自動估計分數,讓團隊在最終的人類評估之前以較低的成本篩選許多樣本。