平均意见得分评估
平均意见分数 (MOS) 是人类听众的 1 到 5 平均评分,用于衡量合成或传输的音频声音的好坏程度。
概述
It is the gold-standard yardstick for judging text-to-speech, voice cloning, and audio codecs, because ultimately humans, not machines, are the audience.
深入探讨
MOS 来自 ITU 标准化的电话网络测试(建议 P.800)。听众听到简短的音频片段,并按五分制对每个片段进行评分:5 = 优秀,4 = 良好,3 = 一般,2 = 差,1 = 差。对许多剪辑和听众的许多评分进行平均即可得出 MOS。变体针对特定问题:MOS-LQS 用于总体质量,比较 MOS (CMOS) 用于 A/B 偏好,MUSHRA 用于细粒度编解码器比较。在现代人工智能语音研究中,MOS 是 WaveNet、Tacotron 和 VALL-E 等系统的主要指标。由于人工评估缓慢且成本高昂,预测 MOS 模型(DNSMOS、UTMOS、NISQA)现在可以自动估计分数,尽管人工 MOS 仍然是值得信赖的参考。
技术洞察
适当的 MOS 研究控制聆听条件:校准耳机、固定响度、随机剪辑顺序以及每个样本足够的评估者(通常超过 20 个),因此平均值在统计上是稳定的。研究人员报告了 95% 的置信区间,因为 0.1 MOS 间隙可能是噪声。至关重要的是,MOS 并不是绝对的物理测量;它以该会话中的特定剪辑和说明为基础,因此不同研究的分数不能直接比较。
战略影响
交通与覆盖范围
它通过转录、旁白和语音界面提高了可访问性。
成本与预算
媒体团队可以用更少的预算更快地交付精美的音频。
速度与规模
面向客户的系统可以处理更大规模的语音交互。
平均意见评分评估的未来
自动 MOS 预测器正在快速改进,并在大型人类评级语料库上进行训练,使团队可以在最终的人类测试之前以低廉的成本筛选数千个样本。期望有更丰富、多维的分数来区分自然度、清晰度、说话者相似度和情感,而不是一个模糊的数字。随着生成语音接近人类水平,评估正在转向偏好测试和检测微妙的伪影,因为原始 MOS 接近 4.5 饱和并且无法再区分顶级系统。
现实世界的实施
通过要求听众对自然度进行评分 1-5 来比较导航应用程序的两种文本转语音
使用听众评级以相同比特率对新的神经音频编解码器与 MP3 进行基准测试
在有声读物产品中部署之前验证语音克隆模型的输出质量
电信工程师对新 VoIP 网络的通话质量进行评分,以证明其满足 4.0 MOS 目标
风险与防护栏
如果未征得同意,语音滥用和冒充风险就会增加。
由于口音、方言或嘈杂的环境,准确性可能会下降。
如果没有明确的标签,合成音频可能会被误认为是真实的语音。
实施路线图
获得语音捕获、克隆和重用的明确同意。
测试不同扬声器和背景条件下的质量。
定义人员必须审查或批准输出的时间。
标记合成音频并保留来源记录以供问责。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mean Opinion Score Evaluation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Mean Opinion Score Evaluation?
平均意见分数 (MOS) 是人类听众的 1 到 5 平均评分,用于衡量合成或传输的音频声音的好坏程度。它是判断文本转语音、语音克隆和音频编解码器的黄金标准,因为最终观众是人类,而不是机器。
在标准量表中,平均意见得分 5 代表什么?
在标准国际电联五点绝对类别评级量表中,5 表示优秀,1 表示差。
为什么 MOS 研究在每个音频片段中使用许多听众?
个人评级是主观且嘈杂的,因此对许多评级者进行平均会产生统计上稳定的分数,并具有可报告的置信区间。
哪个组织标准化了原始 MOS 音频质量方法?
国际电信联盟在 P.800 建议书中定义了 MOS 测试,最初用于电话语音质量。
比较两项独立研究的 MOS 值的主要限制是什么?
由于评分取决于特定样本、锚点和听众池,因此无法可靠地比较不同会话的绝对 MOS 数。
DNSMOS 或 UTMOS 等自动 MOS 预测器可以解决什么问题?
经过人类评分训练的预测 MOS 模型会自动估计分数,让团队在最终的人类评估之前以较低的成本筛选许多样本。