オーディオAIガイド

平均意見スコアの評価

平均オピニオン スコア (MOS) は、人間のリスナーによる 1 ~ 5 の平均評価であり、合成または送信されたオーディオのサウンドがどの程度優れているかを測定します。

2分の読書最終更新日

概要

It is the gold-standard yardstick for judging text-to-speech, voice cloning, and audio codecs, because ultimately humans, not machines, are the audience.

ディープダイブ

MOS は、ITU によって標準化された電話網テストに由来しています (勧告 P.800)。リスナーは短いオーディオ クリップを聞いて、それぞれを 5 段階のスケールで評価します: 5 = 優れている、4 = 良い、3 = 普通、2 = 悪い、1 = 悪い。多くのクリップとリスナーにわたる多くの評価を平均すると、MOS が得られます。バリアントは、全体的な品質については MOS-LQS、A/B 優先については比較 MOS (CMOS)、およびきめ細かいコーデック比較については MUSHRA など、特定の質問を対象としています。現代の AI 音声研究では、MOS が WaveNet、Tacotron、VALL-E などのシステムの主要な指標です。人間による評価は時間がかかり、コストがかかるため、予測 MOS モデル (DNSMOS、UTMOS、NISQA) はスコアを自動的に推定するようになりましたが、依然として人間による MOS が信頼できる参照となります。

技術的な洞察

適切な MOS 調査では、平均値が統計的に安定するように、調整されたヘッドフォン、固定ラウドネス、ランダム化されたクリップ順序、およびサンプルごとに十分な評価者 (多くの場合 20 人以上) などのリスニング条件を管理します。 0.1 MOS ギャップはノイズである可能性があるため、研究者は 95% 信頼区間を報告しています。重要なことは、MOS は絶対的な物理的測定値ではないということです。それはそのセッションの特定のクリップと指示によって固定されているため、さまざまな研究からのスコアを直接比較することはできません。

戦略的影響

アクセスと到達範囲

文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。

費用と予算

メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。

速度とスケール

顧客対応システムは、音声対話を大規模に処理できます。

平均意見スコア評価の将来

自動 MOS 予測機能は急速に改善されており、人間が評価した大規模なコーパスでトレーニングされているため、最終的な人間によるテストの前に、チームが数千のサンプルを安価にスクリーニングできるようになります。 1 つの曖昧な数値ではなく、自然さ、明瞭さ、話者の類似性、感情を分離する、より豊かで多次元のスコアが期待されます。生成音声が人間と同等に近づくにつれて、生の MOS が 4.5 付近で飽和し、上位システムを区別できなくなるため、評価は好みのテストや微妙なアーティファクトの検出へと移行しています。

現実世界の実装

リスナーに自然さを 1 ~ 5 で評価してもらい、ナビゲーション アプリの 2 つのテキスト読み上げ音声を比較します。

リスナーの評価を使用して、同じビットレートで新しいニューラル オーディオ コーデックを MP3 と比較してベンチマークする

オーディオブック製品に導入する前に音声クローン モデルの出力品質を検証する

通信エンジニアが新しい VoIP ネットワーク上の通話品質をスコアリングし、4.0 MOS 目標を満たしていることを証明

リスクとガードレール

同意がない場合、音声の悪用やなりすましのリスクが高まります。

アクセント、方言、または騒がしい環境では精度が低下する可能性があります。

合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。

実装ロードマップ

1

音声のキャプチャ、複製、再利用については明示的な同意を取得してください。

2

さまざまな話者や背景条件で品質をテストします。

3

人間がいつ出力をレビューまたは承認する必要があるかを定義します。

4

合成音声にラベルを付け、出所記録を保管して説明責任を果たします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mean Opinion Score Evaluation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

よくある質問

What is Mean Opinion Score Evaluation?

平均オピニオン スコア (MOS) は、人間のリスナーによる 1 ~ 5 の平均評価であり、合成または送信されたオーディオのサウンドがどの程度優れているかを測定します。これは、テキスト読み上げ、音声クローン、およびオーディオ コーデックを判断するためのゴールドスタンダードの基準です。最終的に聴衆となるのは機械ではなく人間であるためです。

平均意見スコア 5 は、標準スケールでは何を表しますか?

標準的な ITU の 5 段階絶対カテゴリ評価スケールでは、5 は優れていることを意味し、1 は悪いを意味します。

MOS 研究では、オーディオ クリップごとに多くのリスナーを使用するのはなぜですか?

個々の評価は主観的でノイズが多いため、多数の評価者を平均すると、報告可能な信頼区間を持つ統計的に安定したスコアが得られます。

オーディオ品質に関するオリジナルの MOS 方法論を標準化した組織はどこですか?

国際電気通信連合は、勧告 P.800 で MOS テストを定義しました。当初は電話の音声品質を対象としたものでした。

2 つの別々の研究の MOS 値を比較する際の重要な制限は何ですか?

評価は特定のサンプル、アンカー、リスナー プールに依存するため、異なるセッションからの絶対的な MOS 数値を確実に比較することはできません。

DNSMOS や UTMOS などの自動 MOS 予測機能はどのような問題を解決しますか?

人間による評価に基づいてトレーニングされた予測 MOS モデルにより、スコアが自動的に推定されるため、チームは最終的な人間による評価の前に、多くのサンプルを安価にスクリーニングできます。