PESQ および STOI の音声品質メトリクス
PESQ と STOI は、人間の聞き手を必要とせずに、処理された音声がどの程度優れているか、またそれがどの程度理解しやすいかをスコアする標準的な客観的指標です。
概要
They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.
ディープダイブ
PESQ (音声品質の知覚評価) は、ITU-T P.862 として標準化されており、主に電話やコーデックのテストのために知覚される音声の品質を予測します。クリーンな基準信号と劣化した基準信号を比較し、人間の聴覚をモデル化した MOS のようなスケール (およそ -0.5 ~ 4.5) でスコアを出力します。 2010 年に導入された STOI (短時間客観的明瞭度) は、代わりに明瞭度、つまり聞き手が実際に理解できる単語の数を予測します。これは、周波数帯域全体でクリーンな音声と処理された音声の短時間の時間エンベロープを相関させ、0 から 1 のスコアを生成します。どちらも侵入型 (参照ベース) メトリクスです。 PESQ は「良い音ですか?」に答えます。一方、STOIは「理解できますか?」と答えます。これらは共に、音声強調、ノイズ除去、および残響除去システムのデフォルトの評価ツールです。
技術的な洞察
どちらのメトリクスも侵入的です。スコアリングする前に、クリーンなリファレンスと劣化した信号を調整します。 PESQ は、両方の信号を音響心理学的ラウドネス スケール (バーク バンド) にマッピングし、時間の経過に伴う知覚障害を計算し、それを MOS のような値に回帰します。 STOI は、音声を 1/3 オクターブのバンドに分割し、約 400 ミリ秒の短いエンベロープ セグメントを取得し、それらをクリップして正規化し、基準エンベロープと劣化したエンベロープの間の相関関係を計算します。これらの相関を平均すると、0 から 1 の明瞭度スコアが得られます。
戦略的影響
アクセスと到達範囲
文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。
費用と予算
メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。
速度とスケール
顧客対応システムは、音声対話を大規模に処理できます。
PESQ と STOI 音声品質指標の将来
PESQ と STOI にはクリーンな参照が必要なため、研究は、ニューラル ネットワークを使用して劣化した信号のみから品質をスコアリングする DNSMOS や NISQA のような、非侵入的で参照不要のメトリクスに移行しています。新しい深層学習モデルも、人間の MOS を直接予測するようにトレーニングされています。それでも、PESQ と STOI は依然として定着したベンチマークであり、重要な傾向として、これらを微分可能にすることで、事後評価としてだけでなく、音声強調ネットワークのトレーニング損失関数として直接使用できるようになってきています。
現実世界の実装
標準テストセットでの音声強調モデルとノイズ抑制モデルのベンチマーク
ネットワーク エンジニアリング中に電話と VoIP コーデックの品質を比較する
補聴器と人工内耳の処理を調整して明瞭度を最大限に高める
会議および音声アシスタントのパイプラインにおける残響除去アルゴリズムの検証
リスクとガードレール
同意がない場合、音声の悪用やなりすましのリスクが高まります。
アクセント、方言、または騒がしい環境では精度が低下する可能性があります。
合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。
実装ロードマップ
音声のキャプチャ、複製、再利用については明示的な同意を取得してください。
さまざまな話者や背景条件で品質をテストします。
人間がいつ出力をレビューまたは承認する必要があるかを定義します。
合成音声にラベルを付け、出所記録を保管して説明責任を果たします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the PESQ and STOI Speech Quality Metrics quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
音声合成の品質
よくある質問
What is PESQ and STOI Speech Quality Metrics?
PESQ と STOI は、人間の聞き手を必要とせずに、処理された音声がどの程度優れているか、またそれがどの程度理解しやすいかをスコアする標準的な客観的な指標です。これにより、エンジニアはコーデック、ノイズ リデューサー、音声強調モデルのベンチマークを自動的に行うことができます。
PESQ は主に何を測定しますか?
PESQ (ITU-T P.862) は、MOS のようなスケールで知覚される音声品質を予測します。
STOI は主に何を予測しますか?
STOI は、明瞭度、つまり音声がどの程度理解できるかを 0 から 1 のスケールで推定します。
PESQ と STOI はどちらも「侵入型」メトリクスとして説明されています。それはどういう意味ですか?
侵入型メトリクスは、劣化した信号をクリーンな基準と比較してスコアを計算します。
STOIのおおよそのスコア範囲はどれくらいですか?
STOI は 0 ~ 1 の値を出力します。値が大きいほど理解しやすいことを意味します。
PESQ はどの種類の知覚周波数スケールを使用して人間の聴覚をモデル化しますか?
PESQ は、バークバンド処理を使用して信号を音響心理学的ラウドネス表現にマッピングします。