音訊人工智慧指南

PESQ 和 STOI 語音品質指標

PESQ 和 STOI 是標準的客觀指標,可以對處理後的語音聲音的好壞程度以及語音的可理解性進行評分,而無需人類聽眾。

閱讀時間約2分鐘最後更新

概述

They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.

深入探討

PESQ(語音品質感知評估),標準化為 ITU-T P.862,預測語音的感知質量,主要用於電話和編解碼器測試。它將乾淨的參考訊號與降級的參考訊號進行比較,並輸出類似 MOS 等級的分數(大約 -0.5 到 4.5),模擬人類聽覺感知。 STOI(短時間客觀清晰度)於 2010 年推出,它預測清晰度:聽眾實際上能理解多少單字。它將跨頻段的乾淨語音和經過處理的語音的短時時間包絡關聯起來,產生從 0 到 1 的分數。兩者都是侵入性(基於參考)指標。 PESQ 回答「聽起來不錯嗎?」而STOI則回答「你能理解嗎?」它們共同成為語音增強、降噪和去混響系統的預設評估工具。

技術洞察

這兩個指標都是侵入性的:它們在評分之前將乾淨的參考與降級的訊號對齊。 PESQ 將兩個訊號映射到心理聲學響度標度(巴克帶)上,計算隨時間變化的感知幹擾,並將其回歸為類似 MOS 的值。 STOI 將語音分成三分之一倍頻程,採用約 400 ms 的短包絡段,對其進行剪輯和標準化,然後計算參考包絡和降級包絡之間的相關性。將這些相關性平均可得出 0 到 1 的可懂度分數。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

PESQ 和 STOI 語音品質指標的未來

由於 PESQ 和 STOI 需要一個乾淨的參考,因此研究正在轉向非侵入式、無參考的指標,例如 DNSMOS 和 NISQA,這些指標僅使用神經網路根據降級訊號對品質進行評分。較新的深度學習模型也經過訓練可以直接預測人類 MOS。儘管如此,PESQ 和 STOI 仍然是根深蒂固的基準,一個關鍵趨勢是使它們具有可微分性,因此它們可以直接用作語音增強網路的訓練損失函數,而不僅僅是用作事後評估。

現實世界的實施

在標準測試集上對語音增強和噪音抑制模型進行基準測試

在網路工程期間比較電話和 VoIP 編解碼器質量

調整助聽器和人工耳蝸處理以獲得最大清晰度

驗證會議和語音助理管道中的去混響演算法

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PESQ and STOI Speech Quality Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

語音合成品質

常見問題

What is PESQ and STOI Speech Quality Metrics?

PESQ 和 STOI 是標準的客觀指標,可以對處理後的語音聲音的好壞程度以及語音的可理解性進行評分,而無需人類聽眾。它們讓工程師自動對編解碼器、降噪器和語音增強模型進行基準測試。

PESQ 主要在衡量什麼?

PESQ (ITU-T P.862) 以類似 MOS 的尺度預測感知的語音品質。

STOI 主要預測什麼?

STOI 以 0 到 1 的等級評估清晰度,即語音的可理解程度。

PESQ 和 STOI 都被描述為「侵入性」指標。這意味著什麼?

侵入性指標將降級訊號與乾淨的參考訊號進行比較以計算分數。

STOI的大概分數範圍是多少?

STOI 輸出一個介於 0 和 1 之間的值,其中越高意味著更容易理解。

PESQ 使用哪一種感知頻率尺度來模擬人類聽力?

PESQ 使用 Bark 頻帶處理將訊號對應到心理聲學響度表示上。