音訊人工智慧指南

Whisper 帶時間戳的字對齊

Whisper 單字對齊將每個轉錄單字固定到音訊中的準確開始和結束時間。

閱讀時間約2分鐘最後更新

概述

這會將平面文字記錄轉變為可點擊、可搜尋的時間線,用於字幕、配音和編輯。

深入探討

OpenAI 的 Whisper 是一種轉錄語音的編碼器-解碼器轉換器,但其本機輸出僅提供粗略的每段時間戳,而不是每字時間戳。字級對齊填補了這一空白。最常見的技巧(由 Whisper-timestamped 和 WhisperX 使用)讀取模型的交叉注意力權重:解碼器在發出每個標記時關注特定的音頻幀,並且峰值注意力位置粗略地標記說出該單詞的時間。然後,動態時間扭曲會強制將令牌單調、不重疊地對應到 30 秒的音訊視窗。 WhisperX 相反,在 Whisper 的文本上運行一個單獨的基於音素的強制對齊模型(如 wav2vec 2.0),以獲得更清晰的邊界。結果是每個單字都被標記為數十毫秒的精確度。

技術洞察

Whisper 將 30 秒的音訊區塊處理為 log-Mel 頻譜圖,以每秒 50 幀的速度編碼(每 20 毫秒一幀)。交叉注意力將每個解碼的令牌連結到這些幀; argmax 幀成為單字的時間。動態時間規則強制執行單調對齊,因此時間戳永遠不會倒退。強制對齊替代方案將已知的轉錄內容與音素級別的音訊進行匹配,從而提供比原始注意力峰值更清晰的邊緣。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

Whisper 時間戳對齊的未來

期望對齊方式直接嵌入解碼器中,而不是事後附加,再加上可靠的每個單字置信度分數,以便編輯者知道哪些時間戳值得信任。即時字幕的串流對齊正在改進,重疊揚聲器、音樂和代碼切換的穩健性也在改進。隨著多語言模型的發展,低資源語言的對齊品質應該會縮小與英語的差距,從而使自動配音和卡拉 OK 式字幕更加可靠。

現實世界的實施

產生 YouTube 和 TikTok 字幕,螢幕上的文字與所說的完全一致

強大的字幕編輯器可讓您點擊一個單字並跳到該音訊時刻

將翻譯後的腳本與原始音訊對齊,以實現自動配音和口型同步計時

建立可搜尋的播客檔案,其中文字查詢精確到所說的秒數

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Whisper Timestamped Word Alignment quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

耳語語音識別

常見問題

什么是 Whisper 时间戳字对齐?

Whisper 單字對齊將每個轉錄單字固定到音訊中的準確開始和結束時間。這會將平面文字記錄轉變為可點擊、可搜尋的時間線,用於字幕、配音和編輯。

字級對齊增加了 Whisper 原生輸出所缺少的哪些內容?

Whisper 本身提供粗略的每段時間戳記;對齊添加了精確的每個單字的開始和結束時間。

耳語時間戳記使用哪個內部訊號來及時定位單字?

交叉注意力揭示了解碼器在發出每個令牌時關注哪些音訊幀,指示時間。

為什麼在對齊過程中應用動態時間扭曲?

DTW 確保時間戳按順序向前推進,並且單字不會重疊,從而產生合理的時間軸。

與原始注意力相比,WhisperX 如何銳化單字邊界?

WhisperX 使用 wav2vec 2.0 等音素模型來對齊 Whisper 的文本,以獲得比注意力峰值更清晰的邊緣。

Whisper 的編碼器以什麼速率產生音訊幀?

Whisper 以大約每秒 50 幀或每 20 毫秒一幀的速度對 log-Mel 頻譜圖進行編碼。