聽、聽、拼寫
Listen、Attend 和 Spell (LAS) 是 2015 年具有里程碑意義的神經網絡,它可以將語音直接轉錄為字符,無需手工構建的發音詞典或單獨的語言模型。
概述
It showed that a single end-to-end model could do speech recognition.
深入探討
Listen、Attend 和 Spell 由 Google 研究人員 Chan、Jaitly、Le 和 Vinyals 於 2015 年推出,是第一批真正的端對端語音辨識器之一。它由兩個部分組成:「Listener」(一種金字塔形雙向 LSTM,在壓縮時間維度的同時對音訊進行編碼)和「Speller」(一種基於注意力的 LSTM 解碼器,一次發出一個字元)。注意力機制讓拼字者專注於每個輸出字母的相關音訊片段。與舊的 HMM-DNN 管道不同,LAS 不需要音素字典,不需要強制對齊,也不需要單獨訓練的語言模型;它從轉錄的音訊中聯合學習拼字、單字邊界和聲學。它直接啟發了現代序列到序列和基於注意力的 ASR 系統。
技術洞察
LAS 將編碼器-解碼器與注意力機制結合。金字塔形 LSTM 編碼器將三層中每一層的時間解析度減半,將長聲學序列切割成可管理的長度,因此註意力易於處理。在每個解碼步驟中,Speller 都會計算所有編碼器狀態的注意力權重,將它們混合到上下文向量中,並預測下一個字元。訓練最大化正確字元序列的機率;計劃採樣技巧減少了訓練/測試不匹配。
戰略影響
交通與覆蓋範圍
它透過轉錄、旁白和語音介面提高了可訪問性。
成本與預算
媒體團隊可以用更少的預算更快地交付精美的音訊。
速度與規模
面向客戶的系統可以處理更大規模的語音互動。
聽、聽、拼的未來
LAS 現在已成為歷史,但其 DNA 貫穿每個現代 ASR 系統。其基於注意力的編碼器-解碼器概念演變成 Transformer 和 Conformer 識別器,而 RNN-Transducer 等相關方法則支援設備聽寫。未來的系統將繼續這種端到端的軌跡,將識別與翻譯和理解融合在單一的多語言模型中,並推動流式、低延遲的轉錄,而 LAS 由於是非流式的,最初無法提供這種功能。
現實世界的實施
無需發音字典即可將英語口語直接轉錄成字母
作為基於注意力的語音聽寫和字幕系統的概念基礎
示範學術語音辨識課程作業和基準的端到端培訓
啟發性的序列到序列模型後來用於語音翻譯管道
風險與防護欄
如果未徵得同意,語音濫用和冒充風險就會增加。
由於口音、方言或嘈雜的環境,準確性可能會下降。
如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。
實施路線圖
獲得語音捕獲、克隆和重用的明確同意。
測試不同揚聲器和背景條件下的品質。
定義人員必須審查或批准輸出的時間。
標記合成音訊並保留來源記錄以供問責。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Listen Attend and Spell quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Listen Attend and Spell?
Listen、Attend 和 Spell (LAS) 是 2015 年具有里程碑意義的神經網絡,它可以將語音直接轉錄為字符,無需手工構建的發音詞典或單獨的語言模型。它表明單一端到端模型可以進行語音識別。
LAS 模型的兩個主要組成部分是什麼?
LAS 由處理音訊的「監聽器」編碼器和發出字元的基於注意力的「拼字器」解碼器組成。
LAS 中的 Speller 輸出什麼?
Speller 是一個解碼器,可以逐個字元產生轉錄,直接學習拼字。
為什麼 LAS 編碼器被稱為「金字塔」?
金字塔 BLSTM 的每一層都將序列長度減半,縮短了長音頻序列,因此註意力在計算上是可行的。
LAS 特別不需要哪些舊組件?
與經典的 HMM-DNN 管道不同,LAS 直接從音訊到文字對進行學習,無需音素字典或強制對齊。
哪種機制可以讓拼字者專注於每個角色的音訊相關部分?
注意力機制計算編碼器狀態的權重,形成解碼器在每個步驟中使用的上下文向量。