音訊人工智慧指南

Jasper 和 QuartzNet ASR

Jasper 和 QuartzNet 是 NVIDIA 的端對端卷積語音辨識模型,QuartzNet 是 Jasper 的更小、更有效率的重新設計。

閱讀時間約2分鐘最後更新

概述

They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.

深入探討

Jasper(Just Another Speech Recognizer)由 NVIDIA 於 2019 年發布,是一個深度一維卷積網絡,最多 54 層,它使用 CTC 損失將梅爾頻譜圖特徵映射到字元。它引入了密集的殘差連接,因此梯度可以乾淨地流過非常深的堆疊。同年發布的 QuartzNet 保留了 Jasper 的塊結構,但用時間通道可分離卷積替換了標準卷積,將每個濾波器分為深度時間卷積和點通道混合步驟。這種分解將參數從 Jasper 的約 3.33 億減少到約 1900 萬,同時與 Librispeech 的準確性相匹配。兩者都包含在 NVIDIA 的 NeMo 工具包中,並針對快速 GPU 訓練和即時推理進行了調整,使其成為生產 ASR 的熱門構建塊。

技術洞察

QuartzNet 的效率來自於時間通道可分離卷積,這與 MobileNet 背後的想法相同。普通的一維卷積將時間和通道混合在一起,成本是 K 乘以 C-in 乘以 C-out 權重。將其分解為隨時間變化的深度卷積加上通道上的 1x1 逐點卷積,可將參數減少到 K 乘以 C 加上 C-in 乘以 C-out。堆疊在殘差區塊中並使用 CTC 進行訓練,這可以以模型大小和計算量的一小部分提供接近 Jasper 的精度。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

Jasper 與 QuartzNet ASR 的未來

QuartzNet 的可分離卷積血統直接導致了 NVIDIA 的 Citrinet 和廣泛使用的 Conformer 模型,這些模型增加了自註意力以捕捉全局上下文以及局部卷積。預計串流混合卷積加註意力架構和轉換器 (RNN-T) 解碼器將繼續發展。隨著 ASR 推向手機、汽車和嵌入式設備,核心課程——用於邊緣和即時部署的參數高效卷積仍然是核心。

現實世界的實施

透過 NeMo 工具包部署在 NVIDIA GPU 上的即時轉錄和語音助手

邊緣和嵌入式 ASR,QuartzNet 佔用空間小,適合記憶體受限的設備

針對特定領域的詞彙(例如醫學或法律術語)微調預先訓練的 QuartzNet 檢查點

呼叫中心分析可快速且經濟高效地轉錄大量音頻

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jasper and QuartzNet ASR quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

Wav2Letter 卷積 ASR

常見問題

What is Jasper and QuartzNet ASR?

Jasper 和 QuartzNet 是 NVIDIA 的端對端卷積語音辨識模型,QuartzNet 是 Jasper 的更小、更有效率的重新設計。它們對於展示如何使用更少的參數獲得較高的準確性非常重要,非常適合部署。

哪些關鍵創新讓 QuartzNet 使用比 Jasper 少很多的參數?

QuartzNet 以時間通道可分離卷積取代了標準卷積,在保持準確度的同時大幅減少了參數數量。

與 Jasper 的約 3.33 億個參數相比,QuartzNet 大約有多少個參數?

QuartzNet 縮減至約 1,900 萬個參數,大約減少了 17 倍,同時與 Jasper 的 Librispeech 準確性相符。

Jasper 和 QuartzNet 是哪家公司開發的?

這兩個模型均由 NVIDIA 開發,並透過其 NeMo 對話式 AI 工具包進行分發。

Jasper 和 QuartzNet 使用什麼損失函數在沒有明確對齊的情況下進行訓練?

兩者都使用 CTC 損失,將可變長度音訊與字元序列對齊,而不需要每幀標籤。

什麼結構特徵有助於梯度流過 Jasper 的非常深(最多 54 層)的網絡?

Jasper 使用密集的殘差(跳過)連接,因此梯度可以透過其深度卷積堆疊乾淨地傳播。