音频人工智能指南

Jasper 和 QuartzNet ASR

Jasper 和 QuartzNet 是 NVIDIA 的端到端卷积语音识别模型,QuartzNet 是 Jasper 的更小、更高效的重新设计。

阅读时间:2分钟最后更新

概述

They matter for showing how to get strong accuracy with far fewer parameters, ideal for deployment.

深入探讨

Jasper(Just Another Speech Recognizer)由 NVIDIA 于 2019 年发布,是一个深度一维卷积网络,最多 54 层,它使用 CTC 损失将梅尔频谱图特征映射到字符。它引入了密集的残差连接,因此梯度可以干净地流过非常深的堆栈。同年发布的 QuartzNet 保留了 Jasper 的块结构,但用时间通道可分离卷积替换了标准卷积,将每个滤波器分为深度时间卷积和点通道混合步骤。这种分解将参数从 Jasper 的约 3.33 亿减少到约 1900 万,同时与 Librispeech 的准确性相匹配。两者都包含在 NVIDIA 的 NeMo 工具包中,并针对快速 GPU 训练和实时推理进行了调整,使其成为生产 ASR 的流行构建块。

技术洞察

QuartzNet 的效率来自于时间通道可分离卷积,这与 MobileNet 背后的想法相同。普通的一维卷积将时间和通道混合在一起,成本是 K 乘以 C-in 乘以 C-out 权重。将其分解为随时间变化的深度卷积加上通道上的 1x1 逐点卷积,可将参数减少到 K 乘以 C 加上 C-in 乘以 C-out。堆叠在残差块中并使用 CTC 进行训练,这可以以模型大小和计算量的一小部分提供接近 Jasper 的精度。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

Jasper 和 QuartzNet ASR 的未来

QuartzNet 的可分离卷积血统直接导致了 NVIDIA 的 Citrinet 和广泛使用的 Conformer 模型,这些模型增加了自注意力以捕获全局上下文以及局部卷积。预计流式传输混合卷积加注意力架构和转换器 (RNN-T) 解码器将继续发展。随着 ASR 推向手机、汽车和嵌入式设备,核心课程——用于边缘和实时部署的参数高效卷积仍然是核心。

现实世界的实施

通过 NeMo 工具包部署在 NVIDIA GPU 上的实时转录和语音助手

边缘和嵌入式 ASR,QuartzNet 占用空间小,适合内存受限的设备

针对特定领域的词汇(例如医学或法律术语)微调预训练的 QuartzNet 检查点

呼叫中心分析可快速且经济高效地转录大量音频

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jasper and QuartzNet ASR quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

Wav2Letter 卷积 ASR

常见问题

What is Jasper and QuartzNet ASR?

Jasper 和 QuartzNet 是 NVIDIA 的端到端卷积语音识别模型,QuartzNet 是 Jasper 的更小、更高效的重新设计。它们对于展示如何使用更少的参数获得较高的准确性非常重要,非常适合部署。

哪些关键创新让 QuartzNet 使用比 Jasper 少得多的参数?

QuartzNet 用时间通道可分离卷积取代了标准卷积,在保持准确性的同时大幅减少了参数数量。

与 Jasper 的约 3.33 亿个参数相比,QuartzNet 大约有多少个参数?

QuartzNet 缩减至大约 1900 万个参数,大约减少了 17 倍,同时与 Jasper 的 Librispeech 准确性相匹配。

Jasper 和 QuartzNet 是哪家公司开发的?

这两种模型均由 NVIDIA 开发,并通过其 NeMo 对话式 AI 工具包进行分发。

Jasper 和 QuartzNet 使用什么损失函数在没有显式对齐的情况下进行训练?

两者都使用 CTC 损失,将可变长度音频与字符序列对齐,而不需要每帧标签。

什么结构特征有助于梯度流过 Jasper 的非常深(最多 54 层)的网络?

Jasper 使用密集的残差(跳过)连接,因此梯度可以通过其深度卷积堆栈干净地传播。