音频人工智能指南

听、听、拼写

Listen、Attend 和 Spell (LAS) 是 2015 年具有里程碑意义的神经网络,它可以将语音直接转录为字符,无需手工构建的发音词典或单独的语言模型。

阅读时间:2分钟最后更新

概述

It showed that a single end-to-end model could do speech recognition.

深入探讨

Listen、Attend 和 Spell 由 Google 研究人员 Chan、Jaitly、Le 和 Vinyals 于 2015 年推出,是首批真正的端到端语音识别器之一。它由两部分组成:“Listener”(一种金字塔形双向 LSTM,在压缩时间维度的同时对音频进行编码)和“Speller”(一种基于注意力的 LSTM 解码器,一次发出一个字符)。注意力机制让拼写者专注于每个输出字母的相关音频片段。与旧的 HMM-DNN 管道不同,LAS 不需要音素字典,不需要强制对齐,也不需要单独训练的语言模型;它从转录的音频中联合学习拼写、单词边界和声学。它直接启发了现代序列到序列和基于注意力的 ASR 系统。

技术洞察

LAS 将编码器-解码器与注意力机制相结合。金字塔形 LSTM 编码器将三层中每一层的时间分辨率减半,将长声学序列切割成可管理的长度,因此注意力易于处理。在每个解码步骤中,Speller 都会计算所有编码器状态的注意力权重,将它们混合到上下文向量中,并预测下一个字符。训练最大化正确字符序列的概率;计划采样技巧减少了训练/测试不匹配。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

听、听、拼的未来

LAS 现已成为历史,但其 DNA 贯穿于每一个现代 ASR 系统中。其基于注意力的编码器-解码器理念演变成 Transformer 和 Conformer 识别器,而 RNN-Transducer 等相关方法则支持设备听写。未来的系统将继续这种端到端的轨迹,将识别与翻译和理解融合在单一的多语言模型中,并推动流式、低延迟的转录,而 LAS 由于是非流式的,最初无法提供这种功能。

现实世界的实施

无需发音词典即可将英语口语直接转录成字母

作为基于注意力的语音听写和字幕系统的概念基础

演示学术语音识别课程作业和基准的端到端培训

启发性的序列到序列模型后来用于语音翻译管道

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Listen Attend and Spell quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

音乐自动标记

常见问题

What is Listen Attend and Spell?

Listen、Attend 和 Spell (LAS) 是 2015 年具有里程碑意义的神经网络,它可以将语音直接转录为字符,无需手工构建的发音词典或单独的语言模型。它表明单个端到端模型可以进行语音识别。

LAS 模型的两个主要组成部分是什么?

LAS 由处理音频的“监听器”编码器和发出字符的基于注意力的“拼写器”解码器组成。

LAS 中的 Speller 输出什么?

Speller 是一个解码器,可以逐个字符生成转录,直接学习拼写。

为什么 LAS 编码器被称为“金字塔”?

金字塔 BLSTM 的每一层都将序列长度减半,缩短了长音频序列,因此注意力在计算上是可行的。

LAS 特别不需要哪些旧组件?

与经典的 HMM-DNN 管道不同,LAS 直接从音频到文本对进行学习,无需音素字典或强制对齐。

哪种机制可以让拼写者专注于每个角色的音频相关部分?

注意力机制计算编码器状态的权重,形成解码器在每一步使用的上下文向量。