音频人工智能指南

VALL-E 和编解码器语言模型

VALL-E 将文本到语音重新定义为音频编解码器令牌上的语言建模问题,从而可以从仅三秒的样本中克隆语音。

阅读时间:2分钟最后更新

概述

It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.

深入探讨

VALL-E 由 Microsoft 于 2023 年初宣布,将语音合成视为语言建模。它不是预测频谱图,而是预测神经编解码器 (EnCodec) 的离散声学标记,因此生成变成了音频词汇表上的下一个标记预测。给定一个看不见的说话者加上目标文本的 3 秒录音,VALL-E 会继续该说话者的声音,保留音色甚至声学环境。它接受了大约 60,000 小时的语音训练,远远超过典型的 TTS 数据集,这使其具有强大的零样本克隆能力。由于编解码器标记是分层的(通过 RVQ),VALL-E 使用两个阶段:自回归模型预测第一个以提示为条件的粗略标记流,非自回归模型填充剩余的详细标记。这个编解码器-LM 配方启发了 VALL-E 2 等后继者和许多语音基础模型。

技术洞察

诀窍是分层编解码器令牌的混合解码。自回归阶段一次预测最重要的第一个密码本标记,捕获韵律和内容。其余的码本添加了精细的声学细节,由以第一个流和扬声器提示为条件的非自回归模型并行预测。这种分割保持了高质量,同时避免了顺序生成每个令牌的成本,并且使用编解码器意味着可以使用相同的变压器机制对语音和文本进行建模。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

VALL-E 和编解码器语言模型的未来

编解码器语言模型正在将语音与大型语言模型合并,指向在一个模型中听、推理和说的统一系统。期待更好的稳定性和更少的伪影、实时流生成以及对情感和风格的更严格控制。同样强大的克隆使 VALL-E 对于可访问性和配音很有用,但也引发了深度伪造和同意问题,因此水印、语音验证保护措施和政策护栏正在成为这些系统部署方式的核心部分。

现实世界的实施

从几秒钟的音频中克隆声音,以用于个性化助理或恢复丢失声音的辅助工具

将视频本地化并配音成其他语言,同时保留原始说话者的音色

生成富有表现力、与上下文匹配的旁白,保留录音的声学环境

作为多模式助手的语音骨干,可以理解并产生语音

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VALL-E and Codec Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

大型语言模型的新兴能力

常见问题

What is VALL-E and Codec Language Models?

VALL-E 将文本到语音重新定义为音频编解码器令牌上的语言建模问题,从而可以从仅三秒的样本中克隆语音。它表明,为文本 LLM 提供支持的相同下一个标记预测可以生成非常自然、富有表现力的语音。

VALL-E 与早期文本转语音系统的核心思想是什么?

VALL-E 将 TTS 重新构建为对离散音频编解码器令牌的下一个令牌预测,将语音生成视为语言模型。

VALL-E 需要多少参考音频来克隆新说话者的声音?

VALL-E 可以从看不见的说话者的大约 3 秒样本中执行零样本语音克隆。

VALL-E 使用哪种神经编解码器来生成音频标记?

VALL-E 基于 Meta 的 EnCodec 构建,预测其离散声学标记以合成语音。

为什么 VALL-E 同时使用自回归和非自回归阶段?

编解码器令牌通过 RVQ 进行分层; VALL-E 以自回归方式预测第一个粗略流,并并行预测剩余的细节标记以提高效率。

VALL-E 大约训练了多少语音数据,以实现强大的零样本克隆?

VALL-E 接受了大约 60,000 小时的语音训练,远远超过典型的 TTS 数据集,这提高了其零样本泛化能力。