音频人工智能指南

Voicebox 流程匹配语音生成

Voicebox 是 Meta 的文本引导语音生成模型,采用流匹配目标进行训练,以“填充”屏蔽音频,让一个模型进行零样本语音克隆、噪声消除、内容编辑和多语言合成。

阅读时间:2分钟最后更新

概述

It matters because, like a language model for speech, it generalizes across many tasks it was never explicitly trained for.

深入探讨

Voicebox 由 Meta AI 于 2023 年宣布,针对单一任务进行训练:给定周围的音频上下文和相应的文本,预测语音中被屏蔽的部分。这种“上下文中”或填充公式在概念上借鉴了大型语言模型,意味着同一模型通过选择要屏蔽的内容来处理不同的推理工作。擦除说错的单词,Voicebox 会以相同的声音重新生成它;提供某人的两秒钟演讲作为上下文,它会模仿他们的音色和风格合成新句子;掩盖噪音片段并产生干净的替代品。报告的结果显示,与基于扩散的自回归系统相比,零样本文本到语音的质量很高,生成速度要快得多,同时一个模型支持多种语言。

技术洞察

Voicebox 使用条件流匹配,训练连续时间模型来学习平滑的速度场,该速度场将随机噪声传输到真实的语音特征,以文本和未屏蔽的音频为条件。与扩散相比,流匹配可以使用常微分方程求解器以相对较少的步骤求解,从而降低推理成本。通过将每项功能定义为“预测给定上下文的屏蔽音频”,单个非自回归网络可以学习编辑、克隆和去噪,而无需特定于任务的头或单独的训练运行。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

Voicebox 流程匹配语音生成的未来

流程匹配语音生成将支撑通用语音模型,这些模型可以像文本编辑器处理单词一样流畅地编辑、翻译和重新设计音频。期待实时对话代理、翻译中的跨语言语音保存以及损坏录音的高保真恢复。由于相同的技术可以实现令人信服的语音克隆,Meta 最初保留了该模型,并推动了检测合成语音的研究——来源水印、同意框架和检测工具将成为负责任部署的核心。

现实世界的实施

通过输入更正的单词并以原始发言者的声音重新朗读来编辑播客

只需几秒的参考音频即可进行零样本语音克隆

通过掩蔽和重新生成干净的语音片段来消除瞬态噪声

从一个模型跨多种语言合成同一说话人的声音

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Voicebox Flow-Matching Speech Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

What is Voicebox Flow-Matching Speech Generation?

Voicebox 是 Meta 的文本引导语音生成模型,采用流匹配目标进行训练,以“填充”屏蔽音频,让一个模型进行零样本语音克隆、噪声消除、内容编辑和多语言合成。这很重要,因为就像语音的语言模型一样,它可以概括许多从未明确训练过的任务。

Voicebox 针对哪些单一训练任务进行了优化?

Voicebox 经过训练,可以使用周围的音频和文本来填充语音的屏蔽部分,这是一种受语言模型启发的上下文表述。

Voicebox 使用哪种生成技术来代替扩散?

Voicebox 使用条件流匹配,学习将噪声传输为语音特征的速度场,并且可以使用 ODE 求解器高效求解。

Voicebox如何进行零样本语音克隆?

给定一个简短的参考剪辑作为未屏蔽的上下文,Voicebox 会合成与说话者的音色和风格相匹配的新句子,而无需重新训练。

为什么 Meta 最初保留完整的 Voicebox 模型?

由于该模型可以令人信服地克隆声音,Meta 推迟了它并强调了检测合成语音的研究。

一个模型如何处理 Voicebox 中的编辑、克隆和去噪?

所有能力都归结为相同的填充目标;改变推理时屏蔽的内容可以对一个模型进行编辑、克隆或噪声消除。