音频人工智能指南

自然语音和潜在扩散 TTS

NaturalSpeech 是 Microsoft TTS 研究的一个系列,旨在实现人类水平的语音质量,后续版本使用潜在扩散来生成丰富、自然的声音。

阅读时间:2分钟最后更新

概述

It shows how diffusion models, famous for images, can produce expressive, controllable audio.

深入探讨

最初的 NaturalSpeech (2022) 是第一个在 LJSpeech 基准上达到人类水平质量的系统,由无法可靠地区分真实录音的听众来判断。它使用具有仔细匹配先验的变分自动编码器来缩小训练和推理之间的差距。 NaturalSpeech 2 然后采用了潜在扩散方法:神经音频编解码器将语音编码为连续的潜在向量,扩散模型学习从文本生成这些潜在向量,从而能够从简短的提示中实现强大的零样本语音克隆。 NaturalSpeech 3 引入了分解扩散,将语音分离为内容、韵律、音色和声学细节等解开的属性,因此每个属性都可以独立建模和控制,以获得更高的保真度和灵活性。

技术洞察

潜在扩散的工作原理是向紧凑的潜在语音表示添加噪声,并训练网络逐步逆转该噪声。 NaturalSpeech 2 不是对原始波形或完整频谱图进行去噪,而是对编解码器潜伏进行去噪,这些潜伏维度较低且更易于建模。以文本和参考语音提示为条件来引导反向扩散,因此最终采样的潜伏解码为与请求的内容和说话者身份相匹配的语音。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

自然语音和潜在扩散 TTS 的未来

基于扩散和分解的 TTS 指向的声音不仅自然而且可精细控制,让用户可以像独立的旋钮一样调整音色、情感和韵律。期望通过蒸馏和几步扩散实现更快的采样,从几秒钟的音频中进行更强大的零样本克隆,以及与大型语言模型更紧密的集成以实现上下文感知交付。这些进步还加剧了对水印和同意保护措施的需求,因为高保真克隆会带来明显的滥用风险。

现实世界的实施

配音工作室使用 NaturalSpeech 2 式零镜头克隆技术,从简短样本中克隆演员的声音,以对电影进行本地化。

有声读物平台生成人类水平的叙述,听众很难将其与真正的配音人才区分开来。

辅助工具可以为失语者从旧录音中重新创建一个人自己的声音。

内容创建套件让编辑人员能够利用 NaturalSpeech 3 的分解属性独立调整音色和韵律。

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the NaturalSpeech and Latent Diffusion TTS quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

稳定的音频潜在扩散

常见问题

What is NaturalSpeech and Latent Diffusion TTS?

NaturalSpeech 是 Microsoft TTS 研究的一个系列,旨在实现人类水平的语音质量,后续版本使用潜在扩散来生成丰富、自然的声音。它展示了以图像闻名的扩散模型如何产生富有表现力的、可控的音频。

据报道,最初的 NaturalSpeech (2022) 实现了哪些里程碑?

据报道,NaturalSpeech 是 LJSpeech 上第一个达到人类水平质量的系统,但听众无法可靠地将其与真实语音区分开来。

NaturalSpeech 2 的潜在扩散模型实际上生成了什么?

NaturalSpeech 2 扩散编解码器潜伏,这些潜伏比原始波形更紧凑且更容易建模,然后将其解码为音频。

扩散模型如何生成高水平的数据?

扩散在训练过程中增加噪声,并学习将其逆转,通过逐步从随机噪声中去噪来生成样本。

潜在扩散为 NaturalSpeech 2 提供了哪些关键功能?

通过调节简短的语音提示,NaturalSpeech 2 可以克隆从未接受过明确训练的说话者的声音。

NaturalSpeech 3 的“分解扩散”的中心思想是什么?

分解扩散可以解开内容、韵律、音色和声学细节,因此每个属性都可以单独建模和控制。