音频人工智能指南

神经声码器

神经声码器是一种将紧凑的声学表示(通常是梅尔频谱图)转换为实际可听波形的模型。

阅读时间:2分钟最后更新

概述

It is the final stage that gives modern text-to-speech and voice cloning their natural, human sound.

深入探讨

传统的语音合成使用信号处理声码器,通常听起来很嗡嗡作响或机械化。神经声码器通过对数小时的真实录音进行训练,学习从声谱图中重建原始音频样本。 WaveNet(DeepMind,2016)是一项突破,它以每秒 16,000 多个样本的速度一次预测一个样本,产生极其自然的语音,但速度非常慢。后来的模型用自回归瓶颈换取了速度:WaveGlow 使用基于流的生成,Parallel WaveGAN 和 MelGAN 使用生成对抗网络,HiFi-GAN 通过生成远快于实时的高保真 22kHz 音频而成为流行标准。如今,声码器几乎总是两级管道的后半部分,与生成梅尔频谱图的 Tacotron 2 或 FastSpeech 等声学模型配对。

技术洞察

梅尔频谱图丢弃了音频的相位信息,仅保留能量随时间在频段上的分布情况。声码器的艰巨任务是发明一种可信的、连贯的波形,其幅度谱与输入相匹配。基于 GAN 的声码器(例如 HiFi-GAN)使用多个鉴别器来检查不同尺度和周期的信号,推动发生器产生逼真的精细细节,例如谐波和辅音的尖锐瞬态。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

神经声码器的未来

声码器变得越来越小、速度越来越快,因此它们可以在手机和嵌入式设备上运行,而无需云连接。人们还正在推动通用声码器的发展,这种声码器可以推广到任何说话者、语言、歌唱,甚至非语音,而无需重新训练。并行趋势将声码器直接折叠到端到端系统和神经编解码器中,模糊了单独的声学阶段和波形阶段之间的界限,并减少了通过中间频谱图引入的伪影。

现实世界的实施

在屏幕阅读器和导航应用程序等文本转语音助手中生成最终的语音音频

在配音和有声读物旁白工具中生成听起来自然的克隆声音

在人工智能音乐和虚拟歌手软件中重建歌声

为智能扬声器和辅助设备提供设备上语音输出,无需服务器往返

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Neural Vocoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

HiFi-GAN 和 GAN 声码器

常见问题

What is Neural Vocoders?

神经声码器是一种将紧凑的声学表示(通常是梅尔频谱图)转换为实际可听波形的模型。这是最后阶段,提供现代文本到语音和语音克隆其自然的人类声音。

神经声码器的主要工作是什么?

神经声码器采用紧凑的声学特征(通常是梅尔频谱图),并合成您听到的实际原始音频波形。

2016 年哪个模型是使神经声码器听起来更自然的突破?

DeepMind 于 2016 年推出的 WaveNet 逐个样本生成音频,并产生极其自然的语音,开启了神经声码器时代。

为什么最初的 WaveNet 生成音频很慢?

WaveNet 是自回归的:每个音频样本都依赖于之前的样本,因此每秒生成数万个样本的计算成本很高。

梅尔频谱图明显丢弃了哪些信息,使声码器的任务变得更加困难?

梅尔频谱图保留幅度(每个频带的能量)但降低相位,因此声码器必须重建相位合理的相干波形。

HiFi-GAN 等基于 GAN 的声码器如何提高真实感?

HiFi-GAN 使用多个鉴别器来检查不同的时间尺度和周期,推动发生器产生真实的谐波和瞬态。