音频人工智能指南

HiFi-GAN 和 GAN 声码器

HiFi-GAN 是一种生成对抗式声码器,它几乎可以立即将梅尔频谱图转换为原始音频波形,从而以比实时快得多的速度生成录音室质量的语音。

阅读时间:2分钟最后更新

概述

It became the standard final stage of modern text-to-speech because it is fast, lightweight, and hard to distinguish from real recordings.

深入探讨

声码器是大多数 TTS 管道中的最后一步:像 Tacotron 或 FastSpeech 这样的模型会预测梅尔频谱图(随时间变化的频率的紧凑图片),而声码器会填充实际的波形样本。像 WaveNet 这样的早期神经声码器听起来很棒,但是逐个样本地生成音频,这使得它们非常慢。 Kong、Kim 和 Bae 于 2020 年发布的 HiFi-GAN 用经过对抗性训练的单个前馈生成器取代了自回归循环。它的关键技巧是使用多个鉴别器来判断不同尺度和不同周期模式的音频,迫使生成器获得正确的精细纹理和音调周期性。结果是 22 kHz 语音合成速度比 GPU 上的实时合成速度快数百倍,其质量可与地面真实音频相媲美。

技术洞察

HiFi-GAN 的生成器通过转置卷积对梅尔频谱图进行上采样,并使用堆叠的多感受野块混合不同的内核大小和膨胀以捕获不同的波形。两个鉴别器系列负责监管:多周期鉴别器将 1D 信号重塑为 2、3、5、7、11 等素数处的 2D 网格,以捕获音调周期性,多尺度鉴别器以多个下采样分辨率检查波形。梅尔谱图和特征匹配损失使训练保持稳定。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

HiFi-GAN 和 GAN 声码器的未来

GAN 声码器变得越来越小、越来越快:像 BigVGAN 这样的后代添加了抗锯齿激活,以泛化未知的歌手、乐器和语言,而 UnivNet 和 Vocos 则推动通用的全频段合成。流媒体和设备上的变体现在可以在手机和耳塞内运行声码,以实现低延迟助手。扩散和流量匹配音频模型越来越多地被提炼成 GAN 式的单通道生成器,将扩散的保真度与 GAN 的速度融合在一起。预计声码器将逐渐成为为语音和音乐提供支持的通用神经音频编解码器。

现实世界的实施

生成需要无声延迟响应的虚拟助手和导航应用程序的语音输出。

为实时语音克隆和配音工具提供支持,将克隆的梅尔频谱图渲染成听起来自然的音频。

推动有声读物和播客旁白平台,快速、廉价地合成数小时的语音。

通过 BigVGAN 风格的通用声码器充当歌声合成器和音乐演示中的波形阶段。

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the HiFi-GAN and GAN Vocoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

并行 WaveGAN 声码器

常见问题

What is HiFi-GAN and GAN Vocoders?

HiFi-GAN 是一种生成对抗式声码器,它几乎可以立即将梅尔频谱图转换为原始音频波形,从而以比实时快得多的速度生成录音室质量的语音。它成为现代文本转语音的标准最后阶段,因为它快速、轻量级且难以与真实录音区分开来。

像 HiFi-GAN 这样的声码器在文本转语音管道中的主要工作是什么?

声码器是从声学模型生成的梅尔频谱图中合成实际波形样本的最后阶段。

为什么 HiFi-GAN 比早期的 WaveNet 声码器快得多?

WaveNet 逐个样本(自回归)生成音频,而 HiFi-GAN 的前馈发生器一次性输出波形,实现远快于实时的速度。

HiFi-GAN 的多周期鉴别器具体帮助捕获什么?

多周期鉴别器使用素数周期将一维波形重塑为二维波形,以检测与音调相关的周期结构。

GAN 声码器经过“对抗性”训练。这是什么意思?

在 GAN 设置中,生成器学习生成足够真实的波形,以欺骗经过训练以区分真实音频和合成音频的鉴别器网络。

后来哪一个声码器扩展了 HiFi-GAN,以更好地泛化看不见的声音、歌唱和乐器?

BigVGAN 扩展了 HiFi-GAN 并添加了抗锯齿周期性激活,从而提高了对歌声和乐器等非分布音频的泛化。