音频人工智能指南

MelGAN 生成声码器

MelGAN 是一种基于 GAN 的全卷积声码器,可在单次快速前向传递中将梅尔声谱图转换为原始音频波形。

阅读时间:2分钟最后更新

概述

It mattered because it proved high-quality, non-autoregressive speech synthesis could run hundreds of times faster than real time on a GPU.

深入探讨

MelGAN,由 Kumar 等人提出。 2019 年,无需使用 WaveNet 使用的缓慢的逐样本循环即可生成音频。它的生成器是一堆转置卷积,可将梅尔频谱图(通常为 80 个频带)上采样到音频采样率,并使用扩张卷积来拓宽感受野的残差块。关键的创新是使用在不同音频尺度(原始波形加上下采样版本)运行的多个鉴别器进行训练,每个鉴别器都查看重叠的窗口。特征匹配损失会比较真实和虚假音频之间的鉴别器激活,从而稳定 GAN 训练。按照神经音频标准,该模型很小,即使在 CPU 上运行也比实时运行速度更快,这使其适用于嵌入式和设备上的文本转语音。

技术洞察

MelGAN 的多尺度鉴别器使用三个相同的网络以全分辨率、半分辨率和四分之一分辨率查看音频,每个网络捕获不同频率范围的结构。至关重要的是,MelGAN 依赖于特征匹配损失(真实音频与生成音频的鉴别器特征图之间的 L1 距离)而不是显式频谱图重建损失,这鼓励生成器逐层匹配真实音频的统计数据。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

MelGAN 生成声码器的未来

MelGAN 培育了一系列 GAN 声码器。它的后继者 HiFi-GAN 和 UnivNet 保留了快速非自回归方法,但添加了多周期和多分辨率鉴别器以实现更清晰的高频。该架构继续存在于设备上和流式 TTS 中,其中延迟和模型大小很重要,其鉴别器思想继续影响神经编解码器和音乐生成系统,在这些系统中,对抗性训练可以提高感知质量。

现实世界的实施

移动助手中的设备上文本转语音,其中小型、快速的声码器避免了云往返

实时语音转换管道,将说话者的梅尔频谱图转换为目标语音

游戏和动画工具,可从生成的频谱图中以低延迟合成角色对话

音频 GAN 的研究基线,其中 MelGAN 的特征匹配损失被重新用于音乐和音效生成

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MelGAN Generative Vocoder quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

DiffWave 扩散声码器

常见问题

What is MelGAN Generative Vocoder?

MelGAN 是一种基于 GAN 的全卷积声码器,可在单次快速前向传递中将梅尔声谱图转换为原始音频波形。这很重要,因为它证明了高质量、非自回归语音合成的运行速度比 GPU 上的实时运行速度快数百倍。

MelGAN 将什么输入转换为原始音频波形?

MelGAN 是一个声码器:它采用声学特征表示(梅尔频谱图),并合成相应的波形。

为什么 MelGAN 的推理速度比 WaveNet 快得多?

WaveNet 以自回归方式一次生成一个样本; MelGAN 的卷积生成器在单个并行前向传递中生成整个波形。

MelGAN 引入了哪些独特的判别器设计?

MelGAN 使用多个相同的鉴别器来检查原始波形和下采样版本,以捕获不同尺度的结构。

哪种损失有助于稳定 MelGAN 的对抗训练?

特征匹配损失最小化了真实音频和生成音频的鉴别器特征图之间的 L1 距离,从而指导生成器并稳定训练。

MelGAN 的生成器如何增加其感受野?

具有扩张卷积的残差块有效地拓宽了感受野,让生成器能够模拟长程时间结构。