音频人工智能指南

编码解码器音频压缩

EnCodec 是 Meta 的高保真神经音频编解码器,它以极低的比特率压缩语音和音乐,其质量可与更重的格式相媲美。

阅读时间:2分钟最后更新

概述

It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.

深入探讨

EnCodec 由 Meta AI 于 2022 年发布,遵循编码器、残差矢量量化器 (RVQ) 和端到端训练的解码器的 SoundStream 蓝图,但添加了一些改进。它使用具有流媒体功能的卷积编码器、多尺度频谱图和时域重建损失,以及用于感知质量的对抗性鉴别器。一个显着的贡献是一个基于 Transformer 的小型熵模型,它进一步无损地压缩量化代码,在不损失质量的情况下挤出额外的比特。 EnCodec 还引入了一个平衡器,可以自动缩放许多竞争训练损失,使它们保持稳定。它可处理 24 kHz 单声道和 48 kHz 立体声音频,可在 1.5、3、6 和 12 kbps 等比特率下运行,并且在 6 kbps 下可达到与 64 kbps 下的 MP3 相当的质量。其代币为 Meta 的 MusicGen 和 AudioGen 提供动力。

技术洞察

EnCodec 的编码器通过跨步卷积将波形下采样为潜在序列,RVQ 将其转换为堆叠码本索引。轻量级 Transformer 语言模型可以预测这些标记的概率并对它们进行算术编码,从而免费恢复进一步的压缩。训练平衡器重新调整重建、频谱和对抗性损失的梯度贡献,因此没有单一项占主导地位,这使多目标训练在整个比特率范围内保持稳定。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

EnCodec 音频压缩的未来

EnCodec 已经是多个开放生成音频模型的默认分词器,其后代正在以较低的比特率推动更高的保真度、完整的立体声和音乐级重建,以及与文本到音频和文本到音乐生成器的更紧密集成。预计将在低带宽通信、实时流媒体和标准“音频令牌”层中得到更广泛的采用,让大型语言模型风格的架构能够读取和写入声音。

现实世界的实施

为 Meta 的 MusicGen 和 AudioGen 文本到音频生成器标记音频

将 24 kHz 语音压缩至 1.5-6 kbps,以实现带宽有限的传输

以更高的比特率编码质量接近 MP3 的 48 kHz 立体声音乐

通过已发布的检查点充当研究和音频 ML 管道的开源嵌入式编解码器

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the EnCodec Audio Compression quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

音频嵌入和表示学习

常见问题

What is EnCodec Audio Compression?

EnCodec 是 Meta 的高保真神经音频编解码器,它以极低的比特率压缩语音和音乐,其质量可与更重的格式相媲美。这很重要,因为它支撑着现代生成音频系统,并以开源形式提供给任何人使用。

EnCodec是哪个组织发布的?

EnCodec 由 Meta AI (FAIR) 于 2022 年推出,作为高保真神经音频编解码器。

EnCodec 添加了哪些额外组件来无损地从其令牌中压缩更多压缩?

EnCodec 训练一个小型 Transformer 来预测令牌概率并对它们进行算术编码,从而在 RVQ 之上实现额外的无损压缩。

据报道,在大约 6 kbps 的情况下,EnCodec 的质量与比特率大约为多少的 MP3 相当?

6 kbps 的 EnCodec 达到的主观质量与 64 kbps 的 MP3 类似,效率大幅提升。

EnCodec的“平衡器”在训练过程中解决什么问题?

由于存在许多损失(重建、光谱、对抗性),平衡器会重新调整梯度,因此没有单一目标占主导地位,从而稳定了训练。

EnCodec 与 SoundStream 共享哪种核心量化方法?

与 SoundStream 一样,EnCodec 使用残差矢量量化将编码器嵌入离散化为堆叠码本索引。