SoundStream 神经编解码器
SoundStream 是 Google 的端到端神经音频编解码器,可将语音和音乐压缩到极低的比特率,同时保持质量。
概述
It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.
深入探讨
SoundStream 由 Google 于 2021 年推出,是一种完全神经编解码器,由三个一起训练的部分构建:将原始波形转换为紧凑向量序列的卷积编码器、离散化这些向量的残差向量量化器 (RVQ) 以及重建波形的卷积解码器。它接受了重建损失和 GAN 式对抗鉴别器的训练,因此输出听起来很自然,而不仅仅是数字上接近。一个突出的功能是“可扩展”或量化器丢失训练:只需在推理时使用更多或更少的量化器层,单个模型就可以在大约 3 到 18 kbps 的比特率上运行,无需重新训练。据报道,在听力测试、处理语音、音乐和一般音频方面,它以 3 kbps 的速度优于 12 kbps 的 Opus,该模型可以在智能手机 CPU 上实时运行。
技术洞察
波形经过大量下采样的跨步卷积,每帧产生一个嵌入(例如 75 帧/秒)。然后,RVQ 将每个嵌入编码为码本索引堆栈。比特率等于帧速率乘以活动量化器的数量乘以每个码本的位数。量化器 dropout 在训练期间随机截断 RVQ 堆栈,迫使早期的码本携带最重要的信息,以便编解码器以较低的速率优雅地降级。
战略影响
交通与覆盖范围
它通过转录、旁白和语音界面提高了可访问性。
成本与预算
媒体团队可以用更少的预算更快地交付精美的音频。
速度与规模
面向客户的系统可以处理更大规模的语音交互。
SoundStream 神经编解码器的未来
SoundStream 建立了后来的编解码器(如 EnCodec 和 DAC)完善的模板,其离散令牌成为 AudioLM 和 MusicLM 等生成系统的基础。预计后代会推动更低的比特率、语义结构的令牌(可兼作语言模型式音频生成器的输入)以及针对带宽和延迟受到严格限制的实时通话、助听器和流媒体的更严格的设备上部署。
现实世界的实施
将语音通话压缩至约 3 kbps,同时在更高比特率下听起来比传统编解码器更清晰
生成离散音频令牌,为 Google 的 AudioLM 和 MusicLM 生成模型提供数据
通过 CPU 上编码和解码在移动设备上进行实时低带宽音频流传输
在处理所有内容类型的单一模型中高效存储或传输音乐和环境声音
风险与防护栏
如果未征得同意,语音滥用和冒充风险就会增加。
由于口音、方言或嘈杂的环境,准确性可能会下降。
如果没有明确的标签,合成音频可能会被误认为是真实的语音。
实施路线图
获得语音捕获、克隆和重用的明确同意。
测试不同扬声器和背景条件下的质量。
定义人员必须审查或批准输出的时间。
标记合成音频并保留来源记录以供问责。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SoundStream Neural Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is SoundStream Neural Codec?
SoundStream 是 Google 的端到端神经音频编解码器,可将语音和音乐压缩到极低的比特率,同时保持质量。这很重要,因为它在相同比特率下击败了 Opus 等传统编解码器,并为现代生成音频模型提供支持。
SoundStream 架构由哪三个组件组成?
SoundStream 由卷积编码器、离散化嵌入的残差矢量量化器和卷积解码器构建,所有这些都经过端到端训练。
什么技术可以让单个 SoundStream 模型在无需重新训练的情况下提供多种不同的比特率?
在训练期间,SoundStream 会随机丢弃量化器层,以便在推理时您可以使用更多或更少的 RVQ 级别来达到一个模型的不同比特率。
在 Google 的聆听测试中,据报告,3 kbps 的 SoundStream 性能优于 12 kbps 的哪种编解码器?
在主观质量评估中,仅 3 kbps 的 SoundStream 与以 12 kbps 运行的广泛使用的 Opus 编解码器相匹配或击败。
SoundStream 使用什么样的附加训练信号来使输出声音自然?
除了重建损失之外,SoundStream 还使用对抗性 (GAN) 判别器,因此重建听起来感觉上很真实,而不仅仅是数字上接近。
SoundStream 的比特率与其量化器有何关系?
比特率随着活动 RVQ 层的数量而变化(乘以帧速率乘以每个码本的位数),因此添加量化器可以提高比特率和质量。