SoundStorm 并行音频生成
SoundStorm 是一种 Google 音频生成模型,它并行生成语音和声音,而不是一次生成一个令牌,从而使高质量音频合成速度显着加快。
概述
It matters because it cuts generation latency for long clips from minutes to seconds without sacrificing fidelity.
深入探讨
SoundStorm 由 Google 于 2023 年推出,可从名为 SoundStream 的神经编解码器生成表示为离散声学标记的音频。 AudioLM 等早期模型以自回归方式生成这些标记,按顺序预测每个标记,这对于长音频来说很慢。相反,SoundStorm 使用借鉴自 MaskGIT 等图像生成模型的非自回归、基于掩模的方法。它从大部分被屏蔽的标记开始,并通过几个解码步骤迭代地填充它们,同时并行预测许多标记。以语义标记(来自 AudioLM 或 SPEAR-TTS 等模型)为条件,它可以在 TPU 上大约半秒内合成 30 秒的自然对话,比自回归基线快大约 100 倍,同时匹配其质量和说话者一致性。
技术洞察
SoundStorm 对 SoundStream 中的残差矢量量化 (RVQ) 级别的层次结构进行建模。在训练过程中,随机标记被屏蔽,模型学习预测它们。在推理时,它运行基于置信度的并行解码:在每次迭代中,它预测所有屏蔽标记,保留最置信的标记,并重新屏蔽其余标记。它首先解码粗略的 RVQ 级别,然后解码更精细的 RVQ 级别,以比逐个令牌生成少得多的步骤实现完整音频。
战略影响
交通与覆盖范围
它通过转录、旁白和语音界面提高了可访问性。
成本与预算
媒体团队可以用更少的预算更快地交付精美的音频。
速度与规模
面向客户的系统可以处理更大规模的语音交互。
SoundStorm 并行音频生成的未来
基于并行掩码的解码正在成为快速、可控音频的标准工具。期望它能够为实时对话代理、即时语音合成以及长篇播客或有声读物生成提供支持,而延迟曾经使自回归模型变得不切实际。将其与更强的语义调节和水印相结合将提高对话的真实性和可追溯性。相同的迭代细化思想可能会与扩散方法合并,从而模糊编解码器令牌和连续音频生成器之间的界限。
现实世界的实施
在不到一秒的时间内为 AI 语音助手生成 30 秒的语音对话
合成具有一致说话者声音的多轮对话以进行原型设计
在自回归模型滞后的交互式代理中支持低延迟文本到语音
通过并行填充声学标记快速生成长格式叙述音频
风险与防护栏
如果未征得同意,语音滥用和冒充风险就会增加。
由于口音、方言或嘈杂的环境,准确性可能会下降。
如果没有明确的标签,合成音频可能会被误认为是真实的语音。
实施路线图
获得语音捕获、克隆和重用的明确同意。
测试不同扬声器和背景条件下的质量。
定义人员必须审查或批准输出的时间。
标记合成音频并保留来源记录以供问责。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SoundStorm Parallel Audio Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is SoundStorm Parallel Audio Generation?
SoundStorm 是一种 Google 音频生成模型,它并行生成语音和声音,而不是一次生成一个令牌,从而使高质量音频合成速度显着加快。这很重要,因为它可以将长剪辑的生成延迟从几分钟缩短到几秒钟,而不会牺牲保真度。
使 SoundStorm 比 AudioLM 更快的关键创新是什么?
SoundStorm 用非自回归并行解码取代了缓慢的自回归、逐个令牌生成,可同时预测许多令牌。
SoundStorm 采用哪种图像生成技术?
SoundStorm 借鉴了 MaskGIT 在图像合成中流行的基于置信度的掩模和填充解码策略。
SoundStorm 生成什么样的表示形式?
SoundStorm 预测由 SoundStream 编解码器生成的离散声学标记,随后将其解码为波形。
SoundStorm 在 TPU 上生成 30 秒的音频大约需要多长时间?
SoundStorm 可以在大约 0.5 秒内合成 30 秒的音频,比自回归基线快约 100 倍。
SoundStorm 如何决定在解码期间保留哪些预测令牌?
在每次迭代中,它都会保留其最高置信度的令牌预测,并为下一次重新屏蔽不确定的令牌预测。