稳定的音频潜在扩散
Stable Audio 是 Stability AI 的文本转音频系统,它使用潜在扩散来生成音乐和声音效果,并明确控制剪辑长度。
概述
It matters because it brought diffusion-based, timing-aware, commercially licensed audio generation to creators.
深入探讨
Stable Audio 由 Stability AI 于 2023 年推出,使用潜在扩散技术从文本提示生成立体声音乐和声音效果,这与稳定扩散等图像模型背后的技术属于同一系列。它不是对图像像素进行去噪,而是对由变分自动编码器创建的音频的压缩潜在表示进行去噪。一个显着的功能是定时调节:模型在训练期间得到开始和总持续时间信号,因此用户可以请求特定长度的剪辑,包括带有前奏和结尾的完整长度的音乐结构。 Stable Audio 2.0 于 2024 年发布,可以以 44.1 kHz 立体声生成长达约三分钟的连贯曲目,并支持音频到音频的转换。它接受了许可音乐的培训以支持商业用途。
技术洞察
该系统由三个部分组成:将 44.1 kHz 立体声音频编码为紧凑潜在序列的 VAE、嵌入提示的文本编码器(CLAP 式或基于 T5 的模型)以及学习反转潜在空间中的噪声过程的扩散变换器(或 U-Net)。定时嵌入条件在所需的开始和持续时间上生成。在推理时,模型对文本引导的随机潜在噪声进行去噪,然后 VAE 解码器重建波形。
战略影响
交通与覆盖范围
它通过转录、旁白和语音界面提高了可访问性。
成本与预算
媒体团队可以用更少的预算更快地交付精美的音频。
速度与规模
面向客户的系统可以处理更大规模的语音交互。
稳定音频潜在扩散的未来
音频的潜在扩散正在朝着更长、更结构化的作品、更精细的干级和乐器控制以及通过蒸馏更快的采样的方向发展。预计将更紧密地集成到音乐制作软件、实时生成以及围绕培训数据许可和艺术家同意的道德工具中。随着时间和调节的改进,创作者将更精确地指导编排、节奏和过渡,音频到音频编辑将允许用户在保留节奏或风格的同时转换现有录音。
现实世界的实施
为视频和广告生成精确长度的免版税背景音乐
根据文本描述创建可循环播放的游戏和应用程序配乐
为播客和预告片制作定制音效和声音
通过音频到音频提示将现有音频剪辑转换为新风格
风险与防护栏
如果未征得同意,语音滥用和冒充风险就会增加。
由于口音、方言或嘈杂的环境,准确性可能会下降。
如果没有明确的标签,合成音频可能会被误认为是真实的语音。
实施路线图
获得语音捕获、克隆和重用的明确同意。
测试不同扬声器和背景条件下的质量。
定义人员必须审查或批准输出的时间。
标记合成音频并保留来源记录以供问责。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Stable Audio Latent Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Stable Audio Latent Diffusion?
Stable Audio 是 Stability AI 的文本转音频系统,它使用潜在扩散来生成音乐和声音效果,并明确控制剪辑长度。这很重要,因为它为创作者带来了基于扩散的、定时感知的、商业许可的音频生成。
Stable Audio 使用什么核心技术来生成音频?
稳定音频应用潜在扩散,对音频的压缩潜在表示而不是原始像素或样本进行降噪。
Stable Audio 提供了哪些许多早期型号所缺乏的独特控制功能?
定时调节允许用户请求特定长度的音频,从而实现具有适当前奏和后奏的完整曲目。
什么组件将原始音频压缩为潜在表示?
VAE 将 44.1 kHz 立体声音频编码为紧凑的潜在序列,然后将其解码回波形。
2024 年稳定音频 2.0 增加了哪些新功能?
Stable Audio 2.0 将完整曲目的长度延长至大约三分钟,并引入了音频到音频的转换。
那么Stable Audio是如何开始生成过程的呢?
扩散从潜在空间中的随机噪声开始,并根据文本调节对其进行迭代降噪。