音频人工智能指南

扩散频谱图扩散

Riffusion 是一种巧妙的技巧,它通过将声音视为图片来生成音乐:它微调稳定扩散图像模型以绘制频谱图,然后将这些图像转换回音频。

阅读时间:2分钟最后更新

概述

It matters because it shows a tool built for one medium (images) can produce another (music) with almost no new architecture.

深入探讨

Riffusion 最初是一个业余爱好项目,由 Seth Forsgren 和 Hayk Martiros 于 2022 年底发布。核心技巧:频谱图是一个二维图像,其中水平轴是时间,垂直轴是频率,像素亮度是响度。由于稳定扩散已经根据文本提示生成图像,因此创建者在数千个配对的频谱图-文本示例上对其进行了微调。用“时髦爵士贝司”提示它,它会将随机噪音降噪成该声音的频谱图。为了制作可播放的音频,Riffusion 通过 Griffin-Lim 算法运行频谱图,重建丢失的相位信息。由于扩散可以在提示之间平滑插入,因此 Riffusion 还可以在连续剪辑中将一种风格转变为另一种风格,无缝循环。

技术洞察

Riffusion 未改变地重复使用潜在扩散管道:U-Net 迭代地从以 CLIP 文本嵌入为条件的潜在图像中去除高斯噪声。唯一的特定领域工作是频谱图表示(梅尔标度、对数功率)和 Griffin-Lim 相位重建,将预测的幅度频谱图转回波形。编码过程中相位被丢弃,因此 Griffin-Lim 的迭代估计是特征“水样”伪像的主要来源。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

扩散谱图扩散的未来

Riffusion 证明了频谱图作为图像的桥梁是有效的,这个想法现在存在于更大的音频系统中,并成为 Riffusion 公司。预计未来的工具将用学习神经声码器取代有损的 Griffin-Lim,以实现更清晰的相位,并将频谱图扩散与潜在音频编解码器相结合。更广泛的教训是,图像模型可以重定向到新的模式,继续影响研究人员如何从现有的预训练骨干网络引导音频和视频生成器。

现实世界的实施

根据“紧张的合成波追逐”等文本提示为独立视频游戏生成短循环背景曲目

在两种音乐风格之间平滑过渡,例如在单个剪辑中将“热带浩室音乐”与“低保真嘻哈音乐”融合在一起

为 YouTube 视频和播客制作免版税的环境音乐床,无需许可费

对旋律或节奏的想法进行原型设计,然后音乐家在数字音频工作站中正确地重新录制

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Riffusion Spectrogram Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

DiffWave 扩散声码器

常见问题

What is Riffusion Spectrogram Diffusion?

Riffusion 是一种巧妙的技巧,它通过将声音视为图片来生成音乐:它微调稳定扩散图像模型以绘制频谱图,然后将这些图像转换回音频。这很重要,因为它表明为一种媒体(图像)构建的工具可以产生另一种媒体(音乐),几乎不需要新的架构。

Riffusion 对现有的哪些人工智能模型进行了微调来生成音乐?

Riffusion 对稳定扩散(一种图像扩散模型)进行了微调,以生成频谱图图像,然后将其转换为音频。

频谱图的两个轴代表什么?

在频谱图中,横轴是时间,纵轴是频率,亮度代表响度。

为什么 Riffusion 需要像 Griffin-Lim 这样的算法?

频谱图存储幅度但丢弃相位,因此 Griffin-Lim 迭代估计相位以重建可播放波形。

当混合两个提示时,扩散给 Riffusion 带来什么能力?

扩散模型可以在潜在空间中进行插值,让 Riffusion 不断从一种音乐风格转变为另一种音乐风格。

Riffusion 最初是如何创建和发布的?

Riffusion 最初是 Seth Forsgren 和 Hayk Martiros 的一个业余爱好项目,于 2022 年底公开发布。