音频人工智能指南

分裂茎分离

Spleeter 是 Deezer 的一款开源工具,它使用深度学习将完成的歌曲分割成单独的曲目(人声、鼓、贝斯等)。

阅读时间:2分钟最后更新

概述

It made high-quality stem separation fast, free, and accessible to anyone with a laptop.

深入探讨

Spleeter 于 2019 年由音乐流媒体公司 Deezer 发布,将混合录音分离为单独的乐器主干。它提供三种预先训练的配置:2-stem(人声加伴奏)、4-stem(人声、鼓、贝斯等)和 5-stem(添加钢琴)。在底层,它使用 U-Net 卷积神经网络对音频频谱图进行操作,预测每个源的软掩码。将掩模乘以原始频谱图并反转回音频产生每个主干。 Spleeter 之所以出名,是因为速度:它分离音频的速度比 GPU 上实时分离的速度快大约 100 倍。它被 DJ、混音师、转录者和卡拉 OK 制作者广泛使用,并引发了 Demucs 等竞争分离器的浪潮。

技术洞察

Spleeter 在时频域中工作。音频通过短时傅立叶变换 (STFT) 转换为幅度谱图。 U-Net(具有跳跃连接的编码器-解码器)针对每个源学习每个时频仓的 0 到 1 之间的掩码。掩蔽频谱图与原始混合物的相位重新组合,然后逆 STFT 重建波形。因为它估计的是软掩模而不是原始音频,所以泄漏和重复使用的相位会导致伪影。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

Spleeter 茎分离的未来

较新的波形域模型(例如 Demucs 和混合变压器分离器)现在在质量上击败了 Spleeter,恢复了更清晰的瞬态和更少的伪影。趋势是更高的主干数量(分离单独的吉他或和声)、DAW 和手机中的实时设备分离,以及集成到流媒体应用程序中以进行即时混音或访问。 Spleeter 本身仍然是一个流行的基线,因为它轻量级、免费且易于运行,即使研究推动了阶段感知和生成方法。

现实世界的实施

通过删除商业歌曲中的主唱来创建即时卡拉 OK 曲目

DJ 和制作人隔离鼓或贝司以构建混音和混搭

音乐学生提取单个乐器线进行转录和练习

通过分离和重新平衡浑浊的混音来恢复或清理旧录音

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spleeter Stem Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

Conv-TasNet 时域分离

常见问题

What is Spleeter Stem Separation?

Spleeter 是 Deezer 的一款开源工具,它使用深度学习将完成的歌曲分割成单独的曲目(人声、鼓、贝斯等)。它使高质量的茎分离变得快速、免费,并且任何拥有笔记本电脑的人都可以使用。

Spleeter 最初是哪家公司发布的?

Spleeter 于 2019 年由法国音乐流媒体公司 Deezer 开源发布。

Spleeter 的 4 干模型将音频分离成什么?

4 根配置输出人声、鼓、贝司和用于其他所有内容的“其他”根。

Spleeter 使用什么神经网络架构?

Spleeter 使用 U-Net 卷积网络来预测音频频谱图上的掩模。

Spleeter 实际上是如何从混合物中提取单一来源的?

网络预测与混合频谱图相乘的每个源掩码(值 0 到 1)。

Spleeter 受欢迎的关键实际优势是什么?

Spleeter 在 GPU 上分离音频的速度比实时速度快约 100 倍,使其快速且易于访问。