音频人工智能指南

使用变形金刚进行音乐标记

音乐标签使用 Transformer 模型来聆听歌曲并预测描述性标签,例如流派、情绪、乐器和节奏。

阅读时间:2分钟最后更新

概述

它支持跨庞大音乐目录的搜索、推荐和自动组织。

深入探讨

音乐自动标记是一个多标签分类问题:一首曲目可以同时是“摇滚”、“活力”、“吉他”和“器乐”。 Transformer 通过将音频转换为频谱图(时频图像)并通过自注意力层提供它的补丁来解决这个问题,就像 Vision Transformer 处理图像补丁一样。音频频谱图转换器 (AST) 和 MERT 等模型可以学习整个音轨的长范围模式,捕捉合唱与相隔几分钟的主歌之间的关系。许多都是在数百万个未标记的剪辑上进行自我监督预训练,然后在 MagnaTagATune 或百万歌曲数据集等标记数据集上进行微调。由于标签并不相互排斥,因此最后一层使用 sigmoid 输出,根据平均精度和 ROC-AUC 等基准进行评分。

技术洞察

原始音频被转换为 log-Mel 频谱图,分成重叠的块,并线性嵌入位置编码。自注意力让每个补丁都权衡其他补丁,因此遥远的音乐事件会影响每个标签。与单标签图像分类器不同,音乐标签对每个标签应用一个 sigmoid,而不是一个 softmax,因为标签同时出现。自监督预训练(预测屏蔽音频标记)在对较小的标记集进行微调之前提供了强有力的表示。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

变形金刚音乐标签的未来

标签与自然语言理解相结合,因此您可以搜索“带有乙烯基爆裂声的梦幻低保真音乐用于学习”,而不是固定的流派按钮。 CLAP 等对比音频文本模型将音乐和描述集中在一个空间中,从而实现训练中从未见过的零样本标签。期待更丰富、更精细的标签、更好地处理融合类型以及设备上的隐私标记。围绕受版权目录培训的权利和归属辩论将决定这些模型可以使用哪些数据。

现实世界的实施

自动生成流派和情绪标签,以便流媒体服务可以构建“焦点”或“锻炼”播放列表

让音乐库为搜索同步许可的视频编辑者提供“欢快的原声吉他”曲目

为推荐引擎提供动力,以找到超出用户明确评分范围的声音相似歌曲

通过检测到的乐器、调性和速度自动组织制作人的样本集合

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Music Tagging with Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

音乐自动标记

常见问题

什么是变形金刚音乐标签?

音乐标签使用 Transformer 模型来聆听歌曲并预测描述性标签,例如流派、情绪、乐器和节奏。它支持跨庞大音乐目录的搜索、推荐和自动组织。

为什么音乐标签被视为多标签问题?

一首歌可以同时是摇滚、充满活力和吉他驱动的,因此多个标签适用于一首曲目。

变压器标注器通常使用什么输入表示?

音频被转换为时频频谱图,然后像图像补丁一样通过自注意力进行补丁和馈送。

为什么音乐标签模型对每个标签使用 sigmoid 输出而不是一个 softmax?

Softmax 强制概率总和为 1(单选); sigmoid 让每个标签独立为真。

自监督预训练对于 MERT 等模型有何作用?

在大型未标记语料库上对屏蔽音频预测进行预训练,构建随后在标记数据上进行微调的表示。

哪个数据集通常用于微调和基准音乐标记器?

MagnaTagATune 和百万歌曲数据集是标准标记音乐基准; MNIST 和 ImageNet 是图像集。