音频人工智能指南

音乐自动标记

音乐自动标记使用机器学习来听歌曲并自动附加描述性标签,例如流派、情绪、乐器和节奏。

阅读时间:2分钟最后更新

概述

It powers the search, recommendation, and organization features behind every major streaming service.

深入探讨

音乐自动标记将标签视为多标签分类问题:单个曲目可以同时是“摇滚”、“活力”和“吉他驱动”。现代系统将原始音频转换为梅尔频谱图(声音的时频图像),并通过在 MagnaTagATune、百万歌曲数据集或 MTG-Jamendo 等数据集上训练的卷积或基于变压器的神经网络提供数据。该模型输出每个可能标签的概率。由于人类应用的标签存在噪音且不完整,因此训练具有挑战性,并且标签不平衡。相同的主干越来越多地来自自我监督的音频模型,因此单个表示可以提供标签、推荐和相似性搜索,而不是为每个标签构建单独的模型。

技术洞察

音频被分成短的重叠帧,通过短时傅里叶变换进行转换,并映射到模仿人类音高感知的梅尔音阶上。 CNN 像读取图像一样读取该频谱图,学习谐波模式、节奏和音色的滤波器。最后一层使用 sigmoid 激活(不是 softmax),因为标签是独立且非排他性的,并且通过跨数百个可能标签的二进制交叉熵进行了优化。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

音乐自动标记的未来

自动标记正在转向基于 CLAP 等音频语言模型构建的开放词汇、文本可查询系统,用户可以在没有预定义标签的情况下搜索“用于学习的梦幻合成音轨”。期望与生成音乐工具更紧密地结合,更好地处理稀有流派和非西方音乐,以及设备上的隐私标记。下一个前沿领域是编写曲目的完整自然语言描述而不是离散标签的字幕模型。

现实世界的实施

Spotify 和类似服务为新上传的内容添加流派和情绪标签,以支持“每周发现”风格推荐

制作音乐库让视频编辑者可以通过“振奋人心的企业”或“紧张的电影”来过滤数百万个库存曲目

DJ 软件自动检测 BPM、调和能量,因此可以自动对曲目进行排序和节拍匹配

音乐授权平台标记乐器和情绪,将歌曲与广告简介相匹配

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Music Auto-Tagging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

使用变形金刚进行音乐标记

常见问题

What is Music Auto-Tagging?

音乐自动标记使用机器学习来听歌曲并自动附加描述性标签,例如流派、情绪、乐器和节奏。它为每个主要流媒体服务背后的搜索、推荐和组织功能提供支持。

为什么音乐自动标记在其输出层中使用 sigmoid 激活而不是 softmax?

自动标记是多标签的:一首曲目可以同时是“摇滚”、“活力”和“吉他”,因此每个标签需要通过 sigmoid 拥有自己的独立概率。

大多数现代自动标记模型将什么输入表示输入到其神经网络中?

音频通常会转换为梅尔频谱图,这是一种时频图像,CNN 可以像处理照片一样处理它。

为什么使用梅尔标度而不是简单的线性频率标度?

梅尔音阶间隔频率以匹配人类的音调感知,为我们耳朵最关心的较低频率提供更高的分辨率。

在现实数据集上训练自动标记模型时的主要挑战是什么?

众包标签不一致,许多有效标签完全丢失,并且某些标签出现的频率远高于其他标签,这使得学习变得更加困难。

哪个数据集通常用于训练和基准音乐自动标记系统?

MagnaTagATune 以及百万歌曲数据集和 MTG-Jamendo 是音乐标签的标准基准。 ImageNet 用于图像,SQuAD 用于文本 QA,LibriSpeech 用于语音。