自动音乐转录
自动音乐转录 (AMT) 将原始音乐录音转换为符号符号,例如乐谱、MIDI 或钢琴卷轴。
概述
It tackles one of the hardest problems in audio AI: untangling many overlapping notes played at once.
深入探讨
AMT 系统监听音频波形并输出正在演奏的音符、开始时间、持续时间以及有时由哪种乐器演奏。核心挑战是复调:当多个音符同时发声时,它们的谐波在频谱中重叠并模糊在一起,因此单个 C 和 G 很难与单个响亮的音符分开。现代系统将音频转换为时频表示,例如梅尔频谱图或恒定 Q 变换,然后使用深度神经网络来预测音符开始、偏移和音高。 Google 的 Onsets 和 Frames 模型是钢琴转录的里程碑,而 MT3 等较新的 Transformer 模型可以同时转录多种乐器。
技术洞察
一个关键的见解是将起始检测与帧级基音检测分开。像 Onsets 和 Frames 这样的模型使用一个网络头来确定音符开始的精确时刻(一个尖锐的、充满活力的事件),另一个网络头来跟踪每帧中发出的音高。然后,开始预测对帧输出进行门控,从而显着减少虚假音符。恒定 Q 变换很有帮助,因为它以对数方式间隔频率区间,匹配音高间隔八度的方式。
战略影响
交通与覆盖范围
它通过转录、旁白和语音界面提高了可访问性。
成本与预算
媒体团队可以用更少的预算更快地交付精美的音频。
速度与规模
面向客户的系统可以处理更大规模的语音交互。
自动音乐转录的未来
AMT 正在从钢琴独奏转向可靠的多乐器和全乐队转录,包括鼓、人声以及转音和颤音等表现技巧。在大型合成和对齐数据集上训练的 Transformer 架构正在缩小差距。期望与源分离、现场表演的实时转录以及捕获微计时和动态而不仅仅是音符的工具进行更紧密的集成。长期目标是建立一个将任何录音转换为可编辑、人类可读乐谱的系统。
现实世界的实施
AnthemScore 和类似应用程序将 MP3 录音转换为可编辑的乐谱,供音乐家通过耳朵学习歌曲
从钢琴录音中提取 MIDI,以便制作人可以在 DAW 中重新配音或量化演奏
音乐教育工具可将学生弹奏的音符与乐谱进行比较,以标记错误或遗漏的音符
音乐学家将历史或即兴录音(如爵士乐独奏)转录成符号进行分析
风险与防护栏
如果未征得同意,语音滥用和冒充风险就会增加。
由于口音、方言或嘈杂的环境,准确性可能会下降。
如果没有明确的标签,合成音频可能会被误认为是真实的语音。
实施路线图
获得语音捕获、克隆和重用的明确同意。
测试不同扬声器和背景条件下的质量。
定义人员必须审查或批准输出的时间。
标记合成音频并保留来源记录以供问责。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Automatic Music Transcription quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Automatic Music Transcription?
自动音乐转录 (AMT) 将原始音乐录音转换为符号符号,例如乐谱、MIDI 或钢琴卷轴。它解决了音频人工智能中最难的问题之一:理清同时播放的许多重叠音符。
自动音乐转录主要输出什么?
AMT 将音频录音转换为符号符号,例如 MIDI、钢琴卷轴或描述所演奏音符的乐谱。
为什么复调音乐特别难转录?
当多个音符同时响起时,它们的和声会重叠,因此很难区分存在哪些单独的音高。
Google 的起始和帧模型有什么值得注意的地方?
起始点和帧使用一个头来检测精确的音符起始点,另一个头用于检测持续的音高,起始点控制帧输出。
为什么恒定 Q 变换对音乐有用?
音乐音高以对数间隔(八度音阶频率加倍),CQT 的对数间隔箱自然与此对齐。
转录中的“起始”指什么?
开始是音符开始时尖锐、充满活力的时刻,它比其延音更容易精确定位。