象征性音乐的产生
符号音乐生成将音乐创建为结构化记谱——音符、音调、持续时间和时间(通常为 MIDI)——而不是原始音频。
概述
It gives composers editable, instrument-agnostic output they can tweak note by note.
深入探讨
符号系统不是生成最终的波形,而是生成“乐谱”:具有音高、持续时间、力度和计时的音符序列,通常采用 MIDI 或钢琴卷帘形式。因为输出是符号性的,所以它是完全可编辑的——您可以更改单个音符、交换乐器、移调键或将其交给人类表演者。标志性项目包括 Google Magenta 的 MelodyRNN 和 MusicVAE、OpenAI 的 MuseNet (2019)(生成了多种风格的多乐器作品)以及 Anticipatory Music Transformer 作品。与 Suno 等原始音频工具相比,符号模型不能产生实际的声音或真实的声音;他们需要合成器或采样器才能被听到。但它们提供了精确性、可控性以及微小、快速的表示。
技术洞察
这些模型将音乐视为一种语言:音符(或音符事件,例如“音符开”、“音符关”、时移)成为标记,序列模型(历史上是 RNN/LSTM,现在通常是 Transformer)预测下一个事件。有些使用 VAE 来学习平滑的潜在空间,以便您可以在旋律之间进行插值。由于符号序列比原始波形短数千倍,因此这些模型的训练和生成速度比音频模型快得多,并且它们的输出可以在任何符号软件中直接编辑。
战略影响
交通与覆盖范围
它通过转录、旁白和语音界面提高了可访问性。
成本与预算
媒体团队可以用更少的预算更快地交付精美的音频。
速度与规模
面向客户的系统可以处理更大规模的语音交互。
象征音乐一代的未来
符号生成越来越多地与音频配对:Transformer 创作乐谱,然后由高质量的神经合成器或采样器进行渲染,将可编辑性与逼真的声音相结合。预计将更紧密地集成到 DAW 和记谱工具中,作为副驾驶,建议和声、填充编曲或按需继续旋律。随着控制的改进,音乐家可能会将符号人工智能视为交互式作曲伙伴,符号加音频管道弥合了与工作室质量输出的差距。
现实世界的实施
作曲家使用 Google Magenta 工具生成旋律或和声创意,然后在 DAW 中逐个音符进行编辑。
游戏工作室按程序生成 MIDI 背景音乐,适应游戏玩法并使用任何乐器组进行渲染。
音乐教育软件自动生成选定调和难度的练习题和伴奏。
制作人使用 MuseNet 风格的模型起草跨流派的多乐器编排,然后对其进行完善和重新编排。
风险与防护栏
如果未征得同意,语音滥用和冒充风险就会增加。
由于口音、方言或嘈杂的环境,准确性可能会下降。
如果没有明确的标签,合成音频可能会被误认为是真实的语音。
实施路线图
获得语音捕获、克隆和重用的明确同意。
测试不同扬声器和背景条件下的质量。
定义人员必须审查或批准输出的时间。
标记合成音频并保留来源记录以供问责。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Symbolic Music Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Symbolic Music Generation?
符号音乐生成将音乐创建为结构化记谱——音符、音调、持续时间和时间(通常为 MIDI)——而不是原始音频。它为作曲家提供了可编辑的、与乐器无关的输出,他们可以逐个音符地进行调整。
象征性音乐的产生实际上产生了什么?
符号系统输出“乐谱”——音调、持续时间和时间等音符事件——而不是实际的声音。
与原始音频生成相比,符号输出的主要优势是什么?
由于输出是符号符号,因此每个音符都是可编辑的,并且可以由人类转置、重新演奏或演奏。
以下哪一个是 OpenAI 中著名的符号音乐模型?
MuseNet(2019)生成了跨越多种音乐风格的多乐器符号作品。
现代符号模型通常如何通过计算处理音乐?
符号模型对音符事件(如音符开、音符关、时移)进行标记,并使用 Transformer 等序列模型来预测下一个事件。
为什么符号模型的训练和生成速度通常比原始音频模型更快?
符号序列比数百万个音频样本要紧凑得多,因此模型处理它的效率要高得多。