音频人工智能指南

MusicLM:分层语义和声学标记

MusicLM 是 Google 的文本到音乐模型,它通过音乐结构的语义标记和声音细节的声学标记的层次结构生成长格式音频。

阅读时间:2分钟最后更新

深入探讨

MusicLM 由 Google Research 于 2023 年初宣布,将音乐生成构建为预测离散音频标记序列,就像语言模型预测单词一样。它使用表示层次结构:语义标记(来自名为 w2v-BERT 的模型)捕获长跨度内的高级结构,如旋律和节奏,而声学标记(来自 SoundStream 神经编解码器)捕获精细细节,如音色和纹理。第一阶段根据文本提示生成语义标记,然后后续阶段根据这些语义填充声音细节。文本调节来自 MuLM/MuLan,这是一种经过联合训练的音乐文本嵌入,因此描述和音频位于同一空间。这种分阶段的方法让 MusicLM 在几分钟内保持音乐一致性,而不是在几秒钟后漂移。

技术洞察

关键思想是将令牌层次结构中的结构与纹理解耦。粗略的语义标记是稀疏且变化缓慢的,因此 Transformer 可以在没有巨大序列长度的情况下对长期形式进行建模。声学标记是密集且高速率的,但它们只需要根据已经固定的语义进行预测,使得每个阶段都易于处理。 SoundStream 的残差矢量量化产生分层声学代码,最终解码器将其转回 24 kHz 波形。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

MusicLM 的未来:分层语义和声学标记

MusicLM 的分层令牌方法成为后来的系统(如 MusicGen 和商业音乐工具)的模板。期待更严格的旋律调节(哼一首曲子,得到完整的编曲),更长的完整结构的歌曲,带有主歌和副歌,以及对乐器和调性更好的控制。棘手的问题是法律和道德问题:训练数据许可、艺术家同意和对生成的音频加水印,以便将其与人造音乐区分开来,这些都是现在部署的核心。

现实世界的实施

将书面场景描述转化为电影或预告片配乐,例如“与合唱团一起打造史诗般的管弦乐”

根据图像标题甚至艺术装置的绘画描述生成背景音乐

将简短的哼唱或口哨旋律扩展为完全乐器演奏的编曲

为广告和内容创作者制作不同节奏和情绪的各种库存音乐曲目

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

象征性音乐的产生

常见问题

什么是MusicLM:层级语义和声学代币?

MusicLM 是 Google 的文本到音乐模型,它通过音乐结构的语义标记和声音细节的声学标记的层次结构生成长格式音频。

MusicLM 从根本上是如何处理生成音乐的任务的?

MusicLM 将音乐生成构建为对离散音频标记的自回归预测,类似于语言模型预测单词的方式。

语义标记在 MusicLM 中的作用是什么?

语义标记(来自 w2v-BERT)捕获粗略的、缓慢变化的结构,例如长跨度内的旋律和节奏。

哪个组件提供了音色和纹理等精细的声学细节?

声学标记来自 SoundStream 神经编解码器,对音色和纹理等精细细节进行编码。

MusicLM 如何将文本提示连接到音乐音频?

MuLan 经过训练,可以将文本描述和匹配音频映射到共享嵌入空间中的附近点,从而实现文本调节。

为什么分层、分阶段的设计有助于远程结构?

稀疏语义标记变化缓慢,因此 Transformer 可以在填充密集的声学细节之前有效地对长期形式进行建模。