音频人工智能指南

音乐生成器

MusicGen 是 Meta 的 AI 模型,它根据文本描述生成音乐,还可以选择您哼唱或上传的旋律。

阅读时间:2分钟最后更新

概述

It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.

深入探讨

作为 AudioCraft 项目的一部分,MusicGen 由 Meta AI 于 2023 年发布,它将“带有强劲低音线的欢快的 80 年代合成器流行歌曲”等提示转换为大约 12 秒(可扩展)的音乐片段。与多级系统不同,MusicGen 使用单个 Transformer 语言模型来预测 Meta 的 EnCodec 神经编解码器生成的音频标记。它巧妙的贡献是一种令牌交错模式(称为延迟交错),使一个模型能够有效地处理 EnCodec 的多个并行令牌流,从而避免了早期所需方法的级联。 MusicGen 可以同时以两种方式引导:通过文本描述和参考旋律,因此您可以要求您哼唱的曲调的“爵士乐版本”。 Meta 公开发布了代码和权重,推动了社区工具和实验的浪潮。

技术洞察

MusicGen 将音频表示为来自 EnCodec 编解码器的离散令牌的并行流,每个流捕获不同的细节。 MusicGen 不是使用单独的模型对流进行建模,而是将它们与受控延迟交错,以便单个自回归 Transformer 一次性预测它们。文本调节来自 T5 文本编码器,而可选的旋律调节使用色谱图(音频的音高配置文件),因此模型可以遵循曲调,而无需复制其精确的录音。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

MusicGen 的未来

MusicGen 的开放版本设定了一个基线,继任者旨在通过更长、更高保真度和立体声输出来超越,以及对结构、乐器和歌曲部分的更精细控制。期待与音乐制作软件的更紧密集成、实时交互生成以及用于编辑或扩展现有曲目的更好工具。与所有生成音乐一样,它加剧了有关训练数据版权、艺术家报酬以及如何在充斥的市场中标记人工智能生成的歌曲的问题。

现实世界的实施

根据文本提示为 YouTube 视频生成免版税背景音乐

哼着旋律并向 MusicGen 请求完整的管弦乐编曲

游戏开发人员快速制作不同类型的关卡配乐原型

研究人员和爱好者运行开源权重来试验文本转音乐

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicGen quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

What is MusicGen?

MusicGen 是 Meta 的 AI 模型,它根据文本描述生成音乐,还可以选择您哼唱或上传的旋律。这很重要,因为它将高质量、可控的音乐创作放入一个单一的、公开发布的模型中,爱好者和研究人员可以实际运行。

哪两种输入可以同时控制 MusicGen?

MusicGen 接受文本提示和(可选)旋律,因此您可以请求您提供的曲调的风格版本。

哪个神经编解码器产生 MusicGen 预测的音频标记?

MusicGen 对 Meta 的 EnCodec 编解码器生成的离散令牌进行建模,该编解码器还将预测的令牌解码回音频。

与早期方法相比,MusicGen 的关键架构简化是什么?

通过将 EnCodec 的并行令牌流与受控延迟交错,一个自回归 Transformer 可以在一次传递中对它们进行建模,从而避免模型级联。

MusicGen 如何在不复制精确录音的情况下遵循提供的旋律?

色谱图捕捉随时间变化出现的音级,让 MusicGen 匹配曲调的和声和轮廓,而无需再现原始音色。

MusicGen 是哪个项目和公司发布的?

MusicGen 作为 Meta AI 的 AudioCraft 项目的一部分于 2023 年发布,具有开放代码和模型权重。