音频人工智能指南

点唱机

Jukebox 是 OpenAI 的 2020 年神经网络,可生成原始音乐音频 - 包含歌声、乐器,甚至特定艺术家风格的歌词。

阅读时间:2分钟最后更新

概述

It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.

深入探讨

Jukebox 由 OpenAI 于 2020 年 4 月发布,它以原始音频而不是符号音符的形式生成音乐,这意味着它会产生包括人声在内的实际声音。它接受了从网络上抓取的大约 120 万首歌曲(大约一半是英语)的训练,并搭配来自 LyricWiki 的歌词和元数据。你可以根据流派、艺术家风格和歌词来调节它,它就会像那个艺术家那样以可识别的方式(如果模糊的话)唱歌。输出持续几分钟。问题在于速度和保真度:生成速度非常慢,渲染一分钟的音频需要大约九个小时,而且结果质量低沉、嘈杂。自动点唱机是一项研究,而不是一个精致的产品,但它重塑了人们对可能发生的事情的期望。

技术洞察

Jukebox 使用 VQ-VAE 自动编码器以三种时间分辨率压缩原始音频,将长波形转换为更短的离散代码序列。然后,自回归变压器根据艺术家、流派和歌词一次预测这些代码,而上采样器则添加高频细节。将底层代码解码回 44.1 kHz 波形是生成速度如此缓慢的原因,因为必须顺序生成数百万个音频样本。

战略影响

交通与覆盖范围

它通过转录、旁白和语音界面提高了可访问性。

成本与预算

媒体团队可以用更少的预算更快地交付精美的音频。

速度与规模

面向客户的系统可以处理更大规模的语音交互。

自动点唱机的未来

Jukebox 本身现在在很大程度上是一个历史里程碑,被更快的传播和潜在音频模型所取代,例如 Suno 和 Udio 背后的模型,它们可以在几秒钟内生成接近 CD 质量的歌曲。它的核心思想——离散音频标记和歌词调节——在现代系统中得以延续。预计未来的原始音频模型将继续缩短生成时间、提高声音清晰度并添加精细控制,而 Jukebox 最初提出的有关受版权录音培训的版权问题只会越来越响亮。

现实世界的实施

研究人员使用 Jukebox 作为参考架构,研究神经网络如何对长格式原始音频和歌声进行建模。

音乐家和爱好者创作出怪异、低保真的“人工智能翻唱”,以所选艺术家的粗犷风格演唱新歌词。

教育工作者展示了从 MIDI 风格的音符生成到带有人声的完整原始音频合成的飞跃。

声音设计师和实验艺术家将 Jukebox 的朦胧、梦幻般的纹理作为混音和拼贴的原材料。

风险与防护栏

如果未征得同意,语音滥用和冒充风险就会增加。

由于口音、方言或嘈杂的环境,准确性可能会下降。

如果没有明确的标签,合成音频可能会被误认为是真实的语音。

实施路线图

1

获得语音捕获、克隆和重用的明确同意。

2

测试不同扬声器和背景条件下的质量。

3

定义人员必须审查或批准输出的时间。

4

标记合成音频并保留来源记录以供问责。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jukebox quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

象征性音乐的产生

常见问题

What is Jukebox?

Jukebox 是 OpenAI 的 2020 年神经网络,可生成原始音乐音频 - 包含歌声、乐器,甚至特定艺术家风格的歌词。这是一个里程碑式的证据,证明人工智能可以模拟歌曲长度音乐的实际波形,而不仅仅是音符。

Jukebox 与早期的象征性音乐 AI(类似输出 MIDI 的系统)有何不同?

自动点唱机将实际的音乐声音建模为原始音频,因此它可以产生人声和乐器音色,这与仅输出音符数据的符号系统不同。

谁发布了 Jukebox,大概是什么时候发布的?

OpenAI 于 2020 年 4 月发布了 Jukebox,作为用人声生成音乐的研究模型。

Jukebox 的主要实际限制是什么?

因为它逐个解码原始音频样本,所以 Jukebox 需要大约九个小时才能产生一分钟的音乐,这使得它对于实时使用来说不切实际。

Jukebox 使用什么核心技术来使其 Transformers 能够管理较长的原始音频?

Jukebox 使用 VQ-VAE 自动编码器将波形压缩为离散标记,然后 Transformer 对这些标记进行自回归建模,然后再上采样回音频。

你可以用什么来调节 Jukebox 的输出?

Jukebox 接受一种流派、要模仿的艺术家和歌词,并尝试以这种风格演唱这些歌词。