點唱機
Jukebox 是 OpenAI 的 2020 年神經網絡,可產生原始音樂音訊 - 包含歌聲、樂器,甚至特定藝術家風格的歌詞。
概述
It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.
深入探討
Jukebox 由 OpenAI 於 2020 年 4 月發布,它以原始音訊而不是符號音符的形式生成音樂,這意味著它會產生包括人聲在內的實際聲音。它接受了從網路上抓取的大約 120 萬首歌曲(大約一半是英語)的訓練,並搭配來自 LyricWiki 的歌詞和元資料。你可以根據流派、藝術家風格和歌詞來調節它,它就會像那位藝術家一樣以可識別的方式(如果模糊的話)唱歌。輸出持續幾分鐘。問題在於速度和保真度:產生速度非常慢,渲染一分鐘的音訊需要大約九個小時,而且結果品質低沉、吵雜。自動點唱機是一項研究,而不是一個精緻的產品,但它重塑了人們對可能發生的事情的期望。
技術洞察
Jukebox 使用 VQ-VAE 自動編碼器以三種時間分辨率壓縮原始音頻,將長波形轉換為更短的離散代碼序列。然後,自回歸變壓器根據藝術家、流派和歌詞一次預測這些代碼,而上採樣器則添加高頻細節。將底層程式碼解碼回 44.1 kHz 波形是產生速度如此緩慢的原因,因為必須依序產生數百萬個音訊樣本。
戰略影響
交通與覆蓋範圍
它透過轉錄、旁白和語音介面提高了可訪問性。
成本與預算
媒體團隊可以用更少的預算更快地交付精美的音訊。
速度與規模
面向客戶的系統可以處理更大規模的語音互動。
自動點唱機的未來
Jukebox 本身現在在很大程度上是一個歷史里程碑,被更快的傳播和潛在音訊模型所取代,例如 Suno 和 Udio 背後的模型,它們可以在幾秒鐘內生成接近 CD 品質的歌曲。它的核心思想——離散音頻標記和歌詞調節——在現代系統中得以延續。預計未來的原始音訊模型將繼續縮短生成時間、提高聲音清晰度並添加精細控制,而 Jukebox 最初提出的有關受版權錄音培訓的版權問題只會越來越響亮。
現實世界的實施
研究人員使用 Jukebox 作為參考架構,研究神經網路如何對長格式原始音訊和歌聲進行建模。
音樂家和愛好者創作出怪異、低保真的“人工智慧翻唱”,以所選藝術家的粗獷風格演唱新歌詞。
教育工作者展示了從 MIDI 風格的音符生成到帶有人聲的完整原始音頻合成的飛躍。
聲音設計師和實驗藝術家將 Jukebox 的朦朧、夢幻般的紋理作為混音和拼貼的原材料。
風險與防護欄
如果未徵得同意,語音濫用和冒充風險就會增加。
由於口音、方言或嘈雜的環境,準確性可能會下降。
如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。
實施路線圖
獲得語音捕獲、克隆和重用的明確同意。
測試不同揚聲器和背景條件下的品質。
定義人員必須審查或批准輸出的時間。
標記合成音訊並保留來源記錄以供問責。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jukebox quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Jukebox?
Jukebox 是 OpenAI 的 2020 年神經網絡,可產生原始音樂音訊 - 包含歌聲、樂器,甚至特定藝術家風格的歌詞。這是一個里程碑式的證據,證明人工智慧可以模擬歌曲長度音樂的實際波形,而不僅僅是音符。
Jukebox 與早期的象徵性音樂 AI(類似輸出 MIDI 的系統)有何不同?
自動點唱機將實際的音樂聲音建模為原始音頻,因此它可以產生人聲和樂器音色,這與僅輸出音符資料的符號系統不同。
誰發布了 Jukebox,大概是什麼時候發布的?
OpenAI 於 2020 年 4 月發布了 Jukebox,作為用人聲產生音樂的研究模式。
Jukebox 的主要實際限制是什麼?
因為它逐個解碼原始音訊樣本,所以 Jukebox 需要大約九個小時才能產生一分鐘的音樂,這使得它對於即時使用來說不切實際。
Jukebox 使用什麼核心技術來使其 Transformers 能夠管理較長的原始音訊?
Jukebox 使用 VQ-VAE 自動編碼器將波形壓縮為離散標記,然後 Transformer 對這些標記進行自回歸建模,然後再上取樣回音訊。
你可以用什麼來調節 Jukebox 的輸出?
Jukebox 接受一種流派、要模仿的藝術家和歌詞,並嘗試以這種風格演唱這些歌詞。