音訊人工智慧指南

音樂產生器

MusicGen 是 Meta 的 AI 模型,它根據文字描述產生音樂,還可以選擇您哼唱或上傳的旋律。

閱讀時間約2分鐘最後更新

概述

It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.

深入探討

作為 AudioCraft 計畫的一部分,MusicGen 由 Meta AI 於 2023 年發布,它將「帶有強勁低音線的歡快的 80 年代合成器流行歌曲」等提示轉換為大約 12 秒(可擴展)的音樂片段。與多層系統不同,MusicGen 使用單一 Transformer 語言模型來預測 Meta 的 EnCodec 神經編解碼器產生的音訊標記。它巧妙的貢獻是一種令牌交錯模式(稱為延遲交錯),使一個模型能夠有效地處理 EnCodec 的多個平行令牌流,從而避免了早期所需方法的級聯。 MusicGen 可以同時以兩種方式引導:透過文字描述和參考旋律,因此您可以要求您哼唱的曲調的「爵士樂版本」。 Meta 公開發布了程式碼和權重,推動了社群工具和實驗的浪潮。

技術洞察

MusicGen 將音訊表示為來自 EnCodec 編解碼器的離散令牌的平行流,每個串流捕獲不同的細節。 MusicGen 不是使用單獨的模型對流進行建模,而是將它們與受控延遲交錯,以便單個自回歸 Transformer 一次預測它們。文字調節來自 T5 文字編碼器,而可選的旋律調節使用色譜圖(音訊的音高配置檔案),因此模型可以遵循曲調,而無需複製其精確的錄音。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

MusicGen 的未來

MusicGen 的開放版本設定了一個基線,繼任者旨在透過更長、更高保真度和立體聲輸出來超越,以及對結構、樂器和歌曲部分的更精細控制。期待與音樂製作軟體的更緊密整合、即時互動生成以及用於編輯或擴展現有曲目的更好工具。與所有生成音樂一樣,它加劇了有關訓練資料版權、藝術家報酬以及如何在充斥的市場中標記人工智慧生成的歌曲的問題。

現實世界的實施

根據文字提示為 YouTube 影片產生免版稅背景音樂

哼著旋律並向 MusicGen 請求完整的管弦樂編曲

遊戲開發人員快速製作不同類型的關卡配樂原型

研究人員和愛好者運行開源權重來試驗文本轉音樂

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicGen quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is MusicGen?

MusicGen 是 Meta 的 AI 模型,它根據文字描述產生音樂,還可以選擇您哼唱或上傳的旋律。這很重要,因為它將高品質、可控的音樂創作放入一個單一的、公開發布的模型中,愛好者和研究人員可以實際運作。

哪兩個輸入可以同時控制 MusicGen?

MusicGen 接受文字提示和(可選)旋律,因此您可以要求您提供的曲調的風格版本。

哪個神經編解碼器產生 MusicGen 預測的音訊標記?

MusicGen 對 Meta 的 EnCodec 編解碼器產生的離散令牌進行建模,該編解碼器還將預測的令牌解碼回音訊。

與早期方法相比,MusicGen 的關鍵架構簡化是什麼?

透過將 EnCodec 的平行令牌流與受控延遲交錯,一個自回歸 Transformer 可以在一次傳遞中對它們進行建模,從而避免模型級聯。

MusicGen 如何在不複製精確錄音的情況下遵循提供的旋律?

色譜圖捕捉隨時間變化出現的音級,讓 MusicGen 匹配曲調的和聲和輪廓,而無需再現原始音色。

MusicGen 是哪個專案和公司發布的?

MusicGen 作為 Meta AI 的 AudioCraft 專案的一部分於 2023 年發布,具有開放程式碼和模型權重。