MusicLM:分層語意和聲學標記
MusicLM 是 Google 的文本到音樂模型,它透過音樂結構的語義標記和聲音細節的聲學標記的層次結構產生長格式音訊。
深入探討
MusicLM 由 Google Research 於 2023 年初宣布,將音樂生成建構成預測離散音訊標記序列,就像語言模型預測單字一樣。它使用表示層次結構:語義標記(來自名為 w2v-BERT 的模型)捕獲長跨度內的高級結構,如旋律和節奏,而聲學標記(來自 SoundStream 神經編解碼器)捕獲精細細節,如音色和紋理。第一階段根據文字提示產生語意標記,然後後續階段根據這些語意填入聲音細節。文字調節來自 MuLM/MuLan,這是一個經過聯合訓練的音樂文字嵌入,因此描述和音訊位於同一空間。這種分階段的方法讓 MusicLM 在幾分鐘內保持音樂一致性,而不是在幾秒鐘後漂移。
技術洞察
關鍵思想是將令牌層次結構中的結構與紋理解耦。粗略的語義標記是稀疏且變化緩慢的,因此 Transformer 可以在沒有巨大序列長度的情況下對長期形式進行建模。聲學標記是密集且高速率的,但它們只需要根據已經固定的語義進行預測,使得每個階段都易於處理。 SoundStream 的殘差向量量化產生分層聲學程式碼,最終解碼器將其轉回 24 kHz 波形。
戰略影響
交通與覆蓋範圍
它透過轉錄、旁白和語音介面提高了可訪問性。
成本與預算
媒體團隊可以用更少的預算更快地交付精美的音訊。
速度與規模
面向客戶的系統可以處理更大規模的語音互動。
MusicLM 的未來:分層語意與聲學標記
MusicLM 的分層令牌方法成為後來的系統(如 MusicGen 和商業音樂工具)的模板。期待更嚴格的旋律調節(哼一首曲子,得到完整的編曲),更長的完整結構的歌曲,帶有主歌和副歌,以及對樂器和調性更好的控制。棘手的問題是法律和道德問題:訓練資料授權、藝術家同意和對生成的音訊加水印,以便將其與人造音樂區分開來,這些都是現在部署的核心。
現實世界的實施
將書面場景描述轉化為電影或預告片配樂,例如“與合唱團一起創造史詩般的管弦樂”
根據圖像標題甚至藝術裝置的繪畫描述生成背景音樂
將簡短的哼唱或口哨旋律擴展為完全樂器演奏的編曲
為廣告和內容創作者製作不同節奏和情緒的各種庫存音樂曲目
風險與防護欄
如果未徵得同意,語音濫用和冒充風險就會增加。
由於口音、方言或嘈雜的環境,準確性可能會下降。
如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。
實施路線圖
獲得語音捕獲、克隆和重用的明確同意。
測試不同揚聲器和背景條件下的品質。
定義人員必須審查或批准輸出的時間。
標記合成音訊並保留來源記錄以供問責。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
什麼是 MusicLM:分層語意和聲學標記?
MusicLM 是 Google 的文本到音樂模型,它透過音樂結構的語義標記和聲音細節的聲學標記的層次結構產生長格式音訊。
MusicLM 從根本上是如何處理生成音樂的任務的?
MusicLM 將音樂生成建構成對離散音訊標記的自回歸預測,類似於語言模型預測單字的方式。
語意標記在 MusicLM 中的作用是什麼?
语义标记(来自 w2v-BERT)捕获粗略的、缓慢变化的结构,例如长跨度内的旋律和节奏。
哪個組件提供了音色和紋理等精細的聲學細節?
聲學標記來自 SoundStream 神經編解碼器,對音色和紋理等精細細節進行編碼。
MusicLM 如何將文字提示連接到音樂音訊?
MuLan 經過訓練,可以將文字描述和匹配音訊映射到共享嵌入空間中的附近點,從而實現文字調節。
為什麼分層、分階段的設計有助於遠端結構?
稀疏語義標記變化緩慢,因此 Transformer 可以在填充密集的聲學細節之前有效地對長期形式進行建模。