音訊人工智慧指南

擴散頻譜圖擴散

Riffusion 是一種巧妙的技巧,它透過將聲音視為圖片來產生音樂:它微調穩定擴散影像模型以繪製頻譜圖,然後將這些影像轉換回音訊。

閱讀時間約2分鐘最後更新

概述

It matters because it shows a tool built for one medium (images) can produce another (music) with almost no new architecture.

深入探討

Riffusion 最初是一個業餘愛好項目,由 Seth Forsgren 和 Hayk Martiros 於 2022 年底發布。核心技巧:頻譜圖是一個二維影像,其中水平軸是時間,垂直軸是頻率,像素亮度是響度。由於穩定擴散已經根據文字提示生成圖像,因此創建者在數千個配對的頻譜圖-文字範例上對其進行了微調。用「時髦爵士貝斯」提示它,它會將隨機雜訊降噪成該聲音的頻譜圖。為了製作可播放的音頻,Riffusion 透過 Griffin-Lim 演算法運行頻譜圖,重建遺失的相位資訊。由於擴散可以在提示之間平滑插入,因此 Riffusion 還可以在連續剪輯中將一種風格轉變為另一種風格,無縫循環。

技術洞察

Riffusion 未改變地重複使用潛在擴散管道:U-Net 迭代地從以 CLIP 文字嵌入為條件的潛在影像中去除高斯雜訊。唯一的特定領域工作是頻譜圖表示(梅爾標度、對數功率)和 Griffin-Lim 相位重建,將預測的振幅頻譜圖轉回波形。編碼過程中相位被丟棄,因此 Griffin-Lim 的迭代估計是特徵「水樣」偽影的主要來源。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

擴散譜圖擴散的未來

Riffusion 證明了頻譜圖作為影像的橋樑是有效的,這個想法現在存在於更大的音頻系統中,並成為 Riffusion 公司。預計未來的工具將用學習神經聲碼器取代有損的 Griffin-Lim,以實現更清晰的相位,並將頻譜圖擴散與潛在音頻編解碼器相結合。更廣泛的教訓是,影像模型可以重定向到新的模式,繼續影響研究人員如何從現有的預訓練骨幹網路引導音訊和視訊產生器。

現實世界的實施

根據“緊張的合成波追逐”等文字提示為獨立視頻遊戲生成短循環背景曲目

在兩種音樂風格之間平滑過渡,例如在單一剪輯中將“熱帶浩室音樂”與“低保真嘻哈音樂”融合在一起

為 YouTube 影片和播客製作免版稅的環境音樂床,無需許可費

對旋律或節奏的想法進行原型設計,然後音樂家在數位音訊工作站中正確地重新錄製

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Riffusion Spectrogram Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

DiffWave 擴散聲碼器

常見問題

What is Riffusion Spectrogram Diffusion?

Riffusion 是一種巧妙的技巧,它透過將聲音視為圖片來產生音樂:它微調穩定擴散影像模型以繪製頻譜圖,然後將這些影像轉換回音訊。這很重要,因為它表明為一種媒體(圖像)構建的工具可以產生另一種媒體(音樂),幾乎不需要新的架構。

Riffusion 對現有的哪些人工智慧模型進行了微調來產生音樂?

Riffusion 對穩定擴散(一種影像擴散模型)進行了微調,以產生頻譜圖影像,然後將其轉換為音訊。

頻譜圖的兩個軸代表什麼?

在頻譜圖中,橫軸是時間,縱軸是頻率,亮度代表響度。

為什麼 Riffusion 需要像 Griffin-Lim 這樣的演算法?

頻譜圖儲存振幅但丟棄相位,因此 Griffin-Lim 迭代估計相位以重建可播放波形。

當混合兩個提示時,擴散給 Riffusion 帶來什麼能力?

擴散模型可以在潛在空間中進行插值,讓 Riffusion 不斷從一種音樂風格轉變為另一種音樂風格。

Riffusion 最初是如何創建和發布的?

Riffusion 最初是 Seth Forsgren 和 Hayk Martiros 的業餘愛好項目,於 2022 年底公開發布。