音訊人工智慧指南

分裂莖分離

Spleeter 是 Deezer 的開源工具,它使用深度學習將完成的歌曲分割成單獨的曲目(人聲、鼓、貝斯等)。

閱讀時間約2分鐘最後更新

概述

It made high-quality stem separation fast, free, and accessible to anyone with a laptop.

深入探討

Spleeter 於 2019 年由音樂串流媒體公司 Deezer 發布,將混音錄音分離為單獨的樂器主幹。它提供三種預先訓練的配置:2-stem(人聲加伴奏)、4-stem(人聲、鼓、貝斯等)和 5-stem(添加鋼琴)。在底層,它使用 U-Net 卷積神經網路對音訊頻譜圖進行操作,預測每個來源的軟遮罩。將光罩乘以原始頻譜圖並反轉回音訊產生每個主幹。 Spleeter 之所以出名,是因為速度:它分離音訊的速度比 GPU 上即時分離的速度快大約 100 倍。它被 DJ、混音師、轉錄者和卡拉 OK 製作者廣泛使用,並引發了 Demucs 等競爭分離器的浪潮。

技術洞察

Spleeter 在時頻域中工作。音訊透過短時傅立葉變換 (STFT) 轉換為幅度譜圖。 U-Net(具有跳躍連接的編碼器-解碼器)針對每個來源學習每個時頻倉的 0 到 1 之間的遮罩。掩蔽頻譜圖與原始混合物的相位重新組合,然後逆 STFT 重建波形。因為它估計的是軟掩模而不是原始音頻,所以洩漏和重複使用的相位會導致偽影。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

Spleeter 莖分離的未來

較新的波形域模型(例如 Demucs 和混合變壓器分離器)現在在質量上擊敗了 Spleeter,恢復了更清晰的瞬態和更少的偽影。趨勢是更高的主幹數量(分離單獨的吉他或和聲)、DAW 和手機中的即時設備分離,以及整合到串流應用程式中以進行即時混音或存取。 Spleeter 本身仍然是一個流行的基線,因為它輕量級、免費且易於運行,即使研究推動了階段感知和生成方法。

現實世界的實施

透過刪除商業歌曲中的主唱來創建即時卡拉 OK 曲目

DJ 和製作人隔離鼓或貝斯以建立混音和混搭

音樂學生提取單一樂器線進行轉錄和練習

透過分離和重新平衡渾濁的混音來恢復或清理舊錄音

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spleeter Stem Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

Conv-TasNet 時域分離

常見問題

What is Spleeter Stem Separation?

Spleeter 是 Deezer 的開源工具,它使用深度學習將完成的歌曲分割成單獨的曲目(人聲、鼓、貝斯等)。它使高品質的莖分離變得快速、免費,並且任何擁有筆記型電腦的人都可以使用。

Spleeter 最初是哪家公司發表的?

Spleeter 於 2019 年由法國音樂串流媒體公司 Deezer 開源發布。

Spleeter 的 4 乾模型將音訊分離成什麼?

4 根配置輸出人​​聲、鼓、貝斯和用於其他所有內容的「其他」根。

Spleeter 使用什麼神經網路架構?

Spleeter 使用 U-Net 卷積網路來預測音訊頻譜圖上的遮罩。

Spleeter 實際上是如何從混合物中提取單一來源的?

網路預測與混合頻譜圖相乘的每個來源遮罩(值 0 到 1)。

Spleeter 受歡迎的關鍵實際優勢是什麼?

Spleeter 在 GPU 上分離音訊的速度比即時速度快約 100 倍,使其快速且易於存取。