Demucs と HT-Demucs の音楽ソースの分離
Demucs は Meta のオープンソース音楽ソース分離モデルです。 Hybrid Transformer Demucs (HT-Demucs) は、波形とスペクトログラム処理を使用して、曲をボーカル、ドラム、ベース、その他のステムに分割します。
ディープダイブ
Demucs (Deep Extractor for Music Sources) は、最終的なステレオ録音から個々の楽器トラックを復元するという古典的な「アンミックス」問題に取り組みます。初期のバージョンでは、生のオーディオ サンプルを直接処理する波形ドメイン U-Net が使用されており、スペクトログラム メソッドで失われることが多い位相情報が保存されていました。広く使用されている Hybrid Demucs とその後の Hybrid Transformer Demucs (HT-Demucs) は、波形ドメインとスペクトログラム ドメインの両方でオーディオを同時に処理してからそれらを融合し、長距離構造をモデル化するためにクロスドメイン トランスフォーマーの注意を追加します。 MUDB18 データセットと追加データでトレーニングされた Demucs は、ミックスを 4 つのステム (ボーカル、ドラム、ベース、その他) に分離します。これはオープンソースであり、コンシューマー GPU で実行され、分離ベンチマークで一貫してトップ近くのスコアを獲得しているため、デフォルトのツールとなっています。
技術的な洞察
Hybrid Demucs は 2 つの並列エンコーダ/デコーダ ブランチを実行します。1 つは時間領域波形で、もう 1 つは STFT スペクトログラムです。特徴はブランチ間で交換されて結合されるため、モデルは波形の正確な位相とスペクトログラムの明確な周波数構造を活用します。品質は、保留された曲の信号対歪み比 (SDR) でデシベル単位で測定されます。トランスフォーマーのバリアントでは、自己注目と相互注目が追加され、数秒にわたる音楽のコンテキストを捉えることができます。
戦略的影響
アクセスと到達範囲
文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。
費用と予算
メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。
速度とスケール
顧客対応システムは、音声対話を大規模に処理できます。
Demucs と HT-Demucs の将来 音楽ソースの分離
ソースの分離は、より多くのステム (個々のギター、ピアノ、さらには特定の歌手の分離)、リアルタイムおよびデバイス上での操作、テキスト プロンプト表示による分離 (「サックスを分離する」) へと移行しています。より良いモデルでは、高密度ミックスでも依然として現れる水っぽいアーティファクトが軽減されます。品質が向上するにつれ、アーティストの孤立したボーカルをきれいに抽出する場合の著作権と同意への影響についての継続的な議論とともに、DAW、カラオケおよびリミックス アプリ、音楽教育ツールへの統合がさらに深まることが予想されます。
現実世界の実装
リリースされたトラックからクリーンなアカペラやインストゥルメンタルを抽出するプロデューサーとリミキサー
カラオケ アプリはその場でリード ボーカルを削除してバッキング トラックを作成します
ベースラインやドラムのグルーヴを分離して転写したり、一緒に練習したりするミュージシャン
古いミックスから 1 つの楽器を取り出す必要があるオーディオの復元とサンプリングのワークフロー
リスクとガードレール
同意がない場合、音声の悪用やなりすましのリスクが高まります。
アクセント、方言、または騒がしい環境では精度が低下する可能性があります。
合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。
実装ロードマップ
音声のキャプチャ、複製、再利用については明示的な同意を取得してください。
さまざまな話者や背景条件で品質をテストします。
人間がいつ出力をレビューまたは承認する必要があるかを定義します。
合成音声にラベルを付け、出所記録を保管して説明責任を果たします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Demucs and HT-Demucs Music Source Separation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
オープンアンミックス音楽の分離
よくある質問
What is Demucs and HT-Demucs Music Source Separation?
Demucs は Meta のオープンソース音楽ソース分離モデルです。 Hybrid Transformer Demucs (HT-Demucs) は、波形とスペクトログラム処理を使用して、曲をボーカル、ドラム、ベース、その他のステムに分割します。
Demucs は完成した曲に対して何をしますか?
Demucs は音楽ソースの分離を実行し、ステレオ ミックスを個々の楽器とボーカル ステムに分割します。
Hybrid Demucs を「ハイブリッド」にするものは何ですか?
Hybrid Demucs は、タイムドメイン波形ブランチとスペクトログラム ブランチを組み合わせて、それぞれの長所を融合します。
分離品質を評価するために一般的に使用される指標はどれですか?
デシベル単位で測定される SDR は、推定されたステムが実際の音源とどの程度正確に一致するかを定量化します。
最初に Demucs をリリースしたのはどの組織ですか?
Demucs は、Meta AI / FAIR の研究者によって開発され、オープンソース化されました。
なぜ初期の Demucs は生の波形を直接操作したのでしょうか?
波形領域で動作すると位相が保存されますが、スペクトログラム振幅法では位相が無視されることが多いため、推定する必要があります。