PANDUAN AI Audio

Pemisahan Sumber Muzik Demucs dan HT-Demucs

Demucs ialah model pemisahan sumber muzik sumber terbuka Meta; Hybrid Transformer Demucs (HT-Demucs) membahagikan lagu kepada vokal, dram, bes dan batang lain menggunakan pemprosesan bentuk gelombang dan spektrogram.

2 min dibacaKemas kini terakhir

Menyelam dalam

Demucs (Deep Extractor for Music Sources) menangani masalah "tidak bercampur" klasik: memulihkan trek instrumen individu daripada rakaman stereo terakhir. Versi awal menggunakan U-Net domain bentuk gelombang yang berfungsi secara langsung pada sampel audio mentah, yang mengekalkan maklumat fasa yang sering hilang oleh kaedah spektrogram. Hybrid Demucs yang digunakan secara meluas dan kemudiannya Hybrid Transformer Demucs (HT-Demucs) memproses audio dalam kedua-dua bentuk gelombang dan domain spektrogram secara serentak, kemudian menggabungkannya, dan menambah perhatian pengubah merentas domain kepada model struktur jarak jauh. Dilatih pada set data MUSDB18 serta data tambahan, Demucs memisahkan campuran kepada empat batang (vokal, dram, bes, lain-lain) dan telah menjadi alat lalai kerana ia adalah sumber terbuka, berjalan pada GPU pengguna dan secara konsisten mendapat markah berhampiran bahagian atas pada penanda aras pemisahan.

Wawasan Teknikal

Hybrid Demucs menjalankan dua cabang penyahkod pengekod selari: satu pada bentuk gelombang domain masa dan satu pada spektrogram STFT. Ciri ditukar antara cawangan dan digabungkan, jadi model mengeksploitasi fasa tepat bentuk gelombang dan struktur frekuensi jelas spektrogram. Kualiti diukur dengan Nisbah Signal-to-Distortion (SDR) dalam desibel pada lagu yang dihentikan. Varian pengubah menambah perhatian diri dan silang untuk menangkap konteks muzik merentasi beberapa saat.

Kesan Strategik

Akses dan capai

Ia meningkatkan kebolehcapaian melalui transkripsi, narasi dan antara muka suara.

Kos dan bajet

Pasukan media boleh menghantar audio yang digilap dengan lebih pantas dengan belanjawan yang lebih kecil.

Kelajuan dan skala

Sistem yang menghadapi pelanggan boleh memproses interaksi pertuturan pada skala yang lebih besar.

Masa Depan Pemisahan Sumber Muzik Demucs dan HT-Demucs

Pemisahan sumber bergerak ke arah lebih banyak batang (memisahkan gitar individu, piano, atau penyanyi tertentu), operasi masa nyata dan pada peranti, dan pemisahan terdorong teks ("asingkan saksofon"). Model yang lebih baik akan mengurangkan artifak berair yang masih muncul pada campuran padat. Apabila kualiti meningkat, harapkan penyepaduan yang lebih mendalam ke dalam aplikasi DAW, karaoke dan remix serta alatan pendidikan muzik, di samping perdebatan berterusan tentang implikasi hak cipta dan persetujuan untuk mengekstrak vokal terpencil mana-mana artis secara bersih.

Pelaksanaan Dunia Sebenar

Pengeluar dan pengadun semula mengekstrak acapella atau instrumental bersih daripada lagu yang dikeluarkan

Apl karaoke yang mengalih keluar vokal utama dengan cepat untuk mencipta trek sandaran

Pemuzik mengasingkan garis bass atau alur dram untuk menyalin atau berlatih bersama

Pemulihan audio dan aliran kerja pensampelan yang perlu mengeluarkan satu instrumen daripada campuran lama

Risiko & Pengawal

Penyalahgunaan suara dan risiko penyamaran meningkat apabila tiada kebenaran.

Ketepatan boleh menurun merentas aksen, dialek atau persekitaran yang bising.

Audio sintetik boleh disalah anggap sebagai pertuturan tulen tanpa pelabelan yang jelas.

Hala Tuju Pelaksanaan

1

Dapatkan persetujuan yang jelas untuk menangkap suara, pengklonan dan penggunaan semula.

2

Uji kualiti merentas pelbagai pembesar suara dan keadaan latar belakang.

3

Tentukan bila manusia mesti menyemak atau meluluskan output.

4

Labelkan audio sintetik dan simpan rekod asal untuk kebertanggungjawaban.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Demucs and HT-Demucs Music Source Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Pemisahan Muzik Open-Unmix

Soalan lazim

Apakah Pemisahan Sumber Muzik Demucs dan HT-Demucs?

Demucs ialah model pemisahan sumber muzik sumber terbuka Meta; Hybrid Transformer Demucs (HT-Demucs) membahagikan lagu kepada vokal, dram, bes dan batang lain menggunakan pemprosesan bentuk gelombang dan spektrogram.

Apakah yang dilakukan oleh Demucs pada lagu yang telah siap?

Demucs melakukan pengasingan sumber muzik, memisahkan campuran stereo kepada instrumen individu dan batang vokal.

Apakah yang menjadikan Hybrid Demucs 'hibrid'?

Hybrid Demucs menggabungkan cawangan bentuk gelombang domain masa dan cawangan spektrogram, menggabungkan kekuatannya.

Metrik manakah yang biasa digunakan untuk menilai kualiti pemisahan?

SDR, diukur dalam desibel, mengukur sejauh mana bersih anggaran batang sepadan dengan sumber sebenar.

Organisasi manakah yang pada asalnya mengeluarkan Demucs?

Demucs dibangunkan dan sumber terbuka oleh penyelidik di Meta AI / FAIR.

Mengapakah Demucs awal berfungsi secara langsung pada bentuk gelombang mentah?

Beroperasi dalam domain bentuk gelombang mengekalkan fasa, yang kaedah magnitud spektrogram sering dibuang dan mesti dianggarkan.