Pemisahan Sumber Musik Demucs dan HT-Demucs
Demucs adalah model pemisahan sumber musik sumber terbuka Meta; Hybrid Transformer Demucs (HT-Demucs) membagi lagu menjadi vokal, drum, bass, dan batang lainnya menggunakan pemrosesan bentuk gelombang dan spektogram.
Menyelam Lebih Dalam
Demucs (Deep Extractor for Music Sources) mengatasi masalah klasik "un-mixing": memulihkan track instrumen individual dari rekaman stereo akhir. Versi awal menggunakan domain bentuk gelombang U-Net yang bekerja secara langsung pada sampel audio mentah, yang menyimpan informasi fase yang sering kali hilang dari metode spektogram. Hybrid Demucs yang banyak digunakan dan kemudian Hybrid Transformer Demucs (HT-Demucs) memproses audio dalam domain bentuk gelombang dan spektogram secara bersamaan, kemudian memadukannya, dan menambahkan perhatian transformator lintas domain ke model struktur jarak jauh. Dilatih dengan kumpulan data MUSDB18 ditambah data tambahan, Demucs memisahkan campuran menjadi empat bagian (vokal, drum, bass, lainnya) dan telah menjadi alat default karena bersifat open source, berjalan pada GPU konsumen, dan secara konsisten mendapat skor mendekati puncak pada tolok ukur pemisahan.
Wawasan Teknis
Hybrid Demucs menjalankan dua cabang encoder-decoder paralel: satu pada bentuk gelombang domain waktu dan satu lagi pada spektogram STFT. Fitur dipertukarkan antar cabang dan digabungkan, sehingga model mengeksploitasi fase bentuk gelombang yang tepat dan struktur frekuensi spektogram yang jelas. Kualitas diukur dengan Rasio Signal-to-Distortion (SDR) dalam desibel pada lagu-lagu yang diputar. Varian transformator menambahkan perhatian diri dan perhatian silang untuk menangkap konteks musik dalam hitungan detik.
Dampak Strategis
Access and reach
Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.
Cost and budget
Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.
Kecepatan dan skala
Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.
Masa Depan Pemisahan Sumber Musik Demucs dan HT-Demucs
Pemisahan sumber bergerak menuju lebih banyak batang (memisahkan masing-masing gitar, piano, atau bahkan penyanyi tertentu), pengoperasian real-time dan pada perangkat, dan pemisahan yang dapat dilakukan dengan teks ("isolasi saksofon"). Model yang lebih baik akan mengurangi artefak encer yang masih muncul pada campuran padat. Seiring dengan peningkatan kualitas, diharapkan akan ada integrasi yang lebih mendalam ke dalam DAW, aplikasi karaoke dan remix, serta alat pendidikan musik, serta perdebatan yang sedang berlangsung mengenai implikasi hak cipta dan izin dari ekstraksi vokal terisolasi milik artis mana pun.
Implementasi Dunia Nyata
Produser dan remixer mengekstraksi acapella atau instrumental yang bersih dari lagu yang dirilis
Aplikasi karaoke menghapus vokal utama dengan cepat untuk membuat trek latar
Musisi mengisolasi alur bass atau drum untuk ditranskripsikan atau dilatih
Alur kerja restorasi dan pengambilan sampel audio yang perlu mengeluarkan satu instrumen dari campuran lama
Risiko & Pagar Pembatas
Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.
Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.
Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.
Peta Jalan Implementasi
Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.
Uji kualitas di beragam speaker dan kondisi latar belakang.
Tentukan kapan manusia harus meninjau atau menyetujui keluaran.
Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Demucs and HT-Demucs Music Source Separation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Pemisahan Musik Terbuka-Unmix
Pertanyaan yang sering diajukan
What is Demucs and HT-Demucs Music Source Separation?
Demucs adalah model pemisahan sumber musik sumber terbuka Meta; Hybrid Transformer Demucs (HT-Demucs) membagi lagu menjadi vokal, drum, bass, dan batang lainnya menggunakan pemrosesan bentuk gelombang dan spektogram.
Apa yang Demucs lakukan pada lagu yang sudah selesai?
Demucs melakukan pemisahan sumber musik, membagi campuran stereo menjadi instrumen individual dan batang vokal.
Apa yang menjadikan Hybrid Demucs 'hibrida'?
Hybrid Demucs menggabungkan cabang bentuk gelombang domain waktu dan cabang spektogram, yang menggabungkan kekuatannya.
Metrik manakah yang biasa digunakan untuk mengevaluasi kualitas pemisahan?
SDR, diukur dalam desibel, mengukur seberapa bersih perkiraan batang tersebut sesuai dengan sumber aslinya.
Organisasi mana yang pertama kali merilis Demucs?
Demucs dikembangkan dan dijadikan sumber terbuka oleh para peneliti di Meta AI / FAIR.
Mengapa Demucs awal bekerja secara langsung pada bentuk gelombang mentah?
Beroperasi dalam domain bentuk gelombang mempertahankan fase, yang sering kali dibuang dan harus diperkirakan oleh metode magnitudo spektogram.