Розділення музичних джерел Demucs і HT-Demucs
Demucs — модель розділення музичних джерел із відкритим кодом Meta; Hybrid Transformer Demucs (HT-Demucs) розділяє пісні на вокал, драм, бас та інші елементи за допомогою обробки хвилі та спектрограми.
Глибоке занурення
Demucs (Deep Extractor for Music Sources) вирішує класичну проблему «незмішування»: відновлення окремих треків інструменту з остаточного стереозапису. У ранніх версіях використовувався U-Net з доменом хвилі, який працював безпосередньо з необробленими зразками аудіо, що зберігало інформацію про фазу, яку методи спектрограм часто втрачають. Широко використовувані Hybrid Demucs і пізніші Hybrid Transformer Demucs (HT-Demucs) одночасно обробляють аудіо як у формі хвилі, так і в спектрограмі, потім об’єднують їх і додають увагу міждоменного трансформатора до структури дальньої моделі. Навчаючись на наборі даних MUSDB18 і додаткових даних, Demucs розділяє мікс на чотири групи (вокал, ударні, бас та інше) і став інструментом за замовчуванням, оскільки він має відкритий вихідний код, працює на споживчих графічних процесорах і постійно досягає найвищих результатів за тестами розділення.
Технічне розуміння
Hybrid Demucs запускає дві паралельні гілки кодера-декодера: одну на хвилі у часовій області та одну на спектрограмі STFT. Характеристики обмінюються між гілками та комбінуються, тому модель використовує точну фазу форми хвилі та чітку частотну структуру спектрограми. Якість вимірюється за допомогою відношення сигнал/спотворення (SDR) у децибелах прослуханих пісень. Трансформерний варіант додає увагу на себе та на перехресну увагу, щоб зафіксувати музичний контекст протягом секунд.
Стратегічний вплив
Доступ і охоплення
Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.
Вартість і бюджет
Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.
Швидкість і масштаб
Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.
Майбутнє розмежування музичних джерел Demucs і HT-Demucs
Поділ джерела переходить до більшої кількості стовбурів (відокремлення окремих гітар, піаніно чи навіть певних співаків), роботи в режимі реального часу та на пристрої, а також поділ із текстовими підказками («ізолювати саксофон»). Кращі моделі зменшать водянисті артефакти, які все ще з’являються на щільних сумішах. У міру підвищення якості очікуйте глибшої інтеграції в DAW, програми для караоке та реміксів, а також музичні освітні інструменти, поряд із постійними дебатами щодо наслідків авторського права та згоди чистого вилучення ізольованого вокалу будь-якого виконавця.
Реалізація в реальному світі
Продюсери та реміксери вилучають чисті акапелли чи інструментальні композиції з випущених треків
Програми для караоке видаляють головний вокал на льоту для створення мінусовок
Музиканти виокремлюють басову лінію або грув на барабанах для транскрибування або репетиції
Робочі процеси відновлення аудіо та семплювання, які потребують вилучення одного інструменту зі старого міксу
Ризики та огорожі
Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.
Точність може впасти через акценти, діалекти чи шумне середовище.
Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.
Дорожня карта впровадження
Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.
Перевірте якість на різних динаміках і фонових умовах.
Визначте, коли людина повинна переглядати або затверджувати результати.
Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Demucs and HT-Demucs Music Source Separation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Розділення музики «Відкрити-Розмікшувати».
Часті запитання
What is Demucs and HT-Demucs Music Source Separation?
Demucs — модель розділення музичних джерел із відкритим кодом Meta; Hybrid Transformer Demucs (HT-Demucs) розділяє пісні на вокал, драм, бас та інші елементи за допомогою обробки хвилі та спектрограми.
Що робить Демукс із готовою піснею?
Demucs виконує відокремлення музичного джерела, розділяючи стереомікс на окремі інструментальні та вокальні основи.
Що робить Hybrid Demucs «гібридом»?
Hybrid Demucs поєднує в собі гілку хвилі у часовій області та гілку спектрограми, об’єднуючи їхні переваги.
Який показник зазвичай використовується для оцінки якості розділення?
SDR, виміряний у децибелах, кількісно визначає, наскільки точно розрахунковий стрижень відповідає справжньому джерелу.
Яка організація спочатку випустила Demucs?
Demucs було розроблено та відкрито дослідниками з Meta AI / FAIR.
Чому ранні Demuc працювали безпосередньо над необробленою формою сигналу?
Робота в області форми сигналу зберігає фазу, яку методи спектрограми-величини часто відкидають і повинні оцінювати.