Разделение музыкальных источников Demucs и HT-Demucs
Demucs — это модель разделения музыкальных источников с открытым исходным кодом Meta; Hybrid Transformer Demucs (HT-Demucs) разделяет песни на вокал, ударные, бас и другие основы, используя обработку сигналов и спектрограмм.
Глубокое погружение
Demucs (Deep Extractor for Music Sources) решает классическую проблему «несмешивания»: восстановление отдельных треков инструментов из окончательной стереозаписи. В ранних версиях использовалась U-Net в области сигналов, которая работала непосредственно с необработанными аудиосэмплами и сохраняла фазовую информацию, которую часто теряют методы спектрограмм. Широко используемые Hybrid Demucs, а затем и Hybrid Transformer Demucs (HT-Demucs), одновременно обрабатывают звук как в области формы волны, так и в области спектрограммы, затем объединяют их и добавляют внимание к междоменному преобразователю для моделирования структуры дальнего действия. Обученный на наборе данных MUSDB18 плюс дополнительных данных, Demucs разделяет микс на четыре основы (вокал, ударные, бас и т. д.) и стал инструментом по умолчанию, поскольку он имеет открытый исходный код, работает на потребительских графических процессорах и стабильно занимает верхние позиции по тестам разделения.
Техническая информация
Hybrid Demucs запускает две параллельные ветви кодера-декодера: одну на форме сигнала во временной области, а другую на спектрограмме STFT. Функции передаются между ветвями и комбинируются, поэтому модель использует точную фазу сигнала и четкую частотную структуру спектрограммы. Качество измеряется соотношением сигнала к искажению (SDR) в децибелах в затянувшихся песнях. Вариант-трансформер добавляет внимание к себе и перекрестное внимание, чтобы уловить музыкальный контекст за считанные секунды.
Стратегическое воздействие
Доступ и охват
Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.
Стоимость и бюджет
Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.
Скорость и масштаб
Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.
Будущее разделения музыкальных источников Demucs и HT-Demucs
Разделение источников движется в сторону большего количества стеблей (разделение отдельных гитар, фортепиано или даже конкретных певцов), операций в реальном времени и на устройстве, а также разделения с помощью текстовых подсказок («изолировать саксофон»). Лучшие модели уменьшат количество водянистых артефактов, которые все еще появляются в плотных смесях. По мере роста качества ожидайте более глубокой интеграции в DAW, приложения для караоке и ремиксов, а также инструменты музыкального образования, а также продолжающиеся дебаты о последствиях авторского права и согласия при чистом извлечении изолированного вокала любого исполнителя.
Реальная реализация
Продюсеры и ремиксеры, извлекающие чистые акапеллы или инструментальные партии из выпущенных треков.
Приложения-караоке на лету удаляют ведущий вокал для создания минусовок
Музыканты, изолирующие басовую партию или барабанный грув для расшифровки или практики под нее.
Рабочие процессы восстановления и сэмплирования звука, позволяющие извлечь один инструмент из старого микса
Риски и ограничения
Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.
Точность может снижаться из-за акцентов, диалектов или шумной обстановки.
Синтетический звук можно принять за аутентичную речь без четкой маркировки.
Дорожная карта реализации
Получите явное согласие на захват, клонирование и повторное использование голоса.
Проверьте качество звука при использовании различных динамиков и фоновых условий.
Определите, когда человек должен проверять или утверждать результаты.
Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Demucs and HT-Demucs Music Source Separation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Разделение музыки Open-Unmix
Часто задаваемые вопросы
What is Demucs and HT-Demucs Music Source Separation?
Demucs — это модель разделения музыкальных источников с открытым исходным кодом Meta; Hybrid Transformer Demucs (HT-Demucs) разделяет песни на вокал, ударные, бас и другие основы, используя обработку сигналов и спектрограмм.
Что Demucs делает с готовой песней?
Demucs выполняет разделение музыкальных источников, разделяя стереомикс на отдельные инструментальные и вокальные основы.
Что делает Hybrid Demucs «гибридными»?
Гибридный Demucs сочетает в себе ветвь формы сигнала во временной области и ветвь спектрограммы, объединяя их сильные стороны.
Какой показатель обычно используется для оценки качества разделения?
SDR, измеряемый в децибелах, определяет, насколько точно предполагаемая основа соответствует истинному источнику.
Какая организация изначально выпустила Demucs?
Demucs был разработан и выложен в открытый доступ исследователями из Meta AI/FAIR.
Почему ранние Demucs работали непосредственно с необработанным сигналом?
Работа в области формы сигнала сохраняет фазу, которую методы спектрограммной величины часто игнорируют и которую необходимо оценивать.