Разделяне на музикален източник на Demucs и HT-Demucs
Demucs е моделът за разделяне на музикален източник с отворен код на Meta; Hybrid Transformer Demucs (HT-Demucs) разделя песните на вокални, барабанни, басови и други елементи, използвайки вълнова форма и обработка на спектрограма.
Дълбоко гмуркане
Demucs (Deep Extractor for Music Sources) се справя с класическия проблем с "не-смесване": възстановяване на отделни инструментални песни от окончателен стерео запис. Ранните версии използваха Waveform-domain U-Net, който работеше директно върху необработени аудио проби, което запазваше информация за фазата, която спектрограмните методи често губят. Широко използваните хибридни Demucs и по-късно Hybrid Transformer Demucs (HT-Demucs) обработват аудио едновременно във формата на вълната и спектрограмата, след което ги сливат и добавят внимание на трансформатора на различни домейни към моделиране на структура на дълъг обхват. Обучен на набора от данни MUSDB18 плюс допълнителни данни, Demucs разделя микса на четири стебла (вокали, барабани, бас, други) и се е превърнал в инструмент по подразбиране, тъй като е с отворен код, работи на потребителски графични процесори и последователно постига резултати близо до върха на показателите за разделяне.
Техническа информация
Hybrid Demucs изпълнява два паралелни клона на енкодер-декодер: един на формата на вълната във времевия домейн и един на STFT спектрограмата. Характеристиките се обменят между разклоненията и се комбинират, така че моделът използва точната фаза на вълновата форма и ясната честотна структура на спектрограмата. Качеството се измерва със съотношението сигнал към изкривяване (SDR) в децибели на задържани песни. Вариантът трансформатор добавя внимание към себе си и кръстосано внимание, за да улови музикален контекст за секунди.
Стратегическо въздействие
Access and reach
Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.
Cost and budget
Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.
Speed and scale
Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.
Бъдещето на разделянето на Demucs и HT-Demucs източник на музика
Разделянето на източника се движи към повече стъбла (отделяне на отделни китари, пиана или дори конкретни певци), работа в реално време и на устройството и разделяне с текстови подсказки („изолиране на саксофона“). По-добрите модели ще намалят воднистите артефакти, които все още се появяват върху плътни смеси. С нарастването на качеството очаквайте по-задълбочена интеграция в DAW, приложения за караоке и ремиксиране и инструменти за музикално образование, наред с продължаващия дебат относно последиците от авторското право и съгласието на чистото извличане на изолирания вокал на всеки изпълнител.
Внедряване в реалния свят
Продуценти и ремиксери, извличащи чисти акапели или инструментали от пуснати песни
Приложенията за караоке премахват главните вокали в движение, за да създадат бекграундове
Музиканти, изолиращи бас линия или барабанен груув, за да транскрибират или да практикуват заедно
Работни потоци за възстановяване на аудио и семплиране, които трябва да извадят един инструмент от стар микс
Рискове и предпазни огради
Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.
Точността може да спадне при акценти, диалекти или шумна среда.
Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.
Пътна карта за изпълнение
Получете изрично съгласие за улавяне на глас, клониране и повторно използване.
Тествайте качеството при различни високоговорители и фонови условия.
Определете кога човек трябва да прегледа или одобри резултатите.
Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Demucs and HT-Demucs Music Source Separation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Отваряне-Размиксиране на музикално разделяне
Frequently asked questions
What is Demucs and HT-Demucs Music Source Separation?
Demucs е моделът за разделяне на музикален източник с отворен код на Meta; Hybrid Transformer Demucs (HT-Demucs) разделя песните на вокални, барабанни, басови и други елементи, използвайки вълнова форма и обработка на спектрограма.
Какво прави Demuc с готова песен?
Demucs извършва разделяне на източника на музика, като разделя стерео микса на отделни инструменти и вокални елементи.
Какво прави Hybrid Demucs „хибрид“?
Hybrid Demucs съчетава разклонение на вълновата форма във времева област и разклонение на спектрограма, сливайки силните им страни.
Кой показател се използва обикновено за оценка на качеството на разделяне?
SDR, измерено в децибели, определя количествено доколко изчисленото стебло съвпада с истинския източник.
Коя организация първоначално пусна Demucs?
Demucs е разработен и с отворен код от изследователи в Meta AI / FAIR.
Защо ранните Demuc работят директно върху необработената форма на вълната?
Работата в областта на формата на вълната запазва фазата, която методите за спектрограма-магнитуд често отхвърлят и трябва да оценят.