डेमुक्स और एचटी-डेमुक्स संगीत स्रोत पृथक्करण
डिम्यूक्स Meta का ओपन-सोर्स संगीत स्रोत पृथक्करण मॉडल है; हाइब्रिड ट्रांसफॉर्मर डिम्यूक्स (एचटी-डेम्यूक्स) वेवफॉर्म और स्पेक्ट्रोग्राम प्रोसेसिंग का उपयोग करके गानों को वोकल, ड्रम, बास और अन्य स्टेम में विभाजित करता है।
गहरा गोता
डेमुक्स (संगीत स्रोतों के लिए डीप एक्सट्रैक्टर) क्लासिक "अन-मिक्सिंग" समस्या से निपटता है: अंतिम स्टीरियो रिकॉर्डिंग से व्यक्तिगत उपकरण ट्रैक को पुनर्प्राप्त करना। प्रारंभिक संस्करणों में एक वेवफॉर्म-डोमेन यू-नेट का उपयोग किया गया था जो सीधे कच्चे ऑडियो नमूनों पर काम करता था, जो चरण जानकारी को संरक्षित करता था जो स्पेक्ट्रोग्राम विधियां अक्सर खो जाती हैं। व्यापक रूप से उपयोग किए जाने वाले हाइब्रिड डिम्यूक्स और बाद में हाइब्रिड ट्रांसफार्मर डिम्यूक्स (एचटी-डेम्यूक्स) तरंगरूप और स्पेक्ट्रोग्राम दोनों डोमेन में एक साथ ऑडियो प्रोसेस करते हैं, फिर उन्हें फ्यूज करते हैं, और मॉडल लंबी दूरी की संरचना में क्रॉस-डोमेन ट्रांसफार्मर का ध्यान जोड़ते हैं। MUSDB18 डेटासेट प्लस अतिरिक्त डेटा पर प्रशिक्षित, डेमुक्स एक मिश्रण को चार तनों (वोकल्स, ड्रम, बास, अन्य) में अलग करता है और एक डिफ़ॉल्ट टूल बन गया है क्योंकि यह खुला स्रोत है, उपभोक्ता जीपीयू पर चलता है, और पृथक्करण बेंचमार्क पर लगातार शीर्ष के करीब स्कोर करता है।
तकनीकी अंतर्दृष्टि
हाइब्रिड डेमोक्स दो समानांतर एनकोडर-डिकोडर शाखाएं चलाता है: एक टाइम-डोमेन तरंग पर और एक एसटीएफटी स्पेक्ट्रोग्राम पर। शाखाओं के बीच सुविधाओं का आदान-प्रदान होता है और संयुक्त होता है, इसलिए मॉडल तरंगरूप के सटीक चरण और स्पेक्ट्रोग्राम की स्पष्ट आवृत्ति संरचना का फायदा उठाता है। गुणवत्ता को रुके हुए गानों पर डेसिबल में सिग्नल-टू-डिस्टॉर्शन रेशियो (एसडीआर) से मापा जाता है। ट्रांसफ़ॉर्मर संस्करण संगीत संदर्भ को सेकंडों में कैप्चर करने के लिए स्व- और क्रॉस-अटेंशन जोड़ता है।
सामरिक प्रभाव
पहुंच और पहुंच
यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।
लागत और बजट
मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।
गति और पैमाना
ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।
डेमुक्स और एचटी-डेमुक्स संगीत स्रोत पृथक्करण का भविष्य
स्रोत पृथक्करण अधिक स्टेम्स (व्यक्तिगत गिटार, पियानो, या यहां तक कि विशिष्ट गायकों को अलग करना), वास्तविक समय और ऑन-डिवाइस ऑपरेशन, और टेक्स्ट-प्रॉम्प्टेबल पृथक्करण ("सैक्सोफोन को अलग करना") की ओर बढ़ रहा है। बेहतर मॉडल पानी वाली कलाकृतियों को कम कर देंगे जो अभी भी घने मिश्रणों पर दिखाई देती हैं। जैसे-जैसे गुणवत्ता बढ़ती है, DAWs, कराओके और रीमिक्स ऐप्स और संगीत शिक्षा उपकरणों में गहन एकीकरण की उम्मीद है, साथ ही किसी भी कलाकार के अलग-थलग स्वर को स्पष्ट रूप से निकालने के कॉपीराइट और सहमति निहितार्थ के बारे में चल रही बहस के साथ-साथ।
वास्तविक विश्व कार्यान्वयन
निर्माता और रीमिक्सर रिलीज़ किए गए ट्रैक से स्वच्छ अकापेल्ला या वाद्ययंत्र निकाल रहे हैं
कराओके ऐप्स बैकिंग ट्रैक बनाने के लिए तुरंत लीड वोकल्स हटा रहे हैं
संगीतकार प्रतिलेखन या अभ्यास के लिए बेसलाइन या ड्रम ग्रूव को अलग करते हैं
ऑडियो पुनर्स्थापन और नमूनाकरण वर्कफ़्लो जिसमें एक उपकरण को पुराने मिश्रण से बाहर निकालने की आवश्यकता होती है
जोखिम और रेलिंग
सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।
उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।
स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।
कार्यान्वयन रोडमैप
वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।
विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।
परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।
जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Demucs and HT-Demucs Music Source Separation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
ओपन-अनमिक्स संगीत पृथक्करण
अक्सर पूछे जाने वाले प्रश्नों
What is Demucs and HT-Demucs Music Source Separation?
डिम्यूक्स Meta का ओपन-सोर्स संगीत स्रोत पृथक्करण मॉडल है; हाइब्रिड ट्रांसफॉर्मर डिम्यूक्स (एचटी-डेम्यूक्स) वेवफॉर्म और स्पेक्ट्रोग्राम प्रोसेसिंग का उपयोग करके गानों को वोकल, ड्रम, बास और अन्य स्टेम में विभाजित करता है।
डेमुक्स एक तैयार गीत के साथ क्या करता है?
डेमुक्स संगीत स्रोत पृथक्करण करता है, स्टीरियो मिश्रण को अलग-अलग वाद्ययंत्रों और स्वरों में विभाजित करता है।
हाइब्रिड डिमुक्स को 'हाइब्रिड' क्या बनाता है?
हाइब्रिड डेमोक्स एक टाइम-डोमेन वेवफ़ॉर्म शाखा और एक स्पेक्ट्रोग्राम शाखा को जोड़ता है, जो उनकी शक्तियों को जोड़ता है।
पृथक्करण गुणवत्ता का मूल्यांकन करने के लिए आमतौर पर किस मीट्रिक का उपयोग किया जाता है?
एसडीआर, जिसे डेसीबल में मापा जाता है, यह निर्धारित करता है कि अनुमानित स्टेम वास्तविक स्रोत से कितनी सफाई से मेल खाता है।
मूल रूप से किस संगठन ने डिमुक्स जारी किया?
Demucs को Meta AI/FAIR के शोधकर्ताओं द्वारा विकसित और ओपन-सोर्स किया गया था।
आरंभिक डेमोक्स ने सीधे कच्चे तरंगरूप पर कार्य क्यों किया?
तरंगरूप डोमेन में संचालन चरण को संरक्षित करता है, जिसे स्पेक्ट्रोग्राम-परिमाण विधियां अक्सर त्याग देती हैं और अनुमान लगाना चाहिए।