ओपन-अनमिक्स संगीत पृथक्करण
ओपन-अनमिक्स (यूएमएक्स) एक ओपन-सोर्स डीप लर्निंग सिस्टम है जो एक गाने को उसके भागों में विभाजित करता है: स्वर, ड्रम, बास और अन्य वाद्ययंत्र।
सिंहावलोकन
It matters as a reproducible, reference-quality baseline that made music source separation accessible to researchers, musicians, and hobbyists.
गहरा गोता
2019 में स्टोटर, उहलिच, लिउटकस और मित्सुफुजी द्वारा जारी, ओपन-अनमिक्स को जानबूझकर PyTorch (टेन्सरफ्लो और एनएनएब्ला पोर्ट के साथ) में एक पारदर्शी, अच्छी तरह से प्रलेखित बेसलाइन के रूप में बनाया गया था। यह मिश्रण के परिमाण स्पेक्ट्रोग्राम पर प्रति लक्ष्य स्टेम एक मॉडल को प्रशिक्षित करता है। कोर एक तीन-परत द्विदिशात्मक LSTM है जो पूरी तरह से जुड़ी हुई परतों से लिपटा हुआ है, जो लक्ष्य स्रोत के लिए एक वर्णक्रमीय मुखौटा की भविष्यवाणी करता है। क्योंकि यह परिमाण पर काम करता है, यह मिश्रण के चरण का पुन: उपयोग करता है और व्युत्क्रम एसटीएफटी के माध्यम से स्टेम का पुनर्निर्माण करता है, वैकल्पिक रूप से मल्टीचैनल वीनर फ़िल्टर के साथ परिष्कृत किया जाता है। खुले MUSDB18 डेटासेट पर प्रशिक्षित, यह शीर्ष लीडरबोर्ड स्कोर का पीछा नहीं करता है; इसका लक्ष्य स्पष्टता और पुनरुत्पादकता है, जो समुदाय को तुलना का एक भरोसेमंद बिंदु और निर्माण के लिए एक आधार प्रदान करता है।
तकनीकी अंतर्दृष्टि
प्रत्येक स्टेम का अपना नेटवर्क होता है जो इनपुट परिमाण स्पेक्ट्रोग्राम पर काम करता है। फ़्रीक्वेंसी डिब्बे को एक सघन परत द्वारा मानकीकृत और आयामीता-कम किया जाता है, एक द्विदिश LSTM दोनों दिशाओं में अस्थायी संदर्भ को कैप्चर करता है, और आगे सघन परतें एक नरम मास्क का उत्पादन करने के लिए पूर्ण आवृत्ति रिज़ॉल्यूशन में वापस विस्तारित होती हैं। मास्क को मिश्रण परिमाण से गुणा करने पर अनुमानित स्रोत प्राप्त होता है; मूल चरण का पुन: उपयोग किया जाता है, और एक वीनर फ़िल्टर क्लीनर परिणामों के लिए सभी तनों को संयुक्त रूप से परिष्कृत कर सकता है।
सामरिक प्रभाव
पहुंच और पहुंच
यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।
लागत और बजट
मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।
गति और पैमाना
ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।
ओपन-अनमिक्स म्यूजिक सेपरेशन का भविष्य
ओपन-अनमिक्स को कच्ची गुणवत्ता में डेम्यूक्स और हाइब्रिड स्पेक्ट्रोग्राम-वेवफॉर्म सिस्टम जैसे वेवफॉर्म मॉडल द्वारा पीछे छोड़ दिया गया है, लेकिन एक स्पष्ट, हैक करने योग्य संदर्भ के रूप में इसकी भूमिका इसे शिक्षण और तेजी से प्रोटोटाइप के लिए प्रासंगिक रखती है। शिक्षा में और विवेक-जांच आधार रेखा के रूप में निरंतर उपयोग की अपेक्षा करें, जबकि व्यापक क्षेत्र उच्च-निष्ठा हाइब्रिड और ट्रांसफार्मर-आधारित विभाजकों की ओर बढ़ता है और अधिक, महीन-दानेदार उपकरण श्रेणियों को अलग करने की ओर बढ़ता है।
वास्तविक विश्व कार्यान्वयन
किसी गीत का कराओके या वाद्य संस्करण बनाने के लिए एक पृथक स्वर ट्रैक निकालना।
निर्माताओं द्वारा रीमिक्सिंग और सैंपलिंग के लिए ड्रम या बास स्टेम को बाहर निकालना।
MUSDB18 पर नए पृथक्करण मॉडल के मूल्यांकन के लिए एक प्रतिलिपि प्रस्तुत करने योग्य अनुसंधान आधार रेखा के रूप में कार्य करना।
संगीत के विद्यार्थियों को एक वाद्ययंत्र को अलग करके उसकी भूमिका का मिश्रण में अध्ययन करने देना।
जोखिम और रेलिंग
सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।
उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।
स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।
कार्यान्वयन रोडमैप
वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।
विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।
परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।
जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Open-Unmix Music Separation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
संगीत पृथक्करण
अक्सर पूछे जाने वाले प्रश्नों
What is Open-Unmix Music Separation?
ओपन-अनमिक्स (यूएमएक्स) एक ओपन-सोर्स डीप लर्निंग सिस्टम है जो एक गाने को उसके भागों में विभाजित करता है: स्वर, ड्रम, बास और अन्य वाद्ययंत्र। यह एक प्रतिलिपि प्रस्तुत करने योग्य, संदर्भ-गुणवत्ता वाली आधार रेखा के रूप में मायने रखता है जिसने संगीत स्रोत पृथक्करण को शोधकर्ताओं, संगीतकारों और शौकीनों के लिए सुलभ बना दिया है।
ओपन-अनमिक्स क्या करता है?
ओपन-अनमिक्स एक संगीत स्रोत पृथक्करण प्रणाली है जो मिश्रण को अलग-अलग वाद्ययंत्रों और स्वरों में विभाजित करती है।
ओपन-अनमिक्स के मूल में कौन सा तंत्रिका नेटवर्क है?
ओपन-अनमिक्स पूरी तरह से जुड़े परतों द्वारा लिपटे एक द्विदिश एलएसटीएम का उपयोग करके एक वर्णक्रमीय मुखौटा की भविष्यवाणी करता है।
ओपन-अनमिक्स किस प्रतिनिधित्व पर काम करता है?
यह परिमाण स्पेक्ट्रोग्राम पर काम करता है, मास्क की भविष्यवाणी करता है और पुनर्निर्माण के लिए मिश्रण के चरण का पुन: उपयोग करता है।
ओपन-अनमिक्स किस डेटासेट पर प्रशिक्षित है?
ओपन-अनमिक्स प्रशिक्षण और मूल्यांकन के लिए ओपन MUSDB18 संगीत पृथक्करण डेटासेट का उपयोग करता है।
ओपन-अनमिक्स का मुख्य डिज़ाइन लक्ष्य क्या था?
इसे शीर्ष स्कोरिंग ब्लैक बॉक्स के बजाय एक स्पष्ट, अच्छी तरह से प्रलेखित, प्रतिलिपि प्रस्तुत करने योग्य आधार रेखा के रूप में बनाया गया था।