ऑडियो एआई गाइड

ओपन-अनमिक्स संगीत पृथक्करण

ओपन-अनमिक्स (यूएमएक्स) एक ओपन-सोर्स डीप लर्निंग सिस्टम है जो एक गाने को उसके भागों में विभाजित करता है: स्वर, ड्रम, बास और अन्य वाद्ययंत्र।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters as a reproducible, reference-quality baseline that made music source separation accessible to researchers, musicians, and hobbyists.

गहरा गोता

2019 में स्टोटर, उहलिच, लिउटकस और मित्सुफुजी द्वारा जारी, ओपन-अनमिक्स को जानबूझकर PyTorch (टेन्सरफ्लो और एनएनएब्ला पोर्ट के साथ) में एक पारदर्शी, अच्छी तरह से प्रलेखित बेसलाइन के रूप में बनाया गया था। यह मिश्रण के परिमाण स्पेक्ट्रोग्राम पर प्रति लक्ष्य स्टेम एक मॉडल को प्रशिक्षित करता है। कोर एक तीन-परत द्विदिशात्मक LSTM है जो पूरी तरह से जुड़ी हुई परतों से लिपटा हुआ है, जो लक्ष्य स्रोत के लिए एक वर्णक्रमीय मुखौटा की भविष्यवाणी करता है। क्योंकि यह परिमाण पर काम करता है, यह मिश्रण के चरण का पुन: उपयोग करता है और व्युत्क्रम एसटीएफटी के माध्यम से स्टेम का पुनर्निर्माण करता है, वैकल्पिक रूप से मल्टीचैनल वीनर फ़िल्टर के साथ परिष्कृत किया जाता है। खुले MUSDB18 डेटासेट पर प्रशिक्षित, यह शीर्ष लीडरबोर्ड स्कोर का पीछा नहीं करता है; इसका लक्ष्य स्पष्टता और पुनरुत्पादकता है, जो समुदाय को तुलना का एक भरोसेमंद बिंदु और निर्माण के लिए एक आधार प्रदान करता है।

तकनीकी अंतर्दृष्टि

प्रत्येक स्टेम का अपना नेटवर्क होता है जो इनपुट परिमाण स्पेक्ट्रोग्राम पर काम करता है। फ़्रीक्वेंसी डिब्बे को एक सघन परत द्वारा मानकीकृत और आयामीता-कम किया जाता है, एक द्विदिश LSTM दोनों दिशाओं में अस्थायी संदर्भ को कैप्चर करता है, और आगे सघन परतें एक नरम मास्क का उत्पादन करने के लिए पूर्ण आवृत्ति रिज़ॉल्यूशन में वापस विस्तारित होती हैं। मास्क को मिश्रण परिमाण से गुणा करने पर अनुमानित स्रोत प्राप्त होता है; मूल चरण का पुन: उपयोग किया जाता है, और एक वीनर फ़िल्टर क्लीनर परिणामों के लिए सभी तनों को संयुक्त रूप से परिष्कृत कर सकता है।

सामरिक प्रभाव

पहुंच और पहुंच

यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।

लागत और बजट

मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।

गति और पैमाना

ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।

ओपन-अनमिक्स म्यूजिक सेपरेशन का भविष्य

ओपन-अनमिक्स को कच्ची गुणवत्ता में डेम्यूक्स और हाइब्रिड स्पेक्ट्रोग्राम-वेवफॉर्म सिस्टम जैसे वेवफॉर्म मॉडल द्वारा पीछे छोड़ दिया गया है, लेकिन एक स्पष्ट, हैक करने योग्य संदर्भ के रूप में इसकी भूमिका इसे शिक्षण और तेजी से प्रोटोटाइप के लिए प्रासंगिक रखती है। शिक्षा में और विवेक-जांच आधार रेखा के रूप में निरंतर उपयोग की अपेक्षा करें, जबकि व्यापक क्षेत्र उच्च-निष्ठा हाइब्रिड और ट्रांसफार्मर-आधारित विभाजकों की ओर बढ़ता है और अधिक, महीन-दानेदार उपकरण श्रेणियों को अलग करने की ओर बढ़ता है।

वास्तविक विश्व कार्यान्वयन

किसी गीत का कराओके या वाद्य संस्करण बनाने के लिए एक पृथक स्वर ट्रैक निकालना।

निर्माताओं द्वारा रीमिक्सिंग और सैंपलिंग के लिए ड्रम या बास स्टेम को बाहर निकालना।

MUSDB18 पर नए पृथक्करण मॉडल के मूल्यांकन के लिए एक प्रतिलिपि प्रस्तुत करने योग्य अनुसंधान आधार रेखा के रूप में कार्य करना।

संगीत के विद्यार्थियों को एक वाद्ययंत्र को अलग करके उसकी भूमिका का मिश्रण में अध्ययन करने देना।

जोखिम और रेलिंग

सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।

उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।

स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।

कार्यान्वयन रोडमैप

1

वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।

2

विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।

3

परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।

4

जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Open-Unmix Music Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Open-Unmix Music Separation?

ओपन-अनमिक्स (यूएमएक्स) एक ओपन-सोर्स डीप लर्निंग सिस्टम है जो एक गाने को उसके भागों में विभाजित करता है: स्वर, ड्रम, बास और अन्य वाद्ययंत्र। यह एक प्रतिलिपि प्रस्तुत करने योग्य, संदर्भ-गुणवत्ता वाली आधार रेखा के रूप में मायने रखता है जिसने संगीत स्रोत पृथक्करण को शोधकर्ताओं, संगीतकारों और शौकीनों के लिए सुलभ बना दिया है।

ओपन-अनमिक्स क्या करता है?

ओपन-अनमिक्स एक संगीत स्रोत पृथक्करण प्रणाली है जो मिश्रण को अलग-अलग वाद्ययंत्रों और स्वरों में विभाजित करती है।

ओपन-अनमिक्स के मूल में कौन सा तंत्रिका नेटवर्क है?

ओपन-अनमिक्स पूरी तरह से जुड़े परतों द्वारा लिपटे एक द्विदिश एलएसटीएम का उपयोग करके एक वर्णक्रमीय मुखौटा की भविष्यवाणी करता है।

ओपन-अनमिक्स किस प्रतिनिधित्व पर काम करता है?

यह परिमाण स्पेक्ट्रोग्राम पर काम करता है, मास्क की भविष्यवाणी करता है और पुनर्निर्माण के लिए मिश्रण के चरण का पुन: उपयोग करता है।

ओपन-अनमिक्स किस डेटासेट पर प्रशिक्षित है?

ओपन-अनमिक्स प्रशिक्षण और मूल्यांकन के लिए ओपन MUSDB18 संगीत पृथक्करण डेटासेट का उपयोग करता है।

ओपन-अनमिक्स का मुख्य डिज़ाइन लक्ष्य क्या था?

इसे शीर्ष स्कोरिंग ब्लैक बॉक्स के बजाय एक स्पष्ट, अच्छी तरह से प्रलेखित, प्रतिलिपि प्रस्तुत करने योग्य आधार रेखा के रूप में बनाया गया था।