ऑडियो एआई गाइड

स्वचालित संगीत प्रतिलेखन

स्वचालित संगीत प्रतिलेखन (एएमटी) संगीत की एक कच्ची ऑडियो रिकॉर्डिंग को शीट संगीत, मिडी या पियानो रोल जैसे प्रतीकात्मक संकेतन में परिवर्तित करता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It tackles one of the hardest problems in audio AI: untangling many overlapping notes played at once.

गहरा गोता

एएमटी सिस्टम एक ऑडियो तरंग और आउटपुट को सुनते हैं जो नोट्स बजाए जाते हैं, वे कब शुरू होते हैं, कितने समय तक चलते हैं, और कभी-कभी कौन सा उपकरण उन्हें बजाता है। मुख्य चुनौती पॉलीफोनी है: जब कई नोट एक साथ बजते हैं, तो उनके हार्मोनिक्स ओवरलैप होते हैं और आवृत्ति स्पेक्ट्रम में एक साथ धुंधले हो जाते हैं, इसलिए एक एकल सी और एक जी को एक ही तेज़ नोट से अलग करना मुश्किल हो सकता है। आधुनिक सिस्टम ऑडियो को समय-आवृत्ति प्रतिनिधित्व में परिवर्तित करते हैं जैसे कि मेल-स्पेक्ट्रोग्राम या कॉन्स्टेंट-क्यू ट्रांसफॉर्म, फिर नोट ऑनसेट, ऑफसेट और पिच की भविष्यवाणी करने के लिए गहरे तंत्रिका नेटवर्क का उपयोग करते हैं। Google का ऑनसेट और फ्रेम्स मॉडल पियानो ट्रांसक्रिप्शन के लिए एक मील का पत्थर था, जबकि MT3 जैसे नए ट्रांसफार्मर मॉडल एक साथ कई उपकरणों को ट्रांसक्रिप्ट करते हैं।

तकनीकी अंतर्दृष्टि

एक मुख्य अंतर्दृष्टि शुरुआत का पता लगाने को फ्रेम-स्तरीय पिच का पता लगाने से अलग करना है। ऑनसेट और फ्रेम्स जैसे मॉडल एक नेटवर्क हेड का उपयोग नोट शुरू होने के सटीक क्षण (एक तेज, ऊर्जावान घटना) को देखने के लिए करते हैं और दूसरे नेटवर्क हेड का उपयोग यह ट्रैक करने के लिए करते हैं कि प्रत्येक फ्रेम में कौन सी पिचें बज रही हैं। शुरुआत की भविष्यवाणियां फिर फ़्रेम आउटपुट को गेट करती हैं, नाटकीय रूप से नकली नोटों को कम करती हैं। कॉन्स्टेंट-क्यू ट्रांसफॉर्म मदद करता है क्योंकि यह आवृत्ति डिब्बे को लघुगणकीय रूप से स्थान देता है, यह मिलान करता है कि कैसे संगीतमय पिचों को एक सप्तक के अंतर पर रखा जाता है।

सामरिक प्रभाव

पहुंच और पहुंच

यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।

लागत और बजट

मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।

गति और पैमाना

ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।

स्वचालित संगीत प्रतिलेखन का भविष्य

एएमटी एकल पियानो से विश्वसनीय मल्टी-इंस्ट्रूमेंट और फुल-बैंड ट्रांसक्रिप्शन की ओर बढ़ रहा है, जिसमें ड्रम, वोकल्स और बेंड्स और वाइब्रेटो जैसी अभिव्यंजक तकनीकें शामिल हैं। बड़े सिंथेटिक और संरेखित डेटासेट पर प्रशिक्षित ट्रांसफार्मर आर्किटेक्चर अंतर को कम कर रहे हैं। स्रोत पृथक्करण, लाइव प्रदर्शन के लिए वास्तविक समय प्रतिलेखन और केवल नोट्स ही नहीं बल्कि माइक्रो-टाइमिंग और गतिशीलता को पकड़ने वाले उपकरणों के साथ सख्त एकीकरण की अपेक्षा करें। दीर्घकालिक लक्ष्य एक ऐसी प्रणाली है जो किसी भी रिकॉर्डिंग को संपादन योग्य, मानव-पठनीय स्कोर में बदल देती है।

वास्तविक विश्व कार्यान्वयन

एंथमस्कोर और इसी तरह के ऐप्स कान से गाने सीखने वाले संगीतकारों के लिए एमपी3 रिकॉर्डिंग को संपादन योग्य शीट संगीत में परिवर्तित करते हैं

पियानो रिकॉर्डिंग से MIDI निष्कर्षण ताकि एक निर्माता DAW में प्रदर्शन को फिर से आवाज दे सके या उसकी मात्रा निर्धारित कर सके

संगीत शिक्षा उपकरण जो गलत या छूटे हुए नोट्स को चिह्नित करने के लिए किसी छात्र द्वारा बजाए गए नोट्स की तुलना स्कोर से करते हैं

संगीतज्ञ विश्लेषण के लिए ऐतिहासिक या तात्कालिक रिकॉर्डिंग (जैसे जैज़ सोलो) को नोटेशन में लिपिबद्ध कर रहे हैं

जोखिम और रेलिंग

सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।

उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।

स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।

कार्यान्वयन रोडमैप

1

वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।

2

विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।

3

परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।

4

जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Automatic Music Transcription quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

प्रतीकात्मक संगीत पीढ़ी

अक्सर पूछे जाने वाले प्रश्नों

What is Automatic Music Transcription?

स्वचालित संगीत प्रतिलेखन (एएमटी) संगीत की एक कच्ची ऑडियो रिकॉर्डिंग को शीट संगीत, मिडी या पियानो रोल जैसे प्रतीकात्मक संकेतन में परिवर्तित करता है। यह ऑडियो एआई में सबसे कठिन समस्याओं में से एक से निपटता है: एक साथ चलाए गए कई ओवरलैपिंग नोट्स को सुलझाना।

स्वचालित संगीत प्रतिलेखन मुख्य रूप से क्या आउटपुट देता है?

एएमटी एक ऑडियो रिकॉर्डिंग को एक प्रतीकात्मक संकेतन में परिवर्तित करता है जैसे कि मिडी, एक पियानो रोल, या बजाए गए नोट्स का वर्णन करने वाला शीट संगीत।

पॉलीफोनिक संगीत को लिपिबद्ध करना विशेष रूप से कठिन क्यों है?

जब कई स्वर एक साथ बजते हैं तो उनके हार्मोनिक्स ओवरलैप हो जाते हैं, जिससे यह अलग करना मुश्किल हो जाता है कि कौन सी व्यक्तिगत पिचें मौजूद हैं।

Google के ऑनसेट और फ्रेम्स मॉडल के बारे में क्या उल्लेखनीय था?

ऑनसेट और फ्रेम्स ने सटीक नोट ऑनसेट का पता लगाने के लिए एक हेड का उपयोग किया और निरंतर पिचों के लिए दूसरे हेड का उपयोग किया, जिसमें ऑनसेट फ्रेम आउटपुट को गेट करता था।

कॉन्स्टैंट-क्यू ट्रांसफ़ॉर्म संगीत के लिए क्यों उपयोगी है?

संगीतमय पिचों को लघुगणकीय रूप से स्थान दिया गया है (सप्तक आवृत्ति में दोगुना है), और सीक्यूटी के लॉग-स्थान वाले डिब्बे इसके साथ स्वाभाविक रूप से संरेखित होते हैं।

प्रतिलेखन में 'शुरुआत' का क्या अर्थ है?

शुरुआत वह तीव्र, ऊर्जावान क्षण है जब कोई नोट शुरू होता है, जिसे बनाए रखने की तुलना में सटीक रूप से स्थानीय बनाना आसान होता है।