ऑडियो एआई गाइड

MusicLM: पदानुक्रमित सिमेंटिक और ध्वनिक टोकन

MusicLM Google का टेक्स्ट-टू-म्यूजिक मॉडल है जो संगीत संरचना के लिए सिमेंटिक टोकन और ध्वनि विवरण के लिए ध्वनिक टोकन के पदानुक्रम के माध्यम से लंबे समय तक ऑडियो उत्पन्न करता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

गहरा गोता

Google रिसर्च द्वारा 2023 की शुरुआत में घोषित, MusicLM संगीत पीढ़ी को असतत ऑडियो टोकन के अनुक्रमों की भविष्यवाणी के रूप में तैयार करता है, ठीक उसी तरह जैसे एक भाषा मॉडल शब्दों की भविष्यवाणी करता है। यह अभ्यावेदन के पदानुक्रम का उपयोग करता है: सिमेंटिक टोकन (w2v-BERT नामक मॉडल से) लंबे समय तक माधुर्य और लय जैसी उच्च-स्तरीय संरचना को कैप्चर करते हैं, जबकि ध्वनिक टोकन (साउंडस्ट्रीम न्यूरल कोडेक से) समय और बनावट जैसे बारीक विवरण कैप्चर करते हैं। पहला चरण टेक्स्ट प्रॉम्प्ट से सिमेंटिक टोकन उत्पन्न करता है, फिर बाद के चरण उन सिमेंटिक्स पर आधारित ध्वनिक विवरण भरते हैं। टेक्स्ट कंडीशनिंग MuLM/MuLan से आती है, एक संयुक्त संगीत-पाठ एम्बेडिंग प्रशिक्षित ताकि विवरण और ऑडियो एक ही स्थान पर हों। यह चरणबद्ध दृष्टिकोण MusicLM को कुछ सेकंड के बाद बहकने के बजाय मिनटों तक संगीत की दृष्टि से सुसंगत रहने देता है।

तकनीकी अंतर्दृष्टि

मुख्य विचार टोकन पदानुक्रम में संरचना को बनावट से अलग करना है। मोटे सिमेंटिक टोकन विरल और धीमी गति से बदलने वाले होते हैं, इसलिए एक ट्रांसफार्मर एक विशाल अनुक्रम लंबाई के बिना दीर्घकालिक रूप को मॉडल कर सकता है। ध्वनिक टोकन सघन और उच्च-दर वाले होते हैं, लेकिन उन्हें केवल पहले से तय शब्दार्थों के आधार पर भविष्यवाणी करने की आवश्यकता होती है, जिससे प्रत्येक चरण को सुव्यवस्थित बनाया जा सके। साउंडस्ट्रीम का अवशिष्ट वेक्टर परिमाणीकरण स्तरित ध्वनिक कोड उत्पन्न करता है जिसे एक अंतिम डिकोडर 24 किलोहर्ट्ज़ तरंग रूपों में वापस बदल देता है।

सामरिक प्रभाव

पहुंच और पहुंच

यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।

लागत और बजट

मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।

गति और पैमाना

ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।

म्यूज़िकएलएम का भविष्य: पदानुक्रमित सिमेंटिक और ध्वनिक टोकन

MusicLM का पदानुक्रमित टोकन दृष्टिकोण बाद के सिस्टम जैसे MusicGen और वाणिज्यिक संगीत टूल के लिए एक टेम्पलेट बन गया। सख्त मेलोडी कंडीशनिंग (एक धुन गुनगुनाएं, एक पूर्ण व्यवस्था प्राप्त करें), छंद और कोरस के साथ लंबे समय तक पूरी तरह से संरचित गाने, और वाद्ययंत्रों और कुंजी पर बेहतर नियंत्रण की अपेक्षा करें। कांटेदार मुद्दे कानूनी और नैतिक हैं: प्रशिक्षण डेटा लाइसेंसिंग, कलाकार की सहमति, और वॉटरमार्किंग उत्पन्न ऑडियो ताकि इसे मानव निर्मित संगीत से अलग किया जा सके, अब तैनाती के केंद्र में हैं।

वास्तविक विश्व कार्यान्वयन

किसी लिखित दृश्य विवरण को फ़िल्म या ट्रेलर स्कोर में बदलना, उदा. 'गाना बजानेवालों के साथ महाकाव्य आर्केस्ट्रा का निर्माण'

छवि कैप्शन या यहां तक कि कला प्रतिष्ठानों के लिए पेंटिंग विवरण पर आधारित पृष्ठभूमि संगीत उत्पन्न करना

एक छोटी सी गुनगुनाती या सीटी बजाते हुए धुन को पूरी तरह वाद्य यंत्रों वाली व्यवस्था में विस्तारित करना

विज्ञापन और सामग्री निर्माताओं के लिए अलग-अलग गति और मूड में विभिन्न स्टॉक-म्यूजिक ट्रैक का निर्माण करना

जोखिम और रेलिंग

सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।

उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।

स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।

कार्यान्वयन रोडमैप

1

वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।

2

विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।

3

परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।

4

जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

प्रतीकात्मक संगीत पीढ़ी

अक्सर पूछे जाने वाले प्रश्नों

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM Google का टेक्स्ट-टू-म्यूजिक मॉडल है जो संगीत संरचना के लिए सिमेंटिक टोकन और ध्वनि विवरण के लिए ध्वनिक टोकन के पदानुक्रम के माध्यम से लंबे समय तक ऑडियो उत्पन्न करता है।

MusicLM संगीत उत्पन्न करने के कार्य को मौलिक रूप से कैसे संभालता है?

MusicLM संगीत निर्माण को अलग-अलग ऑडियो टोकन पर ऑटोरेग्रेसिव भविष्यवाणी के रूप में तैयार करता है, जैसे एक भाषा मॉडल शब्दों की भविष्यवाणी करता है।

MusicLM में सिमेंटिक टोकन की क्या भूमिका है?

सिमेंटिक टोकन (w2v-BERT से) लंबी अवधि में माधुर्य और लय जैसी मोटे, धीमी गति से बदलने वाली संरचना को पकड़ते हैं।

कौन सा घटक समय और बनावट जैसे बढ़िया ध्वनिक विवरण प्रदान करता है?

ध्वनिक टोकन साउंडस्ट्रीम न्यूरल कोडेक से आते हैं और समय और बनावट जैसे बारीक विवरणों को एनकोड करते हैं।

MusicLM टेक्स्ट प्रॉम्प्ट को संगीतमय ऑडियो से कैसे जोड़ता है?

MuLan को प्रशिक्षित किया जाता है ताकि टेक्स्ट विवरण और ऑडियो मैप को साझा एम्बेडिंग स्थान में आस-पास के बिंदुओं से मिलान किया जा सके, जिससे टेक्स्ट कंडीशनिंग सक्षम हो सके।

पदानुक्रमित, चरणबद्ध डिज़ाइन लंबी दूरी की संरचना में मदद क्यों करता है?

विरल सिमेंटिक टोकन धीरे-धीरे बदलते हैं, इसलिए एक ट्रांसफार्मर सघन ध्वनिक विवरण भरने से पहले कुशलतापूर्वक दीर्घकालिक रूप का मॉडल बना सकता है।