ऑडियो एआई गाइड

ज्यूकबॉक्स

ज्यूकबॉक्स OpenAI का 2020 न्यूरल नेटवर्क है जो विशिष्ट कलाकारों की शैली में गायन की आवाज़, वाद्ययंत्र और यहां तक ​​​​कि गीत के साथ कच्चा संगीत ऑडियो उत्पन्न करता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.

गहरा गोता

अप्रैल 2020 में OpenAI द्वारा जारी, ज्यूकबॉक्स संगीत को प्रतीकात्मक नोट्स के बजाय कच्चे ऑडियो के रूप में उत्पन्न करता है, जिसका अर्थ है कि यह स्वर सहित वास्तविक ध्वनि उत्पन्न करता है। इसे वेब से निकाले गए लगभग 1.2 मिलियन गानों (लगभग आधी अंग्रेजी भाषा) पर प्रशिक्षित किया गया था, जिसे LyricWiki के बोल और मेटाडेटा के साथ जोड़ा गया था। आप इसे एक शैली, एक कलाकार की शैली और गीत पर आधारित कर सकते हैं, और यह उस कलाकार की तरह पहचानने योग्य (यदि धुंधला हो तो) गाएगा। आउटपुट कई मिनट लंबे चलते हैं। पकड़ गति और निष्ठा है: पीढ़ी बेहद धीमी थी, एक मिनट के ऑडियो को प्रस्तुत करने में लगभग नौ घंटे लग गए, और परिणामों में दबी हुई, शोर की गुणवत्ता थी। ज्यूकबॉक्स एक शोध था, कोई परिष्कृत उत्पाद नहीं, लेकिन इसने जो संभव था उसकी अपेक्षाओं को नया रूप दिया।

तकनीकी अंतर्दृष्टि

ज्यूकबॉक्स तीन समय रिज़ॉल्यूशन पर वीक्यू-वीएई ऑटोएन्कोडर्स का उपयोग करके कच्चे ऑडियो को संपीड़ित करता है, एक लंबी तरंग को अलग कोड के बहुत छोटे अनुक्रम में बदल देता है। ऑटोरेग्रेसिव ट्रांसफॉर्मर कलाकार, शैली और गीत के आधार पर एक-एक करके इन कोडों की भविष्यवाणी करते हैं, और अपसैंपलर उच्च-आवृत्ति विवरण जोड़ते हैं। निचले स्तर के कोड को 44.1 kHz तरंगरूप में डिकोड करने से पीढ़ी इतनी धीमी हो जाती है, क्योंकि लाखों ऑडियो नमूने क्रमिक रूप से तैयार किए जाने चाहिए।

सामरिक प्रभाव

पहुंच और पहुंच

यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।

लागत और बजट

मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।

गति और पैमाना

ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।

ज्यूकबॉक्स का भविष्य

ज्यूकबॉक्स अपने आप में अब काफी हद तक एक ऐतिहासिक मील का पत्थर है, जो तेजी से प्रसार और सुनो और उडियो जैसे अव्यक्त-ऑडियो मॉडल द्वारा प्रतिस्थापित किया गया है जो सेकंड में लगभग सीडी-गुणवत्ता वाले गाने उत्पन्न करते हैं। इसके मूल विचार - अलग-अलग ऑडियो टोकन और गीत पर कंडीशनिंग - आधुनिक प्रणालियों में रहते हैं। उम्मीद है कि भविष्य के रॉ-ऑडियो मॉडल पीढ़ी के समय को कम करते रहेंगे, स्वर की स्पष्टता को बढ़ाएंगे, और बढ़िया नियंत्रण जोड़ेंगे, जबकि ज्यूकबॉक्स द्वारा कॉपीराइट रिकॉर्डिंग पर प्रशिक्षण के बारे में सबसे पहले उठाए गए कॉपीराइट प्रश्न केवल जोर से बढ़ते हैं।

वास्तविक विश्व कार्यान्वयन

शोधकर्ता अध्ययन कर रहे हैं कि कैसे तंत्रिका नेटवर्क एक संदर्भ वास्तुकला के रूप में ज्यूकबॉक्स का उपयोग करके लंबे प्रारूप वाले कच्चे ऑडियो और गायन की आवाजों को मॉडल कर सकते हैं।

संगीतकार और शौकीन लोग भयानक, लो-फाई 'एआई कवर' तैयार कर रहे हैं जो चुने हुए कलाकार की रफ शैली में नए गीत गाते हैं।

शिक्षक MIDI-शैली नोट निर्माण से स्वर के साथ पूर्ण कच्चे-ऑडियो संश्लेषण तक की छलांग का प्रदर्शन कर रहे हैं।

ध्वनि डिजाइनर और प्रयोगात्मक कलाकार रीमिक्सिंग और कोलाज के लिए कच्चे माल के रूप में ज्यूकबॉक्स की धुंधली, स्वप्न जैसी बनावट का उपयोग कर रहे हैं।

जोखिम और रेलिंग

सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।

उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।

स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।

कार्यान्वयन रोडमैप

1

वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।

2

विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।

3

परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।

4

जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jukebox quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

प्रतीकात्मक संगीत पीढ़ी

अक्सर पूछे जाने वाले प्रश्नों

What is Jukebox?

ज्यूकबॉक्स OpenAI का 2020 न्यूरल नेटवर्क है जो विशिष्ट कलाकारों की शैली में गायन की आवाज़, वाद्ययंत्र और यहां तक ​​कि गीत के साथ कच्चा संगीत ऑडियो उत्पन्न करता है। यह एक ऐतिहासिक प्रमाण था कि एआई केवल नोट्स ही नहीं, बल्कि गीत-लंबाई वाले संगीत की वास्तविक तरंग को भी मॉडल कर सकता है।

ज्यूकबॉक्स को पहले के प्रतीकात्मक संगीत AI जैसे सिस्टम से क्या अलग बनाता है जो MIDI आउटपुट करता है?

ज्यूकबॉक्स संगीत की वास्तविक ध्वनि को कच्चे ऑडियो के रूप में मॉडल करता है, इसलिए यह प्रतीकात्मक प्रणालियों के विपरीत, जो केवल नोट डेटा आउटपुट करता है, स्वर और वाद्य यंत्र का उत्पादन कर सकता है।

ज्यूकबॉक्स किसने और लगभग कब जारी किया?

OpenAI ने गायन के साथ संगीत उत्पन्न करने के लिए एक शोध मॉडल के रूप में अप्रैल 2020 में ज्यूकबॉक्स जारी किया।

ज्यूकबॉक्स की एक प्रमुख व्यावहारिक सीमा क्या थी?

क्योंकि यह नमूने द्वारा कच्चे ऑडियो नमूने को डिकोड करता है, ज्यूकबॉक्स ने एक मिनट का संगीत तैयार करने में नौ घंटे का समय लिया, जिससे यह वास्तविक समय के उपयोग के लिए अव्यावहारिक हो गया।

ज्यूकबॉक्स अपने ट्रांसफॉर्मर के लिए लंबे कच्चे ऑडियो को प्रबंधनीय बनाने के लिए किस मुख्य तकनीक का उपयोग करता है?

ज्यूकबॉक्स तरंगरूप को अलग-अलग टोकन में संपीड़ित करने के लिए वीक्यू-वीएई ऑटोएन्कोडर्स का उपयोग करता है, जिसे ट्रांसफॉर्मर ऑडियो में वापस अपसैंपलिंग करने से पहले ऑटोरेग्रेसिव रूप से मॉडल करते हैं।

आप ज्यूकबॉक्स के आउटपुट को किस शर्त पर रख सकते हैं?

ज्यूकबॉक्स एक शैली, नकल करने के लिए एक कलाकार और गीत को स्वीकार करता है, और उन शब्दों को उस शैली में गाने का प्रयास करेगा।