ऑडियो एआई गाइड

ऑडियोएलएम

ऑडियोएलएम एक Google अनुसंधान ढांचा है जो ध्वनि को एक भाषा की तरह व्यवहार करके और टोकन द्वारा इसकी भविष्यवाणी करके यथार्थवादी ऑडियो - भाषण या पियानो संगीत उत्पन्न करता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.

गहरा गोता

2022 में Google द्वारा पेश किया गया, ऑडियोएलएम ऑडियो पीढ़ी को एक भाषा-मॉडलिंग समस्या के रूप में पुन: प्रस्तुत करता है: यह कच्चे तरंगों को असतत टोकन में परिवर्तित करता है और फिर अगले टोकन की भविष्यवाणी करता है, जैसे एक टेक्स्ट मॉडल अगले शब्द की भविष्यवाणी करता है। इसकी मुख्य चाल टोकन प्रकारों का पदानुक्रम है। 'सिमेंटिक' टोकन (w2v-BERT जैसे मॉडल से) दीर्घकालिक संरचना - ध्वन्यात्मक, वाक्यविन्यास, माधुर्य - को कैप्चर करते हैं, जबकि 'अकॉस्टिक' टोकन (साउंडस्ट्रीम न्यूरल कोडेक से) स्पीकर की पहचान, समय और रिकॉर्डिंग स्थितियों जैसे बारीक विवरण कैप्चर करते हैं। पहले सिमेंटिक टोकन की भविष्यवाणी करके, फिर उन पर ध्वनिक टोकन को कंडीशनिंग करके, ऑडियोएलएम ऐसी निरंतरता उत्पन्न करता है जो मूल आवाज या उपकरण को संरक्षित करते हुए कई सेकंड तक सुसंगत रहती है। भाषण के कुछ सेकंड दिए जाने पर, यह उसी स्वर में बोलना जारी रखता है; पियानो दिया गया है, यह उसी शैली में सुधार करता है।

तकनीकी अंतर्दृष्टि

ऑडियोएलएम को पूरी तरह से ऑडियो पर प्रशिक्षित किया जाता है - कोई प्रतिलेख नहीं। साउंडस्ट्रीम अवशिष्ट वेक्टर परिमाणीकरण के माध्यम से ऑडियो को ध्वनिक टोकन में संपीड़ित करता है, जबकि w2v-BERT मोटे सिमेंटिक टोकन की आपूर्ति करता है। ट्रांसफार्मर भाषा मॉडल का एक ढेर चरणों में टोकन की भविष्यवाणी करता है: संरचना के लिए पहले अर्थ संबंधी, फिर उच्च-निष्ठा पुनर्निर्माण के लिए मोटे और बढ़िया ध्वनिक टोकन। साउंडस्ट्रीम का डिकोडर अंततः पूर्वानुमानित टोकन को एक तरंग रूप में बदल देता है, जिससे ऑडियो उत्पन्न होता है जो स्पीकर की आवाज और छंद को सुसंगत रखता है।

सामरिक प्रभाव

पहुंच और पहुंच

यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।

लागत और बजट

मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।

गति और पैमाना

ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।

ऑडियोएलएम का भविष्य

ऑडियोएलएम का टोकन-आधारित नुस्खा बाद के सिस्टम के लिए आधार बन गया: Google के ऑडियोएलएम विचारों को तेज पीढ़ी के लिए टेक्स्ट-टू-म्यूजिक और साउंडस्टॉर्म के लिए म्यूजिकएलएम में डाला गया, जबकि व्यापक क्षेत्र अब भाषण, संगीत और ध्वनि प्रभावों में सिमेंटिक और ध्वनिक टोकन को मिश्रित करता है। तेज़, वास्तविक समय पीढ़ी, लंबे सुसंगत आउटपुट और मल्टीमॉडल नियंत्रण की अपेक्षा करें जहां पाठ या अन्य सिग्नल पूरी तरह से ऑडियो-प्रशिक्षित मॉडल चलाते हैं। वही तकनीकें वॉयस क्लोनिंग और ऑडियो डीपफेक के बारे में चिंताओं को भी बढ़ाती हैं।

वास्तविक विश्व कार्यान्वयन

प्रतिलेख के बिना उसी वक्ता की आवाज़ और स्वर में एक छोटी भाषण क्लिप जारी रखना

नए पियानो संगीत में सुधार करना जो एक संक्षिप्त रिकॉर्डेड प्रॉम्प्ट की शैली से मेल खाता हो

MusicLM जैसे टेक्स्ट-टू-म्यूजिक सिस्टम के लिए ऑडियो-जेनरेशन रीढ़ के रूप में कार्य करना

भाषण संश्लेषण में अनुसंधान जो एक नमूने से प्रोसोडी और रिकॉर्डिंग ध्वनिकी को संरक्षित करता है

जोखिम और रेलिंग

सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।

उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।

स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।

कार्यान्वयन रोडमैप

1

वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।

2

विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।

3

परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।

4

जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

कीवर्ड स्पॉटिंग और वेक वर्ड्स

अक्सर पूछे जाने वाले प्रश्नों

What is AudioLM?

ऑडियोएलएम एक Google अनुसंधान ढांचा है जो ध्वनि को एक भाषा की तरह व्यवहार करके और टोकन द्वारा इसकी भविष्यवाणी करके यथार्थवादी ऑडियो - भाषण या पियानो संगीत उत्पन्न करता है। यह मायने रखता है क्योंकि इसने दिखाया कि आप बिना किसी पाठ प्रतिलेख या संगीत स्कोर के सुसंगत, प्राकृतिक-ध्वनि वाले ऑडियो निरंतरता का उत्पादन कर सकते हैं।

ऑडियो उत्पन्न करने के लिए AudioLM किस मूल विचार का उपयोग करता है?

ऑडियोएलएम तरंगों को अलग-अलग टोकन में परिवर्तित करता है और उन्हें क्रमिक रूप से भविष्यवाणी करता है, भाषा मॉडल के अगले-टोकन दृष्टिकोण को कच्ची ध्वनि पर लागू करता है।

AudioLM में 'सिमेंटिक' टोकन की क्या भूमिका है?

सिमेंटिक टोकन (w2v-BERT से) उच्च-स्तरीय संरचना और सुसंगतता को एन्कोड करते हैं, जबकि ध्वनिक टोकन बढ़िया ऑडियो विवरण को संभालते हैं।

कौन सा तंत्रिका कोडेक AudioLM के ध्वनिक टोकन उत्पन्न करता है?

साउंडस्ट्रीम ऑडियो को ध्वनिक टोकन में संपीड़ित करने के लिए अवशिष्ट वेक्टर परिमाणीकरण का उपयोग करता है और बाद में पूर्वानुमानित टोकन को तरंग रूप में डिकोड करता है।

AudioLM को प्रशिक्षण डेटा के रूप में क्या चाहिए?

एक उल्लेखनीय विशेषता यह है कि ऑडियोएलएम बिना किसी टेक्स्ट लेबल के पूरी तरह से ऑडियो पर प्रशिक्षण देता है, सीधे ध्वनि से संरचना सीखता है।

AudioLM ध्वनिक टोकन से पहले सिमेंटिक टोकन की भविष्यवाणी क्यों करता है?

पहले स्थूल संरचना उत्पन्न करने से आउटपुट समय के साथ सुसंगत रहता है; उच्च-निष्ठा विवरण जोड़ने के लिए ध्वनिक टोकन को उस संरचना पर वातानुकूलित किया जाता है।