ऑडियो एआई गाइड

VALL-E और कोडेक भाषा मॉडल

VALL-E ने ऑडियो कोडेक टोकन पर भाषा मॉडलिंग समस्या के रूप में टेक्स्ट-टू-स्पीच को फिर से तैयार किया, जिससे नमूने के केवल तीन सेकंड से आवाज क्लोनिंग सक्षम हो गई।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.

गहरा गोता

2023 की शुरुआत में Microsoft द्वारा घोषित, VALL-E भाषण संश्लेषण को भाषा मॉडलिंग की तरह मानता है। एक स्पेक्ट्रोग्राम की भविष्यवाणी करने के बजाय, यह एक तंत्रिका कोडेक (एनकोडेक) के असतत ध्वनिक टोकन की भविष्यवाणी करता है, इसलिए पीढ़ी एक ऑडियो शब्दावली पर अगली-टोकन भविष्यवाणी बन जाती है। एक अनदेखे स्पीकर और लक्ष्य पाठ की 3-सेकंड की रिकॉर्डिंग को देखते हुए, VALL-E उस स्पीकर की आवाज़ में जारी रहता है, समय और यहां तक ​​कि ध्वनिक वातावरण को भी संरक्षित करता है। इसे लगभग 60,000 घंटों के भाषण पर प्रशिक्षित किया गया था, जो सामान्य टीटीएस डेटासेट से काफी अधिक था, जिसने इसे मजबूत शून्य-शॉट क्लोनिंग प्रदान की। क्योंकि कोडेक टोकन स्तरित होते हैं (आरवीक्यू के माध्यम से), VALL-E दो चरणों का उपयोग करता है: एक ऑटोरेग्रेसिव मॉडल पहले की भविष्यवाणी करता है, मोटे टोकन स्ट्रीम को प्रॉम्प्ट पर वातानुकूलित किया जाता है, और एक गैर-ऑटोरेग्रेसिव मॉडल शेष विवरण टोकन भरता है। इस कोडेक-एलएम रेसिपी ने VALL-E 2 और कई स्पीच फाउंडेशन मॉडल जैसे उत्तराधिकारियों को प्रेरित किया।

तकनीकी अंतर्दृष्टि

चाल पदानुक्रमित कोडेक टोकन पर हाइब्रिड डिकोडिंग है। ऑटोरेग्रेसिव चरण एक समय में सबसे महत्वपूर्ण प्रथम-कोडबुक टोकन की भविष्यवाणी करता है, छंद और सामग्री को कैप्चर करता है। शेष कोडबुक, जो बढ़िया ध्वनिक विवरण जोड़ते हैं, की भविष्यवाणी पहली स्ट्रीम और स्पीकर प्रॉम्प्ट पर वातानुकूलित एक गैर-ऑटोरेग्रेसिव मॉडल द्वारा समानांतर में की जाती है। यह विभाजन प्रत्येक टोकन को क्रमिक रूप से उत्पन्न करने की लागत से बचते हुए गुणवत्ता को उच्च रखता है, और एक कोडेक का उपयोग करने का मतलब है कि भाषण और पाठ को एक ही ट्रांसफार्मर मशीनरी के साथ मॉडल किया जा सकता है।

सामरिक प्रभाव

पहुंच और पहुंच

यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।

लागत और बजट

मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।

गति और पैमाना

ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।

VALL-E और कोडेक भाषा मॉडल का भविष्य

कोडेक भाषा मॉडल भाषण को बड़े भाषा मॉडल के साथ विलय कर रहे हैं, जो एकीकृत प्रणालियों की ओर इशारा करते हैं जो एक मॉडल में सुनते हैं, तर्क करते हैं और बोलते हैं। बेहतर स्थिरता और कम कलाकृतियों, वास्तविक समय स्ट्रीमिंग पीढ़ी और भावना और शैली पर सख्त नियंत्रण की अपेक्षा करें। वही शक्तिशाली क्लोनिंग जो VALL-E को एक्सेसिबिलिटी और डबिंग के लिए उपयोगी बनाती है, डीपफेक और सहमति संबंधी चिंताओं को भी बढ़ाती है, इसलिए वॉटरमार्किंग, आवाज-सत्यापन सुरक्षा उपाय और नीति रेलिंग इन प्रणालियों को कैसे तैनात किया जाता है इसका एक केंद्रीय हिस्सा बन रहे हैं।

वास्तविक विश्व कार्यान्वयन

वैयक्तिकृत सहायकों या एक्सेसिबिलिटी टूल के लिए कुछ सेकंड के ऑडियो से एक आवाज की क्लोनिंग करना जो खोई हुई आवाज को बहाल करता है

मूल वक्ता के समय को बरकरार रखते हुए वीडियो को अन्य भाषाओं में स्थानीयकृत और डब करना

अभिव्यंजक, संदर्भ-मिलान कथन उत्पन्न करना जो रिकॉर्डिंग के ध्वनिक वातावरण को संरक्षित करता है

मल्टीमॉडल सहायकों में भाषण रीढ़ की हड्डी के रूप में कार्य करना जो बोले गए ऑडियो को समझता और उत्पन्न करता है

जोखिम और रेलिंग

सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।

उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।

स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।

कार्यान्वयन रोडमैप

1

वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।

2

विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।

3

परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।

4

जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VALL-E and Codec Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

बड़े भाषा मॉडल की उभरती क्षमताएँ

अक्सर पूछे जाने वाले प्रश्नों

What is VALL-E and Codec Language Models?

VALL-E ने ऑडियो कोडेक टोकन पर भाषा मॉडलिंग समस्या के रूप में टेक्स्ट-टू-स्पीच को फिर से तैयार किया, जिससे नमूने के केवल तीन सेकंड से आवाज क्लोनिंग सक्षम हो गई। इससे पता चला कि वही नेक्स्ट-टोकन प्रेडिक्शन पॉवरिंग टेक्स्ट एलएलएम उल्लेखनीय रूप से प्राकृतिक, अभिव्यंजक भाषण उत्पन्न कर सकता है।

कौन सा मूल विचार VALL-E को पहले के टेक्स्ट-टू-स्पीच सिस्टम से अलग करता है?

VALL-E ने अलग-अलग ऑडियो कोडेक टोकन पर टीटीएस को अगली-टोकन भविष्यवाणी के रूप में फिर से परिभाषित किया, भाषण पीढ़ी को एक भाषा मॉडल की तरह माना।

नए स्पीकर की आवाज को क्लोन करने के लिए VALL-E को कितने संदर्भ ऑडियो की आवश्यकता है?

VALL-E एक अनदेखे स्पीकर के लगभग 3-सेकंड के नमूने से शून्य-शॉट वॉयस क्लोनिंग कर सकता है।

VALL-E अपने ऑडियो टोकन बनाने के लिए किस न्यूरल कोडेक का उपयोग करता है?

VALL-E Meta के EnCodec पर निर्माण करता है, जो भाषण को संश्लेषित करने के लिए अपने असतत ध्वनिक टोकन की भविष्यवाणी करता है।

VALL-E ऑटोरेग्रेसिव और नॉन-ऑटोरेग्रेसिव दोनों चरणों का उपयोग क्यों करता है?

कोडेक टोकन आरवीक्यू के माध्यम से पदानुक्रमित हैं; VALL-E दक्षता के लिए पहली मोटे स्ट्रीम को स्वचालित रूप से और शेष विवरण टोकन को समानांतर में भविष्यवाणी करता है।

मजबूत शून्य-शॉट क्लोनिंग को सक्षम करने के लिए VALL-E को मोटे तौर पर कितने भाषण डेटा पर प्रशिक्षित किया गया था?

VALL-E को लगभग 60,000 घंटों के भाषण पर प्रशिक्षित किया गया था, जो सामान्य टीटीएस डेटासेट से कहीं अधिक था, जिसने इसके शून्य-शॉट सामान्यीकरण को बढ़ावा दिया।