वेवनेट
2016 में डीपमाइंड द्वारा पेश किया गया वेवनेट, एक सफल तंत्रिका नेटवर्क था जो एक समय में कच्चे ऑडियो का एक नमूना उत्पन्न करता है, जो आश्चर्यजनक रूप से प्राकृतिक भाषण और संगीत का उत्पादन करता है।
सिंहावलोकन
It set the modern standard for high-fidelity text-to-speech.
गहरा गोता
वेवनेट एक ऑटोरेग्रेसिव जेनरेटिव मॉडल है: यह प्रत्येक ऑडियो नमूने को उसके पहले के सभी नमूनों पर आधारित भविष्यवाणी करता है, आमतौर पर प्रति सेकंड 16,000 या 24,000 नमूने। इसका मूल नवप्रवर्तन विस्तृत कारणात्मक संकल्पों का ढेर है। कॉसल का अर्थ है कि मॉडल केवल समय में पीछे की ओर देखता है, पीढ़ी क्रम को संरक्षित करता है; फैलाव का मतलब है कि प्रत्येक परत नमूनों की तेजी से बढ़ती संख्या को छोड़ देती है, इसलिए एक मामूली स्टैक बिना किसी बड़ी लागत के हजारों नमूनों (एक विस्तृत ग्रहणशील क्षेत्र) को कवर करता है। भाषाई विशेषताओं या मेल-स्पेक्ट्रोग्राम पर वातानुकूलित, वेवनेट पूर्ववर्ती और पैरामीट्रिक वोकोडर्स की तुलना में कहीं अधिक प्राकृतिक भाषण उत्पन्न करता है, मानव रिकॉर्डिंग के लिए अधिकांश अंतर को बंद कर देता है और Google असिस्टेंट के शुरुआती संस्करणों को सशक्त बनाता है।
तकनीकी अंतर्दृष्टि
विस्तारित कनवल्शन मुख्य युक्ति है: 1, 2, 4, 8 और इसी तरह की फैलाव दर के साथ, केवल दसियों गहरी परतों वाला एक नेटवर्क हजारों पिछले नमूनों में शामिल हो सकता है, जो बारीक तरंग रूप विवरण और लंबी प्रोसोडिक संरचना दोनों को कैप्चर कर सकता है। आउटपुट प्रत्येक नमूने के मूल्य को एक श्रेणीबद्ध वितरण (मूल रूप से म्यू-लॉ कंपाउंडिंग के माध्यम से 256 स्तर) के रूप में मॉडल करता है, और गेटेड सक्रियण इकाइयाँ प्लस अवशिष्ट और स्किप कनेक्शन इस बहुत गहरे स्टैक के प्रशिक्षण को स्थिर करते हैं।
सामरिक प्रभाव
पहुंच और पहुंच
यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।
लागत और बजट
मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।
गति और पैमाना
ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।
वेवनेट का भविष्य
मूल वेवनेट धीमा था क्योंकि नमूनाकरण अनुक्रमिक है। उत्तराधिकारियों ने इसे ठीक किया: समानांतर वेवनेट और वेवआरएनएन ने वास्तविक समय संश्लेषण को सक्षम किया, और बाद में प्रवाह- और वेवग्लो और हाईफाई-जीएएन जैसे जीएएन-आधारित वोकोडर्स, साथ ही प्रसार वोकोडर्स ने गुणवत्ता और गति को और आगे बढ़ाया। वेवनेट के ऑटोरेग्रेसिव, विस्तारित-कन्वोल्यूशन विचार इन प्रणालियों में रहते हैं और ऑडियो से परे आर्किटेक्चर को प्रभावित करते हैं, जिससे जेनरेटिव मॉडलिंग में इसकी विरासत मजबूत होती है।
वास्तविक विश्व कार्यान्वयन
Google असिस्टेंट और Google क्लाउड टेक्स्ट-टू-स्पीच के लिए प्राकृतिक ध्वनि उत्पन्न करना
एक तंत्रिका वोकोडर के रूप में कार्य करना जो टैकोट्रॉन 2 जैसी टीटीएस पाइपलाइनों में मेल-स्पेक्ट्रोग्राम को तरंग रूपों में बदल देता है
कच्चे ऑडियो से यथार्थवादी पियानो और वाद्य संगीत का संश्लेषण
सुगम्यता उपकरण और ऑडियोबुक कथन के लिए ध्वनि संश्लेषण
जोखिम और रेलिंग
सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।
उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।
स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।
कार्यान्वयन रोडमैप
वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।
विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।
परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।
जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WaveNet quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
ऑडियो डीपफेक डिटेक्शन
अक्सर पूछे जाने वाले प्रश्नों
What is WaveNet?
2016 में डीपमाइंड द्वारा पेश किया गया वेवनेट, एक सफल तंत्रिका नेटवर्क था जो एक समय में कच्चे ऑडियो का एक नमूना उत्पन्न करता है, जो आश्चर्यजनक रूप से प्राकृतिक भाषण और संगीत का उत्पादन करता है। इसने उच्च-निष्ठा वाले टेक्स्ट-टू-स्पीच के लिए आधुनिक मानक स्थापित किया।
वेवनेट ऑडियो कैसे उत्पन्न करता है?
वेवनेट ऑटोरेग्रेसिव है: यह प्रत्येक ऑडियो नमूने की भविष्यवाणी उसके पहले आए नमूनों के आधार पर करता है।
वेवनेट में प्रमुख संकेंद्रित नवाचार क्या है?
विस्तृत कारणात्मक संकल्पन नेटवर्क को केवल समय में पीछे देखते हुए हजारों पिछले नमूनों को कुशलतापूर्वक कवर करने देता है।
फैलाव वेवनेट को क्यों मदद करता है?
तेजी से बढ़ती हुई फैलाव दर अपेक्षाकृत कम परतों वाले हजारों नमूनों पर एक व्यापक ग्रहणशील क्षेत्र प्रदान करती है।
मूल वेवनेट की एक बड़ी व्यावहारिक कमी क्या थी?
क्योंकि प्रत्येक नमूना पिछले नमूने पर निर्भर करता है, पीढ़ी अनुक्रमिक थी और इसलिए धीमी थी, जो पैरेलल वेवनेट और अन्य उत्तराधिकारियों को प्रेरित करती थी।
टेक्स्ट-टू-स्पीच पाइपलाइन में, वेवनेट अक्सर किसके रूप में कार्य करता है?
वेवनेट एक मेल-स्पेक्ट्रोग्राम ले सकता है (उदाहरण के लिए, टैकोट्रॉन 2 से) और अंतिम प्राकृतिक-ध्वनि तरंग उत्पन्न कर सकता है।