ऑडियो एआई गाइड

वेवनेट

2016 में डीपमाइंड द्वारा पेश किया गया वेवनेट, एक सफल तंत्रिका नेटवर्क था जो एक समय में कच्चे ऑडियो का एक नमूना उत्पन्न करता है, जो आश्चर्यजनक रूप से प्राकृतिक भाषण और संगीत का उत्पादन करता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It set the modern standard for high-fidelity text-to-speech.

गहरा गोता

वेवनेट एक ऑटोरेग्रेसिव जेनरेटिव मॉडल है: यह प्रत्येक ऑडियो नमूने को उसके पहले के सभी नमूनों पर आधारित भविष्यवाणी करता है, आमतौर पर प्रति सेकंड 16,000 या 24,000 नमूने। इसका मूल नवप्रवर्तन विस्तृत कारणात्मक संकल्पों का ढेर है। कॉसल का अर्थ है कि मॉडल केवल समय में पीछे की ओर देखता है, पीढ़ी क्रम को संरक्षित करता है; फैलाव का मतलब है कि प्रत्येक परत नमूनों की तेजी से बढ़ती संख्या को छोड़ देती है, इसलिए एक मामूली स्टैक बिना किसी बड़ी लागत के हजारों नमूनों (एक विस्तृत ग्रहणशील क्षेत्र) को कवर करता है। भाषाई विशेषताओं या मेल-स्पेक्ट्रोग्राम पर वातानुकूलित, वेवनेट पूर्ववर्ती और पैरामीट्रिक वोकोडर्स की तुलना में कहीं अधिक प्राकृतिक भाषण उत्पन्न करता है, मानव रिकॉर्डिंग के लिए अधिकांश अंतर को बंद कर देता है और Google असिस्टेंट के शुरुआती संस्करणों को सशक्त बनाता है।

तकनीकी अंतर्दृष्टि

विस्तारित कनवल्शन मुख्य युक्ति है: 1, 2, 4, 8 और इसी तरह की फैलाव दर के साथ, केवल दसियों गहरी परतों वाला एक नेटवर्क हजारों पिछले नमूनों में शामिल हो सकता है, जो बारीक तरंग रूप विवरण और लंबी प्रोसोडिक संरचना दोनों को कैप्चर कर सकता है। आउटपुट प्रत्येक नमूने के मूल्य को एक श्रेणीबद्ध वितरण (मूल रूप से म्यू-लॉ कंपाउंडिंग के माध्यम से 256 स्तर) के रूप में मॉडल करता है, और गेटेड सक्रियण इकाइयाँ प्लस अवशिष्ट और स्किप कनेक्शन इस बहुत गहरे स्टैक के प्रशिक्षण को स्थिर करते हैं।

सामरिक प्रभाव

पहुंच और पहुंच

यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।

लागत और बजट

मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।

गति और पैमाना

ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।

वेवनेट का भविष्य

मूल वेवनेट धीमा था क्योंकि नमूनाकरण अनुक्रमिक है। उत्तराधिकारियों ने इसे ठीक किया: समानांतर वेवनेट और वेवआरएनएन ने वास्तविक समय संश्लेषण को सक्षम किया, और बाद में प्रवाह- और वेवग्लो और हाईफाई-जीएएन जैसे जीएएन-आधारित वोकोडर्स, साथ ही प्रसार वोकोडर्स ने गुणवत्ता और गति को और आगे बढ़ाया। वेवनेट के ऑटोरेग्रेसिव, विस्तारित-कन्वोल्यूशन विचार इन प्रणालियों में रहते हैं और ऑडियो से परे आर्किटेक्चर को प्रभावित करते हैं, जिससे जेनरेटिव मॉडलिंग में इसकी विरासत मजबूत होती है।

वास्तविक विश्व कार्यान्वयन

Google असिस्टेंट और Google क्लाउड टेक्स्ट-टू-स्पीच के लिए प्राकृतिक ध्वनि उत्पन्न करना

एक तंत्रिका वोकोडर के रूप में कार्य करना जो टैकोट्रॉन 2 जैसी टीटीएस पाइपलाइनों में मेल-स्पेक्ट्रोग्राम को तरंग रूपों में बदल देता है

कच्चे ऑडियो से यथार्थवादी पियानो और वाद्य संगीत का संश्लेषण

सुगम्यता उपकरण और ऑडियोबुक कथन के लिए ध्वनि संश्लेषण

जोखिम और रेलिंग

सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।

उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।

स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।

कार्यान्वयन रोडमैप

1

वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।

2

विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।

3

परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।

4

जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WaveNet quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

ऑडियो डीपफेक डिटेक्शन

अक्सर पूछे जाने वाले प्रश्नों

What is WaveNet?

2016 में डीपमाइंड द्वारा पेश किया गया वेवनेट, एक सफल तंत्रिका नेटवर्क था जो एक समय में कच्चे ऑडियो का एक नमूना उत्पन्न करता है, जो आश्चर्यजनक रूप से प्राकृतिक भाषण और संगीत का उत्पादन करता है। इसने उच्च-निष्ठा वाले टेक्स्ट-टू-स्पीच के लिए आधुनिक मानक स्थापित किया।

वेवनेट ऑडियो कैसे उत्पन्न करता है?

वेवनेट ऑटोरेग्रेसिव है: यह प्रत्येक ऑडियो नमूने की भविष्यवाणी उसके पहले आए नमूनों के आधार पर करता है।

वेवनेट में प्रमुख संकेंद्रित नवाचार क्या है?

विस्तृत कारणात्मक संकल्पन नेटवर्क को केवल समय में पीछे देखते हुए हजारों पिछले नमूनों को कुशलतापूर्वक कवर करने देता है।

फैलाव वेवनेट को क्यों मदद करता है?

तेजी से बढ़ती हुई फैलाव दर अपेक्षाकृत कम परतों वाले हजारों नमूनों पर एक व्यापक ग्रहणशील क्षेत्र प्रदान करती है।

मूल वेवनेट की एक बड़ी व्यावहारिक कमी क्या थी?

क्योंकि प्रत्येक नमूना पिछले नमूने पर निर्भर करता है, पीढ़ी अनुक्रमिक थी और इसलिए धीमी थी, जो पैरेलल वेवनेट और अन्य उत्तराधिकारियों को प्रेरित करती थी।

टेक्स्ट-टू-स्पीच पाइपलाइन में, वेवनेट अक्सर किसके रूप में कार्य करता है?

वेवनेट एक मेल-स्पेक्ट्रोग्राम ले सकता है (उदाहरण के लिए, टैकोट्रॉन 2 से) और अंतिम प्राकृतिक-ध्वनि तरंग उत्पन्न कर सकता है।