ऑडियो एआई गाइड

RNNoise के साथ भाषण निंदा

RNNoise एक छोटा, तेज़ तंत्रिका नेटवर्क है जो वास्तविक समय में भाषण से पृष्ठभूमि शोर को हटा देता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

Created by Xiph.Org's Jean-Marc Valin, it pairs classic signal processing with a small recurrent network so it runs on ordinary CPUs and even embedded devices.

गहरा गोता

2017 में जारी RNNoise को वॉयस कॉल में कम-विलंबता शोर दमन के लिए डिज़ाइन किया गया था। शुरू से अंत तक सब कुछ सीखने के बजाय, यह भाषण को मानव कान (एक बार्क-जैसे पैमाने) पर आधारित लगभग 22 आवृत्ति बैंडों में विभाजित करता है और प्रति फ्रेम प्रत्येक बैंड के लिए लाभ (0 से 1) का अनुमान लगाने के लिए गेटेड आवर्ती इकाइयों के साथ एक आवर्ती तंत्रिका नेटवर्क का उपयोग करता है। ये लाभ भाषण-प्रधान बैंड को बरकरार रखते हुए शोर बैंड को कम करते हैं। एक पूरक पिच फिल्टर आवाज वाले भाषण के हार्मोनिक्स के बीच अवशिष्ट शोर को साफ करता है। पूरे मॉडल का वजन लगभग 85,000 है, यह एक सीपीयू कोर पर वास्तविक समय से भी तेज चलता है, और बीएसडी लाइसेंस के तहत खुला स्रोत है, यही कारण है कि इसे ओपस कोडेक इकोसिस्टम, मम्बल और ओबीएस स्टूडियो जैसी परियोजनाओं में एकीकृत किया गया था।

तकनीकी अंतर्दृष्टि

मुख्य डिज़ाइन विकल्प कच्चे वर्णक्रमीय डिब्बे के बजाय अवधारणात्मक बैंड लाभ पर काम कर रहा है। प्रति फ्रेम केवल ~22 लाभ मूल्यों की भविष्यवाणी करके, जीआरयू नेटवर्क छोटा रहता है और पुराने वर्णक्रमीय-घटाव विधियों में आम संगीत-शोर कलाकृतियों से बचता है। हाथ से तैयार की गई विशेषताएं (बैंड ऊर्जा, पिच अवधि, पिच सहसंबंध) नेटवर्क को फीड करती हैं, सीखने के साथ डीएसपी ज्ञान का मिश्रण करती हैं। एक अलग आवाज-गतिविधि आउटपुट शुद्ध-शोर फ्रेम के दौरान गेट लाभ में मदद करता है।

सामरिक प्रभाव

पहुंच और पहुंच

यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।

लागत और बजट

मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।

गति और पैमाना

ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।

RNNoise के साथ भाषण निंदा का भविष्य

RNNoise ने हल्के वजन वाले वास्तविक समय संवर्द्धन कार्य की एक लहर को प्रेरित किया; इसका उत्तराधिकारी अनुसंधान (PercepNet, DeepFilterNet) CPU बजट को छोटा रखते हुए गुणवत्ता को उच्चतर बनाता है। डिनोइज़र से अपेक्षा करें कि वे सीधे हेडसेट, श्रवण यंत्र और कॉन्फ्रेंसिंग चिप्स में एम्बेड करें, इको कैंसलेशन और डीरेवरबरेशन के साथ संयोजन करें, और अवधारणात्मक और यहां तक ​​कि जेनरेटर उद्देश्यों का उपयोग करें। जहां भी कम विलंबता, कम शक्ति और ओपन-सोर्स लाइसेंसिंग कच्चे मॉडल के आकार से अधिक मायने रखती है, वहां हाइब्रिड डीएसपी-प्लस-छोटा-नेटवर्क नुस्खा प्रभावशाली रहता है।

वास्तविक विश्व कार्यान्वयन

RNNoise को बंडल करने वाले ऐप्स में वीडियो कॉल के दौरान कीबोर्ड की खड़खड़ाहट और पंखे की गड़गड़ाहट को दबाना।

अंतर्निहित RNNoise शोर-दमन फ़िल्टर के माध्यम से OBS स्टूडियो में स्ट्रीमर के माइक्रोफ़ोन को साफ़ करना।

कम-शक्ति वाले हार्डवेयर पर गेम और मम्बल जैसे वीओआईपी टूल में वॉयस चैट की सुगमता में सुधार।

शोर फ़ील्ड रिकॉर्डिंग को प्रीप्रोसेस करना ताकि डाउनस्ट्रीम वाक् पहचान को एक साफ़ सिग्नल मिल सके।

जोखिम और रेलिंग

सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।

उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।

स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।

कार्यान्वयन रोडमैप

1

वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।

2

विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।

3

परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।

4

जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speech Denoising with RNNoise quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

भाषण पृथक्करण और कॉकटेल पार्टी समस्या

अक्सर पूछे जाने वाले प्रश्नों

What is Speech Denoising with RNNoise?

RNNoise एक छोटा, तेज़ तंत्रिका नेटवर्क है जो वास्तविक समय में भाषण से पृष्ठभूमि शोर को हटा देता है। Xiph.Org के जीन-मार्क वैलिन द्वारा निर्मित, यह क्लासिक सिग्नल प्रोसेसिंग को एक छोटे आवर्ती नेटवर्क के साथ जोड़ता है ताकि यह सामान्य सीपीयू और यहां तक ​​कि एम्बेडेड डिवाइस पर भी चल सके।

RNNoise ऑडियो के प्रत्येक छोटे फ्रेम के लिए मुख्य रूप से क्या भविष्यवाणी करता है?

RNNoise प्रति-बैंड लाभ का अनुमान लगाता है जो प्रत्येक वर्णक्रमीय बिन पर काम करने के बजाय भाषण-प्रधान बैंड को संरक्षित करते हुए शोर-प्रधान बैंड को कमजोर करता है।

RNNoise के मूल में किस प्रकार का तंत्रिका नेटवर्क है?

RNNoise गेटेड रिकरंट यूनिट्स के साथ निर्मित एक कॉम्पैक्ट रिकरंट न्यूरल नेटवर्क का उपयोग करता है, जो इसे छोटा रहते हुए अस्थायी मेमोरी देता है।

RNNoise कच्चे वर्णक्रमीय डिब्बे के बजाय अवधारणात्मक आवृत्ति बैंड का उपयोग क्यों करता है?

केवल ~22 बैंड लाभ की भविष्यवाणी करने से नेटवर्क छोटा, तेज़ रहता है, और संगीत-शोर कलाकृतियों के प्रति कम संवेदनशील रहता है जो प्रति-बिन विधियों को प्रभावित करता है।

RNNoise मॉडल मोटे तौर पर कितना बड़ा है?

RNNoise का वजन लगभग 85,000 है, जो एक सीपीयू कोर पर वास्तविक समय से भी तेज चलने के लिए काफी छोटा है।

RNNoise में पिच फिल्टर की क्या भूमिका है?

एक कंघी/पिच फिल्टर, बैंड के लाभ को पूरक करते हुए, हार्मोनिक्स के बीच बैठे शोर को दबाने के लिए आवाज वाले भाषण की हार्मोनिक संरचना का फायदा उठाता है।