ऑडियो एआई गाइड

साउंडस्ट्रीम न्यूरल कोडेक

साउंडस्ट्रीम Google का एंड-टू-एंड न्यूरल ऑडियो कोडेक है जो गुणवत्ता को संरक्षित करते हुए भाषण और संगीत को बेहद कम बिटरेट पर संपीड़ित करता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It matters because it beats traditional codecs like Opus at the same bitrate and powers modern generative audio models.

गहरा गोता

Google द्वारा 2021 में पेश किया गया, साउंडस्ट्रीम एक पूरी तरह से न्यूरल कोडेक है जिसे एक साथ प्रशिक्षित तीन टुकड़ों से बनाया गया है: एक कनवल्शनल एनकोडर जो कच्चे तरंग को वैक्टर के एक कॉम्पैक्ट अनुक्रम में बदल देता है, एक अवशिष्ट वेक्टर क्वांटाइज़र (आरवीक्यू) जो उन वैक्टर को अलग करता है, और एक कनवल्शनल डिकोडर जो तरंग को फिर से बनाता है। इसे पुनर्निर्माण हानियों और GAN-शैली प्रतिकूल विभेदक दोनों के साथ प्रशिक्षित किया गया है, इसलिए आउटपुट केवल संख्यात्मक रूप से बंद होने के बजाय स्वाभाविक लगता है। एक असाधारण विशेषता 'स्केलेबल' या क्वांटाइज़र-ड्रॉपआउट प्रशिक्षण है: एक एकल मॉडल अनुमान के समय अधिक या कम क्वांटाइज़र परतों का उपयोग करके लगभग 3 से 18 केबीपीएस तक बिटरेट पर काम कर सकता है, बिना किसी पुनर्प्रशिक्षण के। 3 केबीपीएस पर यह कथित तौर पर एक मॉडल में सुनने के परीक्षण, भाषण, संगीत और सामान्य ऑडियो को संभालने में 12 केबीपीएस पर ओपस से बेहतर प्रदर्शन करता है जो स्मार्टफोन सीपीयू पर वास्तविक समय में चल सकता है।

तकनीकी अंतर्दृष्टि

तरंगरूप स्ट्राइड कनवल्शन से होकर गुजरता है जो भारी मात्रा में डाउनसैंपल करता है, जिससे प्रति फ्रेम एक एम्बेडिंग उत्पन्न होती है (उदाहरण के लिए 75 फ्रेम/सेकंड)। आरवीक्यू फिर प्रत्येक एम्बेडिंग को कोडबुक सूचकांकों के ढेर के रूप में एन्कोड करता है। बिटरेट फ़्रेम दर गुणा सक्रिय क्वांटाइज़र की संख्या गुणा बिट्स प्रति कोडबुक के बराबर है। क्वांटाइज़र ड्रॉपआउट प्रशिक्षण के दौरान आरवीक्यू स्टैक को बेतरतीब ढंग से छोटा कर देता है, जिससे पहले की कोडबुक को सबसे महत्वपूर्ण जानकारी ले जाने के लिए मजबूर किया जाता है ताकि कोडेक कम दरों पर शानदार ढंग से खराब हो जाए।

सामरिक प्रभाव

पहुंच और पहुंच

यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।

लागत और बजट

मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।

गति और पैमाना

ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।

साउंडस्ट्रीम न्यूरल कोडेक का भविष्य

साउंडस्ट्रीम ने टेम्पलेट स्थापित किया जिसे बाद में एनकोडेक और डीएसी जैसे कोडेक्स को परिष्कृत किया गया, और इसके अलग-अलग टोकन ऑडियोएलएम और म्यूजिकएलएम जैसे जेनरेटर सिस्टम के लिए सब्सट्रेट बन गए। उम्मीद है कि वंशज और भी कम बिटरेट की ओर बढ़ेंगे, शब्दार्थ रूप से संरचित टोकन जो भाषा-मॉडल-शैली ऑडियो जेनरेटर के इनपुट के रूप में दोगुने होते हैं, और लाइव कॉल, श्रवण सहायता और स्ट्रीमिंग के लिए डिवाइस पर कड़ी तैनाती होती है जहां बैंडविड्थ और विलंबता सख्ती से सीमित होती है।

वास्तविक विश्व कार्यान्वयन

उच्च बिटरेट पर लीगेसी कोडेक्स की तुलना में स्पष्ट ध्वनि के साथ वॉयस कॉल को ~3 केबीपीएस पर संपीड़ित करना

असतत ऑडियो टोकन उत्पन्न करना जो Google के AudioLM और MusicLM जेनरेटर मॉडल को फ़ीड करता है

ऑन-सीपीयू एन्कोडिंग और डिकोडिंग के साथ मोबाइल उपकरणों पर वास्तविक समय कम बैंडविड्थ ऑडियो स्ट्रीमिंग

संगीत और परिवेशीय ध्वनि को एक ही मॉडल में कुशलतापूर्वक संग्रहीत या प्रसारित करना जो सभी प्रकार की सामग्री को संभालता है

जोखिम और रेलिंग

सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।

उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।

स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।

कार्यान्वयन रोडमैप

1

वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।

2

विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।

3

परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।

4

जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStream Neural Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

तंत्रिका ऑडियो कोडेक्स

अक्सर पूछे जाने वाले प्रश्नों

What is SoundStream Neural Codec?

साउंडस्ट्रीम Google का एंड-टू-एंड न्यूरल ऑडियो कोडेक है जो गुणवत्ता को संरक्षित करते हुए भाषण और संगीत को बेहद कम बिटरेट पर संपीड़ित करता है। यह मायने रखता है क्योंकि यह ओपस जैसे पारंपरिक कोडेक्स को समान बिटरेट पर मात देता है और आधुनिक जेनरेटिव ऑडियो मॉडल को शक्ति प्रदान करता है।

साउंडस्ट्रीम आर्किटेक्चर को कौन से तीन घटक बनाते हैं?

साउंडस्ट्रीम एक कन्वेन्शनल एनकोडर, एक अवशिष्ट वेक्टर क्वांटाइज़र से बनाया गया है जो एम्बेडिंग को अलग करता है, और एक कन्वेन्शनल डिकोडर, सभी को अंत से अंत तक प्रशिक्षित किया जाता है।

कौन सी तकनीक एक एकल साउंडस्ट्रीम मॉडल को पुनः प्रशिक्षण के बिना कई अलग-अलग बिटरेट प्रदान करने देती है?

प्रशिक्षण के दौरान, साउंडस्ट्रीम बेतरतीब ढंग से क्वांटाइज़र परतों को गिरा देता है ताकि अनुमान के समय आप एक मॉडल से विभिन्न बिटरेट को हिट करने के लिए अधिक या कम आरवीक्यू स्तरों का उपयोग कर सकें।

Google के श्रवण परीक्षणों में, 3 केबीपीएस पर साउंडस्ट्रीम को 12 केबीपीएस पर किस कोडेक से बेहतर प्रदर्शन करने की सूचना मिली थी?

केवल 3 केबीपीएस पर साउंडस्ट्रीम व्यक्तिपरक गुणवत्ता मूल्यांकन में 12 केबीपीएस पर चलने वाले व्यापक रूप से उपयोग किए जाने वाले ओपस कोडेक से मेल खाता है या हरा देता है।

आउटपुट ध्वनि को प्राकृतिक बनाने के लिए साउंडस्ट्रीम किस प्रकार के अतिरिक्त प्रशिक्षण सिग्नल का उपयोग करता है?

पुनर्निर्माण के नुकसान से परे, साउंडस्ट्रीम प्रतिकूल (जीएएन) विभेदकों का उपयोग करता है ताकि पुनर्निर्माण केवल संख्यात्मक रूप से करीब होने के बजाय अवधारणात्मक रूप से यथार्थवादी लगे।

साउंडस्ट्रीम की बिटरेट उसके क्वांटाइज़र से कैसे संबंधित है?

सक्रिय आरवीक्यू परतों की संख्या के साथ बिटरेट स्केल (प्रति कोडबुक समय फ्रेम दर गुणा बिट्स), इसलिए क्वांटाइज़र जोड़ने से बिटरेट और गुणवत्ता बढ़ जाती है।