एनकोडेक ऑडियो संपीड़न
एनकोडेक Meta का उच्च-निष्ठा न्यूरल ऑडियो कोडेक है जो भाषण और संगीत को बहुत कम बिटरेट पर गुणवत्ता के साथ संपीड़ित करता है जो कि कहीं अधिक भारी प्रारूपों को टक्कर देता है।
सिंहावलोकन
It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.
गहरा गोता
2022 में Meta AI द्वारा जारी, एनकोडेक एक एनकोडर, एक अवशिष्ट वेक्टर क्वांटाइज़र (आरवीक्यू) और एक डिकोडर प्रशिक्षित अंत से अंत तक साउंडस्ट्रीम ब्लूप्रिंट का अनुसरण करता है, लेकिन कई परिशोधन जोड़ता है। यह एक स्ट्रीमिंग-सक्षम कनवल्शनल एनकोडर, मल्टी-स्केल स्पेक्ट्रोग्राम और टाइम-डोमेन पुनर्निर्माण हानियों और अवधारणात्मक गुणवत्ता के लिए प्रतिकूल विभेदकों का उपयोग करता है। एक उल्लेखनीय योगदान एक छोटा ट्रांसफार्मर-आधारित एन्ट्रॉपी मॉडल है जो गुणवत्ता हानि के बिना अतिरिक्त बिट्स को निचोड़ते हुए, परिमाणित कोड को दोषरहित रूप से संपीड़ित करता है। एनकोडेक एक बैलेंसर भी पेश करता है जो कई प्रतिस्पर्धी प्रशिक्षण घाटे को स्वचालित रूप से मापता है ताकि वे स्थिर रहें। यह 24 किलोहर्ट्ज़ मोनोफोनिक और 48 किलोहर्ट्ज़ स्टीरियो ऑडियो को संभालता है, 1.5, 3, 6 और 12 केबीपीएस जैसे बिटरेट पर काम करता है, और 6 केबीपीएस पर 64 केबीपीएस पर एमपी3 के बराबर गुणवत्ता तक पहुंचता है। इसके टोकन Meta के MusicGen और AudioGen को शक्ति प्रदान करते हैं।
तकनीकी अंतर्दृष्टि
एनकोडेक का एनकोडर स्ट्राइड कनवल्शन के साथ तरंगरूप को एक अव्यक्त अनुक्रम में डाउनसैंपल करता है, जिसे आरवीक्यू स्टैक्ड कोडबुक इंडेक्स में परिवर्तित करता है। एक हल्का ट्रांसफॉर्मर भाषा मॉडल इन टोकन की संभावनाओं की भविष्यवाणी करता है और उन्हें अंकगणित-कोड करता है, और मुफ्त में और संपीड़न पुनर्प्राप्त करता है। प्रशिक्षण बैलेंसर पुनर्निर्माण, वर्णक्रमीय और प्रतिकूल हानियों से क्रमिक योगदान को पुन: मापता है ताकि कोई भी एक शब्द हावी न हो, जो पूर्ण बिटरेट रेंज में बहुउद्देश्यीय प्रशिक्षण को स्थिर रखता है।
सामरिक प्रभाव
पहुंच और पहुंच
यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।
लागत और बजट
मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।
गति और पैमाना
ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।
एनकोडेक ऑडियो संपीड़न का भविष्य
एनकोडेक पहले से ही कई खुले जेनरेटर ऑडियो मॉडल के लिए डिफ़ॉल्ट टोकननाइज़र है, और इसके वंशज कम बिटरेट, पूर्ण स्टीरियो और संगीत-ग्रेड पुनर्निर्माण, और टेक्स्ट-टू-ऑडियो और टेक्स्ट-टू-म्यूज़िक जेनरेटर के साथ सख्त एकीकरण पर उच्च निष्ठा पर जोर दे रहे हैं। कम-बैंडविड्थ संचार, वास्तविक समय स्ट्रीमिंग और मानक 'ऑडियो टोकन' परत के रूप में व्यापक रूप से अपनाने की अपेक्षा करें जो बड़े भाषा-मॉडल-शैली आर्किटेक्चर को ध्वनि पढ़ने और लिखने की सुविधा देता है।
वास्तविक विश्व कार्यान्वयन
Meta के MusicGen और AudioGen टेक्स्ट-टू-ऑडियो जनरेटर के लिए ऑडियो को टोकनाइज़ करना
बैंडविड्थ-सीमित ट्रांसमिशन के लिए 24 kHz भाषण को 1.5-6 kbps तक संपीड़ित करना
बहुत अधिक बिटरेट पर एमपी3 के निकट गुणवत्ता के साथ 48 किलोहर्ट्ज़ स्टीरियो संगीत को एन्कोड करना
जारी चौकियों के माध्यम से अनुसंधान और ऑडियो एमएल पाइपलाइनों के लिए एक ओपन-सोर्स ड्रॉप-इन कोडेक के रूप में कार्य करना
जोखिम और रेलिंग
सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।
उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।
स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।
कार्यान्वयन रोडमैप
वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।
विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।
परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।
जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the EnCodec Audio Compression quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
ऑडियो एंबेडिंग और प्रतिनिधित्व सीखना
अक्सर पूछे जाने वाले प्रश्नों
What is EnCodec Audio Compression?
एनकोडेक Meta का उच्च-निष्ठा न्यूरल ऑडियो कोडेक है जो भाषण और संगीत को बहुत कम बिटरेट पर गुणवत्ता के साथ संपीड़ित करता है जो कि कहीं अधिक भारी प्रारूपों को टक्कर देता है। यह मायने रखता है क्योंकि यह आधुनिक जेनरेटिव ऑडियो सिस्टम को रेखांकित करता है और किसी के भी उपयोग के लिए ओपन-सोर्स फॉर्म में आता है।
एनकोडेक किस संगठन ने जारी किया?
EnCodec को Meta AI (FAIR) द्वारा 2022 में एक उच्च-निष्ठा तंत्रिका ऑडियो कोडेक के रूप में पेश किया गया था।
EnCodec अपने टोकन से हानिरहित रूप से अधिक संपीड़न निचोड़ने के लिए कौन सा अतिरिक्त घटक जोड़ता है?
एनकोडेक टोकन संभावनाओं की भविष्यवाणी करने और उन्हें अंकगणित-कोड करने के लिए एक छोटे ट्रांसफार्मर को प्रशिक्षित करता है, जिससे आरवीक्यू के शीर्ष पर अतिरिक्त दोषरहित संपीड़न प्राप्त होता है।
लगभग 6 केबीपीएस पर, एनकोडेक की गुणवत्ता लगभग किस बिटरेट पर एमपी3 के बराबर बताई गई थी?
6 केबीपीएस पर एनकोडेक 64 केबीपीएस पर एमपी3 के समान व्यक्तिपरक गुणवत्ता तक पहुंचता है, जो एक बड़ी दक्षता लाभ है।
प्रशिक्षण के दौरान एनकोडेक का 'बैलेंसर' किस समस्या का समाधान करता है?
कई नुकसानों (पुनर्निर्माण, वर्णक्रमीय, प्रतिकूल) के साथ, बैलेंसर अपने ग्रेडिएंट्स को फिर से मापता है ताकि कोई भी एक उद्देश्य हावी न हो, जिससे प्रशिक्षण स्थिर हो जाए।
एनकोडेक साउंडस्ट्रीम के साथ कौन सी मुख्य परिमाणीकरण विधि साझा करता है?
साउंडस्ट्रीम की तरह, एनकोडेक स्टैक्ड कोडबुक सूचकांकों में एनकोडर एम्बेडिंग को अलग करने के लिए अवशिष्ट वेक्टर परिमाणीकरण का उपयोग करता है।