ऑडियो एआई गाइड

मिमी स्ट्रीमिंग ऑडियो कोडेक

मिमी एक तंत्रिका ऑडियो कोडेक है जो वास्तविक समय में भाषण को अलग-अलग टोकन की एक छोटी धारा में संपीड़ित करता है, इसलिए एआई मॉडल बहुत कम विलंबता के साथ सुन और बोल सकते हैं।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It is the audio backbone behind Kyutai's Moshi voice model.

गहरा गोता

2024 में फ्रांसीसी प्रयोगशाला क्यूताई द्वारा जारी मिमी, एक तंत्रिका कोडेक है जो 24 किलोहर्ट्ज़ ऑडियो को लगभग 1.1 केबीपीएस और केवल 12.5 टोकन प्रति सेकंड पर अलग टोकन की एक धारा में बदल देता है। यह अवशिष्ट वेक्टर परिमाणीकरण (आरवीक्यू) के साथ एक एनकोडर-डिकोडर का उपयोग करता है, जो टोकन को स्व-पर्यवेक्षित भाषण मॉडल (डब्ल्यूएवीएलएम) से आसुत 'सिमेंटिक' प्रथम स्तर के साथ-साथ कई 'ध्वनिक' स्तरों में विभाजित करता है जो आवाज बनावट को पकड़ते हैं। महत्वपूर्ण रूप से यह पूरी तरह से स्ट्रीमिंग और कैज़ुअल है: यह लगभग 80 एमएस विलंबता के साथ, पूर्ण क्लिप की प्रतीक्षा करने के बजाय ऑडियो आने पर टोकन उत्सर्जित करता है। यह एक भाषा मॉडल को पाठ टोकन की तरह भाषण का इलाज करने देता है, जिससे मोशी को पुनर्निर्मित ऑडियो को सुगम और प्राकृतिक रखते हुए पूर्ण डुप्लेक्स में बातचीत करने में सक्षम बनाया जाता है।

तकनीकी अंतर्दृष्टि

मिमी की चाल एक स्प्लिट-आरवीक्यू योजना है। पहली कोडबुक को WavLM से एम्बेडिंग से मेल खाने के लिए आसवन हानि के साथ प्रशिक्षित किया जाता है, जो इसे ध्वन्यात्मक 'अर्थ' ले जाने के लिए मजबूर करता है, जबकि समानांतर ध्वनिक कोडबुक तरंग रूप विवरण का पुनर्निर्माण करती है। एक ट्रांसफार्मर टोंटी के अंदर काम करता है, और डिकोडर पर एक प्रतिकूल (जीएएन) हानि आउटपुट गुणवत्ता को तेज कर देती है। कारणात्मक संवेग हर चीज़ को स्ट्रीम करते रहते हैं, इसलिए विलंबता 80 एमएस के करीब रहती है।

सामरिक प्रभाव

पहुंच और पहुंच

यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।

लागत और बजट

मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।

गति और पैमाना

ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।

मिमी स्ट्रीमिंग ऑडियो कोडेक का भविष्य

उम्मीद है कि मिमी जैसे कोडेक्स ऑडियो और बड़े भाषा मॉडल के बीच मानक इंटरफ़ेस बन जाएंगे, जो वास्तविक समय के वॉयस असिस्टेंट को 100 एमएस से कम प्रतिक्रिया समय की ओर धकेलेंगे। वक्ता की पहचान, भावना और संगीत को संरक्षित करते हुए अनुसंधान टोकन दरों को और भी कम कर रहा है। क्योंकि क्युताई ने मिमी और मोशी को ओपन-सोर्स किया है, इसलिए इसमें कई ओपन स्पीच-टू-स्पीच सिस्टम, ऑन-डिवाइस असिस्टेंट और अल्ट्रा-लो-बैंडविड्थ वॉयस कम्युनिकेशन टूल शामिल होने की संभावना है।

वास्तविक विश्व कार्यान्वयन

क्युताई के मोशी फुल-डुप्लेक्स वॉयस असिस्टेंट को सशक्त बनाना ताकि यह एक साथ सुन और बात कर सके

वास्तविक समय में वाक्-से-वाक् अनुवाद के लिए वाक् टोकन को भाषा मॉडल में स्ट्रीम करना

खराब या भीड़भाड़ वाली नेटवर्क स्थितियों के लिए अल्ट्रा-लो-बिटरेट वॉयस कॉल (~1.1 केबीपीएस)।

जेनरेटिव स्पीच और टेक्स्ट-टू-स्पीच पाइपलाइनों के लिए ऑडियो को टोकनाइज़ करना जो टेक्स्ट की तरह ध्वनि का कारण बनता है

जोखिम और रेलिंग

सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।

उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।

स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।

कार्यान्वयन रोडमैप

1

वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।

2

विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।

3

परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।

4

जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mimi Streaming Audio Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

तंत्रिका ऑडियो कोडेक्स

अक्सर पूछे जाने वाले प्रश्नों

What is Mimi Streaming Audio Codec?

मिमी एक तंत्रिका ऑडियो कोडेक है जो वास्तविक समय में भाषण को अलग-अलग टोकन की एक छोटी धारा में संपीड़ित करता है, इसलिए एआई मॉडल बहुत कम विलंबता के साथ सुन और बोल सकते हैं। यह क्युताई के मोशी वॉयस मॉडल के पीछे ऑडियो बैकबोन है।

किस प्रयोगशाला ने मिमी और मोशी आवाज मॉडल जारी किया?

मिमी और मोशी को 2024 में फ्रांसीसी अनुसंधान प्रयोगशाला क्यूताई द्वारा जारी किया गया था, जिसने दोनों को ओपन-सोर्स किया था।

मिमी भाषण के लिए प्रति सेकंड लगभग कितने टोकन उत्सर्जित करती है?

मिमी 24 kHz ऑडियो को लगभग 1.1 kbps पर केवल 12.5 टोकन प्रति सेकंड तक संपीड़ित करता है।

मिमी में पहली ('सिमेंटिक') कोडबुक क्या दर्शाती है?

पहले आरवीक्यू स्तर को शब्दार्थ/ध्वन्यात्मक सामग्री ले जाने के लिए WavLM से आसवन के माध्यम से प्रशिक्षित किया जाता है, जबकि बाद के स्तरों में ध्वनिक विवरण जोड़ा जाता है।

मिमी को 'स्ट्रीमिंग' या 'कारण' के रूप में क्यों वर्णित किया गया है?

मिमी ऑडियो को यथोचित रूप से संसाधित करती है और टोकन को क्रमिक रूप से आउटपुट करती है, जिससे लाइव बातचीत के लिए उपयुक्त लगभग 80 एमएस विलंबता मिलती है।

ऑडियो को एन्कोड करने के लिए मिमी किस परिमाणीकरण तकनीक का उपयोग करती है?

मिमी अवशिष्ट वेक्टर परिमाणीकरण का उपयोग करता है, कई कोडबुक को स्टैक करता है ताकि प्रत्येक पिछले एक में बेहतर विवरण जोड़ सके।