ممی اسٹریمنگ آڈیو کوڈیک
ممی ایک نیورل آڈیو کوڈیک ہے جو ریئل ٹائم میں مجرد ٹوکنز کے ایک چھوٹے سے سلسلے میں تقریر کو کمپریس کرتا ہے، لہذا AI ماڈل بہت کم تاخیر کے ساتھ سن اور بول سکتے ہیں۔
جائزہ
It is the audio backbone behind Kyutai's Moshi voice model.
گہرا غوطہ
Mimi، جسے فرانسیسی لیب Kyutai نے 2024 میں جاری کیا، ایک نیورل کوڈیک ہے جو 24 kHz آڈیو کو تقریباً 1.1 kbps اور صرف 12.5 ٹوکن فی سیکنڈ میں مجرد ٹوکنز کی ایک ندی میں بدل دیتا ہے۔ یہ بقایا ویکٹر کوانٹائزیشن (RVQ) کے ساتھ ایک انکوڈر-ڈیکوڈر کا استعمال کرتا ہے، ٹوکنز کو ایک 'Semantic' فرسٹ لیول میں تقسیم کرتا ہے جو خود زیر نگرانی اسپیچ ماڈل (WavLM) کے علاوہ کئی 'صوتی' لیولز سے کشید کرتا ہے جو آواز کی ساخت کو حاصل کرتے ہیں۔ اہم طور پر یہ مکمل طور پر سلسلہ بندی اور کارآمد ہے: تقریباً 80 ایم ایس تاخیر کے ساتھ، مکمل کلپ کا انتظار کرنے کی بجائے آڈیو کے آتے ہی یہ ٹوکن خارج کرتا ہے۔ یہ ایک لینگویج ماڈل کو ٹیکسٹ ٹوکن کی طرح تقریر کا علاج کرنے دیتا ہے، موشی کو مکمل ڈوپلیکس میں بات چیت کرنے کے قابل بناتا ہے جب کہ دوبارہ تعمیر شدہ آڈیو کو قابل فہم اور قدرتی رکھتے ہوئے.
تکنیکی بصیرت
ممی کی چال ایک اسپلٹ آر وی کیو اسکیم ہے۔ پہلی کوڈ بک کو WavLM سے سرایت کرنے کے لیے ڈسٹلیشن نقصان کے ساتھ تربیت دی جاتی ہے، جس سے اسے فونیٹک 'معنی' لے جانے پر مجبور کیا جاتا ہے، جبکہ متوازی صوتی کوڈ بکس ویوفارم کی تفصیل کو دوبارہ تشکیل دیتی ہے۔ ایک ٹرانسفارمر رکاوٹ کے اندر کام کرتا ہے، اور ڈیکوڈر پر ایک مخالف (GAN) نقصان آؤٹ پٹ کوالٹی کو تیز کرتا ہے۔ کازل کنوولوشنز ہر چیز کو جاری رکھتے ہیں، اس لیے تاخیر 80 ms کے قریب رہتی ہے۔
اسٹریٹجک اثر
رسائی اور رسائی
یہ نقل، بیان اور صوتی انٹرفیس کے ذریعے رسائی کو بہتر بناتا ہے۔
لاگت اور بجٹ
میڈیا ٹیمیں چھوٹے بجٹ کے ساتھ پالش آڈیو کو تیزی سے بھیج سکتی ہیں۔
رفتار اور پیمانہ
کسٹمر کا سامنا کرنے والے نظام بڑے پیمانے پر بولی جانے والی بات چیت پر کارروائی کر سکتے ہیں۔
ممی اسٹریمنگ آڈیو کوڈیک کا مستقبل
توقع ہے کہ ممی جیسے کوڈیکس آڈیو اور بڑے لینگویج ماڈلز کے درمیان معیاری انٹرفیس بن جائیں گے، جو ریئل ٹائم وائس اسسٹنٹس کو ذیلی 100 ms جوابی اوقات کی طرف دھکیل رہے ہیں۔ تحقیق اسپیکر کی شناخت، جذبات اور موسیقی کو محفوظ رکھتے ہوئے ٹوکن کی شرح کو اور بھی کم کر رہی ہے۔ چونکہ Kyutai نے ممی اور موشی کو اوپن سورس کیا ہے، اس لیے امکان ہے کہ اس میں بہت سے اوپن اسپیچ ٹو اسپیچ سسٹم، آن ڈیوائس اسسٹنٹس، اور انتہائی کم بینڈوتھ والے وائس کمیونیکیشن ٹولز ہوں گے۔
حقیقی دنیا کا نفاذ
Kyutai کے Moshi فل ڈوپلیکس وائس اسسٹنٹ کو طاقتور بنانا تاکہ یہ بیک وقت سن اور بات کر سکے۔
ریئل ٹائم اسپیچ ٹو اسپیچ ترجمہ کے لیے اسپیچ ٹوکنز کو زبان کے ماڈل میں اسٹریم کرنا
انتہائی کم بٹ ریٹ والی وائس کالز (~1.1 kbps) ناقص یا بھیڑ والے نیٹ ورک کے حالات کے لیے
تخلیقی اسپیچ اور ٹیکسٹ ٹو اسپیچ پائپ لائنز کے لیے ٹوکنائزنگ آڈیو جو کہ ٹیکسٹ جیسی آواز کی وجہ ہے۔
خطرات اور گارڈریلز
رضامندی غائب ہونے پر آواز کے غلط استعمال اور نقالی کے خطرات بڑھ جاتے ہیں۔
درستگی لہجوں، بولیوں، یا شور والے ماحول میں گر سکتی ہے۔
واضح لیبلنگ کے بغیر مصنوعی آڈیو کو مستند تقریر کے لیے غلط سمجھا جا سکتا ہے۔
نفاذ کا روڈ میپ
آواز کی گرفتاری، کلوننگ اور دوبارہ استعمال کے لیے واضح رضامندی حاصل کریں۔
متنوع اسپیکرز اور پس منظر کے حالات میں معیار کی جانچ کریں۔
وضاحت کریں کہ جب ایک انسان کو آؤٹ پٹس کا جائزہ لینا یا منظور کرنا ضروری ہے۔
مصنوعی آڈیو کو لیبل کریں اور جوابدہی کے لیے پرووینس ریکارڈ رکھیں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
نیورل آڈیو کوڈیکس
اکثر پوچھے گئے سوالات
What is Mimi Streaming Audio Codec?
ممی ایک نیورل آڈیو کوڈیک ہے جو ریئل ٹائم میں مجرد ٹوکنز کے ایک چھوٹے سے سلسلے میں تقریر کو کمپریس کرتا ہے، لہذا AI ماڈل بہت کم تاخیر کے ساتھ سن اور بول سکتے ہیں۔ یہ Kyutai کے موشی وائس ماڈل کے پیچھے آڈیو ریڑھ کی ہڈی ہے۔
کس لیب نے ممی اور موشی وائس ماڈل کو جاری کیا؟
ممی اور موشی کو 2024 میں فرانسیسی ریسرچ لیب Kyutai نے جاری کیا، جس نے دونوں کو اوپن سورس کیا۔
ممی تقریر کے لیے تقریباً کتنے ٹوکن فی سیکنڈ خارج کرتی ہے؟
ممی 24 kHz آڈیو کو تقریباً 1.1 kbps پر صرف 12.5 ٹوکن فی سیکنڈ تک کم کرتی ہے۔
Mimi کیپچر میں پہلی ('semantic') کوڈ بک کیا کرتی ہے؟
پہلی RVQ لیول کو WavLM سے ڈسٹلیشن کے ذریعے تربیت دی جاتی ہے تاکہ سیمنٹک/فونیٹک مواد لے جایا جا سکے، جبکہ بعد کی سطحیں صوتی تفصیلات شامل کرتی ہیں۔
ممی کو 'سٹریمنگ' یا 'کازل' کیوں کہا جاتا ہے؟
Mimi آڈیو کو کارآمد طریقے سے پروسیس کرتا ہے اور بتدریج ٹوکن آؤٹ پٹ کرتا ہے، جس سے لائیو گفتگو کے لیے تقریباً 80 ms لیٹنسی ملتی ہے۔
ممی آڈیو کو انکوڈ کرنے کے لیے کوانٹائزیشن کی کون سی تکنیک استعمال کرتی ہے؟
ممی بقایا ویکٹر کوانٹائزیشن کا استعمال کرتی ہے، ایک سے زیادہ کوڈ بکس کو اسٹیک کرتی ہے تاکہ ہر ایک پچھلی ایک میں بہتر تفصیلات کا اضافہ کرے۔