موشی فل ڈوپلیکس تقریر
Moshi Kyutai کی طرف سے ایک اوپن سورس، ریئل ٹائم وائس AI ہے جو سخت موڑ لینے کے بجائے - ایک ہی وقت میں بات کرتی اور سنتی ہے۔
جائزہ
That removes the awkward lag and rigid turn-taking of traditional voice assistants.
گہرا غوطہ
2024 میں فرانسیسی لیب Kyutai کے ذریعہ جاری کردہ Moshi، ایک تقریر سے تقریر فاؤنڈیشن ماڈل ہے جو قدرتی، کم تاخیر والی گفتگو کے لیے بنایا گیا ہے۔ پائپ لائن اسسٹنٹس کے برعکس جو اسپیچ ٹو ٹیکسٹ، پھر لینگویج ماڈل، پھر ٹیکسٹ ٹو اسپیچ، موشی آڈیو کو براہ راست اور مسلسل ہینڈل کرتا ہے۔ اس کا کلیدی خیال مکمل ڈوپلیکس ہے: یہ بیک وقت دو آڈیو اسٹریمز کو ماڈل کرتا ہے — صارف کا اور اس کا اپنا — تاکہ یہ بولتے ہوئے سن سکتا ہے، رکاوٹوں کو سنبھال سکتا ہے، 'mhm' کے ساتھ بیک چینل کر سکتا ہے اور قدرتی طور پر انسانوں کی طرح اوورلیپ کر سکتا ہے۔ یہ 160-200 ملی سیکنڈ کے قریب تاخیر تک پہنچ جاتا ہے، عام اسسٹنٹ وقفہ سے بہت نیچے۔ ہڈ کے نیچے یہ ایک 7B پیرامیٹر ٹیکسٹ اور آڈیو لینگویج ماڈل (ہیلیم) کو ممی کے ساتھ جوڑتا ہے، ایک نیورل آڈیو کوڈیک جو تقریر کو مجرد ٹوکنز میں کمپریس کرتا ہے جو ماڈل تیار کر سکتا ہے۔ Kyutai نے کھلے عام وزن اور کوڈ جاری کیا۔
تکنیکی بصیرت
موشی کی چال اس کا ممی کوڈیک ہے، جو مسلسل آڈیو کو 12.5 ہرٹز پر مجرد ٹوکن کے کم بٹریٹ اسٹریم میں بدل دیتا ہے، جس میں ایک ڈسٹلڈ سیمنٹک ٹوکن بھی شامل ہے۔ لینگویج ماڈل اس کے اپنے اسپیچ ٹوکنز اور صارف کے متوازی وقت سے منسلک اسٹریمز میں پیش گوئی کرتا ہے، اس لیے نسل کو 'سننے' کے لیے کبھی رکنے کی ضرورت نہیں ہے۔ ایک 'اندرونی مونولوگ' طریقہ آڈیو سے پہلے متن کی پیشین گوئی کرتا ہے، جو موشی اصل میں کہتا ہے اس کی لسانی معیار اور ہم آہنگی کو بہتر بناتا ہے۔
اسٹریٹجک اثر
رسائی اور رسائی
یہ نقل، بیان اور صوتی انٹرفیس کے ذریعے رسائی کو بہتر بناتا ہے۔
لاگت اور بجٹ
میڈیا ٹیمیں چھوٹے بجٹ کے ساتھ پالش آڈیو کو تیزی سے بھیج سکتی ہیں۔
رفتار اور پیمانہ
کسٹمر کا سامنا کرنے والے نظام بڑے پیمانے پر بولی جانے والی بات چیت پر کارروائی کر سکتے ہیں۔
موشی فل ڈوپلیکس اسپیچ کا مستقبل
فل ڈوپلیکس ماڈلنگ قدرتی آواز AI کے لیے ٹیمپلیٹ بن رہی ہے، جو پوری صنعت میں سسٹمز کو متاثر کرتی ہے۔ چھوٹے، آن ڈیوائس ورژنز، کثیر لسانی تعاون، کم تاخیر، اور ایجنٹس، کسٹمر سروس، اور ایکسیسبیلٹی ٹولز میں انضمام کی توقع کریں۔ چونکہ موشی کھلا ہے، محققین آزادانہ طور پر اس کی چھان بین کر سکتے ہیں اور اسے بہتر بنا سکتے ہیں۔ چیلنجز حقائق پر مبنی اعتبار، اوور لیپنگ تقریر میں حفاظت، اور جذباتی نزاکت کے ارد گرد رہتے ہیں، لیکن سخت موڑ سے سیال، رکاوٹ والی گفتگو کی طرف تبدیلی کا امکان مستقل ہے۔
حقیقی دنیا کا نفاذ
ایک ہینڈز فری صوتی ساتھی جو آپ 200 ملی سیکنڈ سے کم میں جوابات کے ساتھ وسط جملے میں خلل ڈال سکتے ہیں۔
ریئل ٹائم، فل ڈوپلیکس بولی جانے والی ڈائیلاگ کا مطالعہ کرنے کے لیے تحقیق کی بنیاد کھولیں، بغیر ملکیتی بلیک باکسز۔
ایکسیسبیلٹی اسسٹنٹس جو ان صارفین کے ساتھ بات چیت کرتے ہیں جنہیں فوری، قدرتی طور پر آگے پیچھے کی ضرورت ہوتی ہے۔
پروٹوٹائپنگ میں مداخلت کرنے والے کسٹمر سروس وائس بوٹس جو بیک چینل کرتے ہیں اور کال کرنے والے کے ابھی بھی بات کرنے کے دوران ردعمل ظاہر کرتے ہیں۔
خطرات اور گارڈریلز
رضامندی غائب ہونے پر آواز کے غلط استعمال اور نقالی کے خطرات بڑھ جاتے ہیں۔
درستگی لہجوں، بولیوں، یا شور والے ماحول میں گر سکتی ہے۔
واضح لیبلنگ کے بغیر مصنوعی آڈیو کو مستند تقریر کے لیے غلط سمجھا جا سکتا ہے۔
نفاذ کا روڈ میپ
آواز کی گرفتاری، کلوننگ اور دوبارہ استعمال کے لیے واضح رضامندی حاصل کریں۔
متنوع اسپیکرز اور پس منظر کے حالات میں معیار کی جانچ کریں۔
وضاحت کریں کہ جب ایک انسان کو آؤٹ پٹس کا جائزہ لینا یا منظور کرنا ضروری ہے۔
مصنوعی آڈیو کو لیبل کریں اور جوابدہی کے لیے پرووینس ریکارڈ رکھیں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Moshi Full-Duplex Speech quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
تقریر کے لیے متن نارملائزیشن
اکثر پوچھے گئے سوالات
What is Moshi Full-Duplex Speech?
Moshi Kyutai کی طرف سے ایک اوپن سورس، ریئل ٹائم وائس AI ہے جو سخت موڑ لینے کے بجائے - ایک ہی وقت میں بات کرتی اور سنتی ہے۔ یہ روایتی صوتی معاونین کے عجیب و غریب وقفے اور سخت موڑ کو دور کرتا ہے۔
موشی کے تناظر میں 'فل ڈوپلیکس' کا کیا مطلب ہے؟
فل ڈوپلیکس کا مطلب ہے کہ ماڈل آنے والی اور جانے والی آڈیو کو بیک وقت ہینڈل کرتا ہے، لہذا یہ بولنے کے دوران سن سکتا ہے اور قدرتی طور پر رکاوٹوں کو سنبھال سکتا ہے۔
موشی کو کس تنظیم نے رہا کیا؟
موشی کو 2024 میں ایک فرانسیسی AI ریسرچ لیب Kyutai نے تیار کیا تھا اور اسے اوپن سورس کیا تھا۔
موشی نظام میں ممی کیا ہے؟
ممی ایک نیورل آڈیو کوڈیک ہے جو مسلسل تقریر کو کم بٹریٹ والے مجرد ٹوکنز میں کمپریس کرتا ہے جو ماڈل تیار کر سکتا ہے۔
موشی روایتی صوتی معاون پائپ لائن سے کیسے مختلف ہے؟
روایتی معاونین اسپیچ ٹو ٹیکسٹ، لینگویج ماڈل اور ٹیکسٹ ٹو اسپیچ کا سلسلہ کرتے ہیں۔ موشی ایک واحد تقریر سے تقریر ماڈل ہے جو آڈیو کو مسلسل ہینڈل کرتا ہے۔
موشی موشی کس بات چیت میں تاخیر کو نشانہ بناتا ہے؟
Moshi 160-200 ms کے ارد گرد لیٹنسی حاصل کرتا ہے، جو عام وائس اسسٹنٹس سے بہت کم ہے، قدرتی اوورلیپ اور رکاوٹ کو فعال کرتا ہے۔