دليل الصوت AI

ميمي تدفق برنامج ترميز الصوت

Mimi عبارة عن برنامج ترميز صوتي عصبي يضغط الكلام إلى تدفق صغير من الرموز المنفصلة في الوقت الفعلي، بحيث يمكن لنماذج الذكاء الاصطناعي الاستماع والتحدث بزمن انتقال منخفض جدًا.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It is the audio backbone behind Kyutai's Moshi voice model.

الغوص العميق

Mimi، الذي أطلقه المختبر الفرنسي Kyutai في عام 2024، هو برنامج ترميز عصبي يحول الصوت بتردد 24 كيلو هرتز إلى دفق من الرموز المنفصلة بسرعة 1.1 كيلوبت في الثانية تقريبًا و12.5 رمزًا فقط في الثانية. يستخدم جهاز تشفير وفك تشفير مع تكميم المتجهات المتبقية (RVQ)، وتقسيم الرموز المميزة إلى المستوى الأول "الدلالي" المقطر من نموذج الكلام الخاضع للإشراف الذاتي (WavLM) بالإضافة إلى العديد من المستويات "الصوتية" التي تلتقط نسيج الصوت. والأهم من ذلك أنه يتدفق بشكل كامل وسببي: فهو يصدر رموزًا عند وصول الصوت بدلاً من انتظار مقطع كامل، مع حوالي 80 مللي ثانية من زمن الوصول. يتيح ذلك لنموذج اللغة التعامل مع الكلام مثل الرموز النصية، مما يمكّن Moshi من التحدث في الاتجاه المزدوج الكامل مع الحفاظ على الصوت المعاد بناؤه واضحًا وطبيعيًا.

البصيرة الفنية

خدعة ميمي هي مخطط تقسيم RVQ. تم تدريب كتاب الرموز الأول مع فقدان التقطير لمطابقة التضمينات من WavLM، مما يجبره على حمل "معنى" صوتي، بينما تعيد كتب الرموز الصوتية المتوازية بناء تفاصيل الشكل الموجي. يعمل المحول داخل عنق الزجاجة، كما يؤدي فقدان التعارض (GAN) على وحدة فك التشفير إلى زيادة جودة الإخراج. تحافظ التلافيفات السببية على تدفق كل شيء، لذا يبقى زمن الوصول بالقرب من 80 مللي ثانية.

التأثير الاستراتيجي

الوصول والوصول

يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.

التكلفة والميزانية

يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.

السرعة والحجم

يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.

مستقبل برنامج ترميز الصوت المتدفق Mimi

نتوقع أن تصبح برامج الترميز مثل Mimi هي الواجهة القياسية بين نماذج الصوت واللغات الكبيرة، مما يدفع المساعدين الصوتيين في الوقت الفعلي نحو أوقات استجابة أقل من 100 مللي ثانية. تعمل الأبحاث على خفض معدلات الرموز المميزة مع الحفاظ على هوية المتحدث والعاطفة والموسيقى. ونظرًا لأن نظام Kyutai مفتوح المصدر لـ Mimi وMoshi، فمن المرجح أن يزرع العديد من أنظمة تحويل الكلام إلى كلام المفتوحة، والمساعدين على الجهاز، وأدوات الاتصال الصوتي ذات النطاق الترددي المنخفض للغاية.

التنفيذ في العالم الحقيقي

تشغيل المساعد الصوتي Moshi مزدوج الاتجاه من Kyutai حتى يتمكن من الاستماع والتحدث في وقت واحد

دفق الرموز المميزة للكلام في نموذج لغة لترجمة الكلام إلى كلام في الوقت الفعلي

مكالمات صوتية ذات معدل بت منخفض جدًا (~1.1 كيلوبت في الثانية) لظروف الشبكة الضعيفة أو المزدحمة

ترميز الصوت للكلام التوليدي وخطوط تحويل النص إلى كلام التي تفسر الصوت مثل النص

المخاطر والدرابزين

تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.

يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.

يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.

خارطة طريق التنفيذ

1

الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.

2

اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.

3

تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.

4

قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mimi Streaming Audio Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

برامج ترميز الصوت العصبية

الأسئلة المتداولة

What is Mimi Streaming Audio Codec?

Mimi عبارة عن برنامج ترميز صوتي عصبي يضغط الكلام إلى تدفق صغير من الرموز المنفصلة في الوقت الفعلي، بحيث يمكن لنماذج الذكاء الاصطناعي الاستماع والتحدث بزمن انتقال منخفض جدًا. إنه العمود الفقري الصوتي وراء نموذج صوت Moshi الخاص بـ Kyutai.

ما هو المعمل الذي أطلق نموذج ميمي وموشي الصوتي؟

تم إطلاق ميمي وموشي في عام 2024 من قبل مختبر الأبحاث الفرنسي كيوتاي، الذي فتح المصدرين معًا.

ما هو عدد الرموز المميزة تقريبًا التي يصدرها ميمي أثناء الكلام؟

تقوم Mimi بضغط الصوت بمعدل 24 كيلو هرتز إلى حوالي 12.5 رمزًا مميزًا في الثانية فقط بمعدل 1.1 كيلوبت في الثانية تقريبًا.

ما الذي يلتقطه أول كتاب رموز ('دلالي') في ميمي؟

يتم تدريب مستوى RVQ الأول عن طريق التقطير من WavLM ليحمل محتوى دلاليًا/صوتيًا، بينما تضيف المستويات اللاحقة تفاصيل صوتية.

لماذا توصف ميمي بأنها "متدفقة" أو "سببية"؟

تقوم Mimi بمعالجة الصوت بشكل سببي وإخراج الرموز بشكل تدريجي، مما يوفر زمن وصول يبلغ حوالي 80 مللي ثانية مناسبًا للمحادثة المباشرة.

ما هي تقنية التكميم التي يستخدمها ميمي لتشفير الصوت؟

يستخدم Mimi تكميم المتجهات المتبقية، وتكديس كتب الرموز المتعددة بحيث يضيف كل منها تفاصيل أكثر دقة إلى سابقتها.