العودة إلى الأخبار
الابتكارAI Understanding إحاطة

يصف تقرير WeMM-Embedding النماذج المفتوحة متعددة الوسائط للبحث والتوصية

يقدم تقرير فني جديد WeMM-Embedding، وهي عائلة مكونة من نماذج 2B و4B و9B لتمثيل النصوص والصور ومقاطع الفيديو والمستندات المرئية في مساحة مشتركة. يقول التقرير إن النماذج تعمل على تحسين معايير WeChat الداخلية وتم نشرها عبر خدمات البحث والتوصية.

5 min readRead the primary source
Source-page capture accompanying WeMM-Embedding Report Describes Open Multimodal Models for Search and Recommendation
وثيقة المصدر الأساسيتم تسجيل المصدر
الناشر
arxiv.org
رابط المصدر
arxiv.orghttps://arxiv.org/abs/2608.24053
نوع المصدر
المستند الأساسي - إعلان رسمي أو ورقة أو ملف أو صفحة الطرف الأول التي نقرأها مباشرة.
السياقافهم هذا في 60 ثانية

ابدأ هنا

المصطلحات الرئيسية

التضمين
تمثيل متجه رقمي يلتقط المعنى الدلالي للنص أو الصور أو البيانات الأخرى.
الذاكرة (ذاكرة الوكيل)
السياق المُخزن الذي يستخدمه وكيل الذكاء الاصطناعي عبر الخطوات أو الجلسات لتحسين الاستمرارية.
مصدر البيانات
الأصل الموثق والملكية والتاريخ لمجموعة البيانات أو القطعة الأثرية النموذجية.
اختبر نفسكوأوضح نماذج الذكاء الاصطناعي مسابقة

ماذا حدث

يصف تقرير فني تم تقديمه إلى arXiv في 25 أغسطس WeMM-، وهي عائلة من نماذج التضمين متعددة الوسائط التي تم تطويرها للنصوص والصور ومقاطع الفيديو والمستندات المرئية والمدخلات متعددة الوسائط المتداخلة. يقول التقرير أن النماذج متاحة مع الأوزان والأكواد التي تم إصدارها وتم نشرها عبر العديد من تطبيقات البحث والتوصية WeChat.

يقدم التقرير WeMM- كعائلة من نماذج التضمين العالمية متعددة الوسائط. وفقًا للملخص، تمثل النماذج النصوص والصور ومقاطع الفيديو والمستندات المرئية والمدخلات متعددة الوسائط المتداخلة بشكل تعسفي في مساحة مشتركة، بأبعاد مخرجات مرنة. تتضمن العائلة 2 مليار، 4 مليار، و9 مليار متغيرات من المعلمات. لا يوفر المصدر المقدم مزيدًا من التفاصيل الفنية حول بنية النموذج أو اللغات المدعومة أو تكوينات الإخراج الدقيقة.

تتكون عملية التدريب المبلغ عنها من مرحلتين. الأولى هي مرحلة محاذاة متعددة الوسائط واسعة النطاق. أما المرحلة الثانية فهي مرحلة التحسين باستخدام البيانات المنسقة والإشراف الدقيق على الصلة ونقل المعرفة على نطاق واسع. تشير هذه الأوصاف إلى أنه تم تحسين النظام ليس فقط لتوصيل أنواع الوسائط المختلفة، ولكن أيضًا للتمييز بين درجات الملاءمة بين العناصر المستردة. ولا يحدد المصدر مجموعات بيانات التدريب أو مصدرها أو كمية البيانات المستخدمة.

تقرير المؤلفين الأداء الرائد على معايير عامة متعددة. في المقارنة المحددة الموضحة في الملخص، يقال إن متغير 2B يتجاوز خط الأساس مفتوح المصدر الرائد سابقًا 8B على MMEB-v2. يدعي التقرير أيضًا أن الإصدار 9B يصل إلى درجة إجمالية جديدة تبلغ 80.6. هذه هي الادعاءات التي قدمها التقرير. لا تتضمن الصفحة المقصودة arXiv المرفقة الجداول القياسية أو شروط المقارنة أو التأكيد المستقل.

يصف التقرير أيضًا الاختبار العملي في تطبيقات WeChat. وتقول إن WeMM- حققت مكاسب كبيرة وفقًا لمعيار داخلي مكون من 26 مهمة، وحسّنت النتائج باستمرار عبر 14 اختبار A/B عبر الإنترنت وتم نشرها على نطاق واسع في تطبيقات التوصية والبحث بما في ذلك قنوات WeChat والحسابات الرسمية واللحظات وخدمات التجارة الإلكترونية. يقول المؤلفون أنه تم إصدار أوزان النماذج والكود، على الرغم من أن المصدر المقدم لا يذكر الترخيص أو يقدم محتويات الإصدار بالتفصيل.

تفاصيل المصدر: arxiv.org ↗

لماذا يهم

يقدم التقرير إصدارًا لنموذج الذكاء الاصطناعي مرتبطًا بكل من مطالبات المعايير العامة ونشر التطبيقات على نطاق واسع. إذا تم استنساخها بشكل مستقل، يمكن أن تكون نتائجها المبلغ عنها ذات صلة بالمطورين الذين يختارون بين أنظمة التضمين متعددة الوسائط الأكبر والأصغر للاسترجاع والتوصية والتصنيف والتطبيقات الوكيلة.

تم وصف التضمينات متعددة الوسائط في التقرير باعتبارها مكونًا أساسيًا لأنظمة الذكاء الاصطناعي الحديثة. والغرض منها هو تمثيل أشكال مختلفة من المحتوى في مساحة مشتركة حتى تتمكن الأنظمة من مقارنتها أو استرجاعها أو التوصية بها أو تصنيفها. وهذا يجعل هذا البحث ذا صلة بالبنية التحتية الموجودة أسفل منتجات البحث والتوصية، وليس فقط عرضًا توضيحيًا مستقلاً أو معيارًا نموذجيًا ضيقًا.

من المحتمل أن تكون نتيجة 2B مقابل 8B المُبلغ عنها ذات أهمية لأنها تشير إلى نموذج أصغر يتفوق على خط أساس مفتوح المصدر أكبر في التقييم المذكور. إذا كانت المقارنة عادلة وقابلة للتكرار، فإن النماذج الأصغر يمكن أن تمنح المطورين خيارًا آخر عند الموازنة بين الجودة والذاكرة وخدمة السعة وتعقيد النشر. لا يقوم المصدر بالإبلاغ عن زمن الوصول أو متطلبات الأجهزة أو استخدام الطاقة أو إجمالي تكلفة التشغيل، لذلك فهو لا يحدد تلك الفوائد.

يمنح النشر المزعوم عبر خدمات WeChat المتعددة للتقرير بُعدًا عمليًا. لا تترجم النتائج المعيارية خارج الإنترنت بالضرورة إلى نتائج أفضل في المنتجات الحية، حيث يمكن أن تختلف توزيعات البيانات وأنماط حركة المرور وقيود النظام. يشير المعيار القياسي المكون من 26 مهمة و14 اختبار A/B إلى جهد لقياس أداء التطبيق، لكن المصدر المقدم لا يعطي أرقام تحسن مطلقة أو أحجام عينات أو أهمية إحصائية أو تفاصيل حول كيفية إجراء الاختبارات.

يمكن أن يؤدي إصدار أوزان النماذج والكود إلى توسيع نطاق الوصول إلى أبحاث التضمين متعدد الوسائط والسماح للباحثين الآخرين باختبار المطالبات المبلغ عنها. قد يكون هذا الانفتاح مفيدًا للمقارنة مع الأنظمة الأخرى ولبناء عمليات الاسترجاع أو التوصية أو سير العمل الوكيل. وتعتمد قيمتها العامة على الترخيص الفعلي، واكتمال الإصدار، والتوثيق، وإمكانية التكرار، ومصدر بيانات التدريب وحقوق استخدامها، والتي لم يتم إنشاء أي منها بواسطة الصفحة المقدمة.

Interactive Mechanism

الآلية التفاعلية: كيف تعمل فعليًا

استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
التحقق من المفهوم التفاعلي+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

ماذا تشاهد بعد ذلك

لا تزال المطالبات المركزية تتطلب التدقيق في الورقة الكاملة والقطع الأثرية التي تم إصدارها وتفاصيل التقييم. تشمل الأمور المجهولة المهمة الترخيص ومصدر بيانات التدريب والمنهجية المرجعية والمكاسب المطلقة في الاختبارات عبر الإنترنت وحجم النشر وتكاليف التشغيل وما إذا كان بإمكان المستخدمين المستقلين إعادة إنتاج النتائج المبلغ عنها خارج نظام WeChat البيئي.

الأولوية الأولى هي التحقق من التقييمات العامة. يجب على القراء البحث عن نتائج MMEB-v2 الكاملة، وهوية وتكوين خط الأساس 8B، وتقسيمات مجموعة البيانات، والمقاييس، ومطالبات التقييم أو المعالجة المسبقة، وما إذا كان قد تم اختبار جميع النماذج في ظل ظروف قابلة للمقارنة. يجب تفسير النتيجة الرئيسية البالغة 80.6 جنبًا إلى جنب مع نتائج كل مهمة، نظرًا لأن النتيجة الإجمالية يمكن أن تخفي نقاط الضعف في طرائق أو حالات استخدام معينة.

تتطلب المطالبات عبر الإنترنت تقارير محددة بنفس القدر. يجب أن تكشف مواد المتابعة عن تعريفات المهام الداخلية الـ 26، وحركة المرور والفترات الزمنية التي تغطيها اختبارات A/B الأربعة عشر، وأحجام التأثير المقاسة، والمعالجة الإحصائية وأي مقايضات في زمن الوصول أو الموثوقية أو استخدام الموارد. يقول المصدر إن النماذج تم نشرها على نطاق واسع ولكنها لا تحدد عدد المستخدمين أو الطلبات أو المناطق أو نسبة خدمات WeChat ذات الصلة المتأثرة.

يجب التحقق من الإصدار نفسه بحثًا عن الأوزان القابلة للاستخدام وكود المصدر والوثائق والترخيص الواضح. سيحتاج المطورون أيضًا إلى معرفة تنسيقات الإدخال واللغات المدعومة، وكيفية تنفيذ أبعاد المخرجات المرنة، وما هي الأجهزة المطلوبة، وما إذا كان الإصدار يمكن استخدامه تجاريًا أو للبحث فقط. المصدر المقدم لا يجيب على هذه الأسئلة.

وينبغي للاختبار المستقل أن يفحص ما إذا كانت المكاسب المبلغ عنها يمكن تعميمها خارج نطاق بيانات WeChat والمعايير التي اختارها المؤلفون. قد تشمل عمليات التحقق المفيدة الاسترجاع متعدد اللغات والمتغير النطاق، والاستعلامات المختلطة للنص والصور، ومعالجة المستندات المرئية، وتمثيل الفيديو، وحالات الفشل التي تنطوي على مطابقات متعددة الوسائط غير ذات صلة أو مضللة. ونظرًا لأن التقرير يذكر الأنظمة الوكيلة كمجال تطبيق، فيجب أن يوضح العمل المستقبلي أيضًا كيف يمكن أن تؤثر أخطاء التضمين على القرارات الآلية النهائية، مع إدراك أن المصدر المقدم لا يبلغ عن تقييم السلامة.

الأدلة والاختبارات ذات الصلة

شرح نماذج الذكاء الاصطناعيوكلاء الذكاء الاصطناعيتدريب الذكاء الاصطناعيالمحولاتاختبر ما تعرفه – جرّب اختبارًا مجانيًا للذكاء الاصطناعيابحث عن مصطلح الذكاء الاصطناعي في قاموسنااتبع أداة تعقب إصدار نموذج الذكاء الاصطناعي
وجدت هذا مفيدا؟