العودة إلى الأخبار
الابتكارAI Understanding إحاطة

تقوم شركة AffectOmni بتدريب الذكاء الاصطناعي متعدد الوسائط لشرح المشاعر باستخدام الأدلة المرئية التي تركز على الأشخاص

تصف نسخة أولية جديدة AffectOmni، وهو إطار عمل للتعلم المعزز مصمم لجعل نماذج الذكاء الاصطناعي متعددة الوسائط تبني أحكامًا عاطفية على إشارات تتمحور حول الأشخاص مثل تعبيرات الوجه ولغة الجسد والنظام الزمني. أبلغ المؤلفون عن تحسينات على خطوط الأساس مفتوحة المصدر بمقياس 7B على ثلاثة معايير...

6 min readRead the primary source
Primary-source image accompanying AffectOmni trains multimodal AI to explain emotions using people-centered visual evidence
وثيقة المصدر الأساسيتم تسجيل المصدر
الناشر
arxiv.org
رابط المصدر
arxiv.orghttps://arxiv.org/abs/2608.26193
نوع المصدر
المستند الأساسي - إعلان رسمي أو ورقة أو ملف أو صفحة الطرف الأول التي نقرأها مباشرة.
السياقافهم هذا في 60 ثانية

ابدأ هنا

المصطلحات الرئيسية

التعلم المعزز
التدريب من خلال إشارات المكافأة حيث يتعلم الوكيل الإجراءات التي تزيد من العائد على المدى الطويل.
نموذج متعدد الوسائط
نموذج يمكنه معالجة أو إنشاء أنواع بيانات متعددة مثل النص والصورة والصوت.
المعايرة
مدى مطابقة درجات ثقة النموذج لاحتمالات الصحة الفعلية.
اختبر نفسكما هو الذكاء الاصطناعي؟ اختبار

ماذا حدث

اقترح الباحثون AffectOmni، وهو إطار عمل لتدريب نماذج لغوية كبيرة متعددة الوسائط على التفكير في العواطف والنوايا والإشارات العاطفية الأخرى في الصور أو المشاهد الاجتماعية والفنية. تقول النسخة الأولية أن النماذج يمكنها في بعض الأحيان الوصول إلى الإجابات الصحيحة من خلال الاعتماد على السياق المحيط مع تجاهل الأدلة التي تركز على الأشخاص والتي من شأنها أن تجعل التحقق من تفكيرهم أسهل.

تصف نسخة أولية تم تقديمها إلى arXiv في 24 أغسطس AffectOmni، وهو إطار للتعلم المعزز للتفكير العاطفي الذي يمكن التحقق منه في نماذج اللغات الكبيرة متعددة الوسائط. تركز الورقة على المشاهد الاجتماعية والفنية التي قد يحتاج فيها النظام إلى استنتاج العاطفة أو النية أو ترتيب الأحداث. حدد المؤلفون نقطة ضعف محددة في الأنظمة الحالية: يمكن للنموذج أن يعطي الإجابة الصحيحة أثناء استخدام الاختصارات بناءً على سياق المشهد الواسع بدلاً من الاهتمام بالإشارات التي تركز على الأشخاص، مثل التعبيرات الدقيقة ولغة الجسد.

يضيف إطار العمل مكونين للمكافأة يسمى التركيز على الأشخاص والنظام الزمني. وفقًا للمصدر، يشجع التركيز على الأشخاص النموذج على اختيار الأدلة التي تتضمن الأشخاص، بينما يشجع النظام الزمني على التفكير الذي يتمحور حول وقت وقوع الأحداث. تقول الورقة أن هذه الإشارات تهدف إلى تقليل سلوك الاختصار وتحسين الاتصال بين إجابة النموذج والأدلة المرئية الداعمة لها. لا يوفر المصدر تفاصيل كافية لتحديد كيفية تصرف هذه المكافآت عبر جميع أنواع المشاهد أو ما إذا كانت تمنع الاختصار في الاختبارات المستقلة.

يستخدم AffectOmni أيضًا التسجيل المقارن داخل المجموعة أثناء التعلم المعزز. يقول المؤلفون إن هذا يهدف إلى معالجة تجميع الدرجات في التحكيم بنموذج اللغة الكبيرة، حيث تحصل العديد من إجابات المرشحين على درجات مماثلة، وبالتالي تنتج إشارات تدريب ضعيفة التمييز. بعد أن يقوم النموذج بإنشاء مبررات حرة الشكل، يقوم ملخص التفكير بتحويل هذا الأساس المنطقي إلى تعليمات أدلة قابلة للتنفيذ. يتم بعد ذلك تثبيت هذه التعليمات في مناطق أدلة على مستوى البكسل باستخدام SAM3، مما يؤدي إلى إنشاء ما يصفه المؤلفون بواجهة قابلة للتدقيق خارجيًا خارج حلقة التدريب.

يقدم المصدر تجارب على ثلاثة معايير: IntentBench، وDaily Omni، وWorldSense. بالنسبة إلى النماذج مفتوحة المصدر على مقياس 7B، أفاد المؤلفون بوجود تحسينات متسقة، بما في ذلك زيادة بنسبة 4.66% في التعرف على المشاعر وزيادة بنسبة 14.29% في المهام الحساسة مؤقتًا. ولا يحدد المصدر ما إذا كانت هذه الأرقام عبارة عن مكاسب مطلقة بنسبة مئوية أو تحسينات نسبية، ولا يوفر أعداد العينات أو فترات الثقة أو أشرطة الخطأ أو المقارنات مع أقوى أنظمة الملكية. تشير النسخة الأولية إلى أن الكود متاح، لكن المصدر لا يوفر رابط مستودع قابل للاستخدام أو يصف شروط الترخيص.

تفاصيل المصدر: arxiv.org ↗

لماذا يهم

يعد التعرف على التأثير قدرة تبعية للأنظمة التي تفسر التفاعلات الاجتماعية، ولكن التسمية الصحيحة لا تظهر بالضرورة أن النموذج قد لاحظ الشخص أو التعبير أو الإيماءة ذات الصلة. يعالج نهج AffectOmni مشكلة التتبع هذه من خلال ربط الاستدلال النموذجي بمناطق الأدلة التي يمكن فحصها خارج عملية التدريب. إذا كانت المكاسب المذكورة تتجاوز معايير المؤلفين، فإن هذه الطريقة يمكن أن تقدم طريقة أكثر مسؤولية لتقييم الأنظمة متعددة الوسائط التي تفسر السلوك البشري.

إن القضية العملية ليست مجرد ما إذا كان النموذج متعدد الوسائط يمكنه تسمية المشاعر أم لا. في التطبيقات التي تفسر المشاهد الاجتماعية، قد يحتاج المستخدمون إلى معرفة الأدلة المرئية التي أدت إلى الحكم. يمكن أن يفشل النظام الذي يقوم بتصنيف المشهد بشكل صحيح لسبب خاطئ عندما تتغير الخلفية أو الملابس أو الإعداد أو أي إشارات سياقية أخرى. إن تركيز البحث على الأدلة التي تركز على الأشخاص يعالج فجوة الموثوقية بشكل مباشر، على الرغم من أن المصدر يذكر تفسير المؤلفين بدلاً من نتيجة تم التحقق منها بشكل مستقل.

يمكن لخطوة تأسيس الأدلة أن تجعل مخرجات النموذج العاطفي أسهل في التدقيق. من خلال ترجمة الأساس المنطقي إلى تعليمات وربطها بمناطق على مستوى البكسل، يقدم AffectOmni قطعة أثرية ملموسة يمكن للمقيم فحصها. يعد هذا أكثر عملية من الطلب العام للنموذج لشرح نفسه: المطالبة مرتبطة بالمواقع الموجودة في الصورة المدخلة. ومع ذلك، لا ينبغي التعامل مع المناطق المميزة تلقائيًا كدليل على الاستدلال السببي. لا يثبت المصدر أن المناطق تكشف بأمانة عن العملية الداخلية التي أنتجت الإجابة.

من المحتمل أن تكون التحسينات المبلغ عنها مفيدة لأن الفهم الزمني والتفسير العاطفي هما من نقاط الفشل الشائعة في الأنظمة متعددة الوسائط. إن التحسن بنسبة 14.29% في المهام الحساسة مؤقتًا، إذا تم إعادة إنتاجها بشكل مستقل وتحديدها بوضوح، يمكن أن يكون مهمًا للأنظمة التي تحلل التسلسلات بدلاً من الصور الثابتة المعزولة. ولا يذكر المصدر مدى صعوبة المهام، أو كيفية بناء المعايير أو ما إذا كانت المكاسب تترجم إلى استخدامات لاحقة مثل التعليم، أو إمكانية الوصول، أو الاعتدال، أو التفاعل بين الإنسان والحاسوب.

ويوضح العمل أيضًا خيار تصميم أوسع في تقييم الذكاء الاصطناعي: ليس فقط مكافأة المخرجات، بل أيضًا اختيار الأدلة الداعمة وتنظيمها. يمكن أن يساعد هذا النهج الباحثين على التمييز بين الأساس البصري الحقيقي والإجابات المنتجة من خلال ارتباطات مجموعة البيانات. ومع ذلك، فإن الأحكام العاطفية حساسة بطبيعتها للسياق والتفسير. قد تظل الطريقة التي تكافئ التركيز على الإشارات البشرية المرئية تشفر افتراضات حول التعبير العاطفي، أو الأعراف الاجتماعية، أو معنى الإيماءات، خاصة عندما تنعكس هذه الافتراضات في بيانات التدريب.

Interactive Mechanism

الآلية التفاعلية: كيف تعمل فعليًا

استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
التحقق من المفهوم التفاعلي+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

ماذا تشاهد بعد ذلك

تأتي النتائج من نسخة مسبقة واحدة من arXiv مكونة من 12 صفحة وتم الإبلاغ عنها من قبل مؤلفيها؛ لا ينشئ المصدر النسخ المتماثل المستقل أو النشر في العالم الحقيقي أو الأداء عبر مجموعات سكانية وإعدادات أوسع. يجب أن تختبر أعمال المتابعة ما إذا كان الإطار يظل موثوقًا به مع الثقافات غير المألوفة والتفاعلات الغامضة وجودة الصورة الرديئة والمشاهد التي تكون فيها الإشارات العاطفية خفية أو متناقضة. سيكون من المهم أيضًا تحديد ما إذا كانت مناطق الأدلة تعكس حقًا عملية اتخاذ القرار الخاصة بالنموذج أو توفر فقط مواقع داعمة معقولة بعد تكوين الإجابة.

السؤال الأول هو النسخ. يتم تقديم AffectOmni كنسخة أولية من arXiv، وليس كنتيجة تمت مراجعتها من قبل النظراء أو تم التحقق من صحتها بشكل مستقل. يجب على الباحثين التحقق مما إذا كانت المكاسب المبلغ عنها تستمر في ظل نفس بروتوكول التقييم، وما إذا كانت تظل بعد التحكم في بيانات التدريب الإضافية أو حجم النموذج، وما إذا كانت الطريقة تعمل على تحسين المعايرة واكتشاف الأخطاء بدلاً من الدرجات المعيارية فقط.

سيكون النطاق المعياري مهمًا. يذكر المصدر أسماء IntentBench وDaily Omni وWorldSense ولكنه لا يصف التغطية الديموغرافية أو اللغات أو جودة الصورة أو الإعدادات الثقافية أو توازن المواقف الاجتماعية. يجب أن تختبر التقييمات المستقبلية المشاعر الغامضة، والإشارات المختلطة، والوجوه المحجوبة، وأوضاع الجسم غير العادية، والمشاهد التي لا يكون فيها الشخص الأبرز هو مصدر الأدلة ذات الصلة. ويجب عليهم أيضًا الإبلاغ عن نتائج المجموعة الفرعية حيث يمكن أن يختلف التفسير عبر الثقافات أو الإعاقات.

إن المطالبة بقابلية التدقيق تستحق اختبارًا مستهدفًا. يمكن للمقيم مقارنة المناطق المميزة بالشروح البشرية، أو إزعاج المناطق المحددة، أو إخفائها، أو استبدال سياق الخلفية مع الحفاظ على الأدلة التي تركز على الأشخاص ثابتة. من شأن مثل هذه الاختبارات أن تساعد في تحديد ما إذا كانت مناطق الأدلة ضرورية لاتخاذ قرار النموذج أم أنها تم إنشاؤها بعد وقوع الحدث. لم يذكر المصدر هذه التجارب، لذا يظل مدى التحقق المزعوم غير معروف.

وأخيرا، لم يتم وضع الحدود العملية. لا توجد معلومات في المصدر حول زمن الاستجابة أو تكلفة الحوسبة أو الترخيص أو توفر النشر أو ضمانات الخصوصية أو الاستخدام في الأنظمة المباشرة. أبلغ المؤلفون عن النتائج وفقًا لخطوط الأساس مفتوحة المصدر بمقياس 7B، لكن المصدر لا يُظهر ما إذا كان AffectOmni قادرًا على المنافسة مع النماذج الأكبر حجمًا، أو قويًا خارج المعايير الثلاثة المذكورة. وإلى أن تتم الإجابة على هذه الأسئلة، فمن الأفضل أن يُفهم هذا العمل على أنه مقترح بحثي ذو نتائج واعدة، وليس كحل معتمد لتفسير مشاعر الناس.

الأدلة والاختبارات ذات الصلة

ما هو الذكاء الاصطناعي؟شرح نماذج الذكاء الاصطناعيالمحولاتأخلاقيات الذكاء الاصطناعياختبر ما تعرفه – جرّب اختبارًا مجانيًا للذكاء الاصطناعيابحث عن مصطلح الذكاء الاصطناعي في قاموسنااتبع أداة تعقب إصدار نموذج الذكاء الاصطناعي
وجدت هذا مفيدا؟