العودة إلى الأخبار
الابتكارAI Understanding إحاطة

يجد معيار Werewolf أن LLMs يمكن أن تبالغ في تقدير المتهمين الموثوق بهم

وجد معيار مكون من 40 تكوينًا من تكوينات LLM ذات الوزن المفتوح أن الاتهامات يمكن أن تغير معتقدات النماذج حتى عندما يكون المتهم متحالفًا مع الجانب الآخر.

4 min readRead the primary source
Source-provided image accompanying Werewolf benchmark finds LLMs can overvalue trusted accusers
وثيقة المصدر الأساسيتم تسجيل المصدر
الناشر
arxiv.org
رابط المصدر
arxiv.orghttps://arxiv.org/abs/2609.12446
نوع المصدر
المستند الأساسي - إعلان رسمي أو ورقة أو ملف أو صفحة الطرف الأول التي نقرأها مباشرة.
السياقافهم هذا في 60 ثانية

ابدأ هنا

المصطلحات الرئيسية

المعيار
اختبار موحد أو مجموعة بيانات تستخدم لقياس ومقارنة أداء النموذج.
نموذج اللغة الكبير (LLM)
نموذج لغة تم تدريبه على مجموعات نصية ضخمة لإنشاء النص وتحليله.
تعليق توضيحي
التصنيفات أو البيانات التعريفية المضافة بواسطة الإنسان والمستخدمة لتدريب نماذج التعلم الآلي أو تقييمها.
اختبر نفسكوأوضح نماذج الذكاء الاصطناعي مسابقة

ماذا حدث

قدم الباحثون معيار Werewolf الذي يقيس كيفية تحديث LLMs لمعتقداتهم بعد تلقي رسائل الشك والاتهام. عبر 1,224 رسالة مشروحة و40 تكوينًا للنماذج ذات الوزن المفتوح، حددت النماذج الأكبر حجمًا في كثير من الأحيان الذئاب الحقيقية من تاريخ اللعبة ولكنها ظلت متأثرة بشدة بالاتهامات والجدارة بالثقة للمتهم.

تقترح الورقة تقييم التحولات في المعتقدات بدلاً من الاعتماد فقط على النتيجة النهائية للعبة الاستنتاج الاجتماعي. في إعداده، يتلقى نموذج المراقبة من جانب القرية رسائل اللعبة، بما في ذلك الشكوك والاتهامات، ويقيس الباحثون مدى تغير معتقداته بعد كل رسالة.

تنتج التقارير المجردة عن 40 تكوينًا مفتوح الوزن لـ LLM و1,224 رسالة مشروحة. كان أداء النماذج الأكبر حجمًا أفضل في التمييز بين الذئاب والقرويين باستخدام تاريخ اللعبة الكامل. ومع ذلك، فإن الاتهامات لا تزال تزيد من الشكوك تجاه المتهم وتقلل من الشكوك تجاه المتهم، خاصة عندما يكون المتهم موثوقًا به بالفعل.

استمر النمط المبلغ عنه حتى عندما كان المتهم الموثوق به متحالفًا مع الذئب. وكانت النماذج الأكبر حجمًا أكثر قدرة على مقاومة اتهامات المتهمين الذين لا يثقون بهم بالفعل، لكن النماذج التي يصل عددها إلى 120 مليار معلمة لا تزال تكافح من أجل دمج محتوى الاتهام مع موثوقية مصدره. لا يوفر المصدر أي نتائج تفصيلية لكل نموذج، أو عدم اليقين الإحصائي، أو النسخ المتماثل المستقل في النص المرفق.

تفاصيل المصدر: arxiv.org ↗

لماذا يهم

تحدد الدراسة نقطة ضعف محددة في التواصل الاستراتيجي: قد لا تفصل النماذج بشكل كافٍ بين مصداقية المتحدث والأدلة الواردة في ادعاء ذلك المتحدث. وهذا أمر مهم بالنسبة لوكلاء LLM الذين يعملون في إعدادات يمكن أن تكون فيها الرسائل انتقائية أو خادعة أو معادية. والنتيجة هي نتيجة مرجعية وبحثية، وليس دليلاً على أن جميع أنظمة الذكاء الاصطناعي المنشورة تتصرف بهذه الطريقة أو أن التقييم يعمم إلى ما هو أبعد من المستذئب.

بالنسبة للباحثين الذين يقومون بتقييم وكلاء LLM، تشير النتيجة إلى أن نجاح اللعبة النهائية قد يخفي نقاط ضعف مهمة في التفكير الوسيط وتحديث المعتقدات. يمكن للنموذج أن يتوصل إلى قرار معقول مع الاستمرار في ترجيح من قدم المطالبة بدلاً من تقييم المطالبة جنبًا إلى جنب مع الأدلة المتاحة.

إن الآثار العملية محدودة ولكنها مفيدة: قد تحتاج تقييمات الوكلاء الذين يتواصلون أو يتخذون قرارات من تقارير متعددة إلى قياس التغيرات في المعتقدات بعد الرسائل الفردية، بما في ذلك الحالات التي يكون فيها المتحدث الموثوق مضللا. لم تثبت الدراسة أن نفس السلوك يحدث في المنتجات المنشورة أو في الإعدادات غير المتعلقة باللعبة.

Interactive Mechanism

الآلية التفاعلية: كيف تعمل فعليًا

استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
التحقق من المفهوم التفاعلي+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

ماذا تشاهد بعد ذلك

يتوفر المعيار والكود من خلال الموقع الإلكتروني للمشروع، لكن المصدر لا يذكر الترخيص أو تفاصيل الاستضافة أو ما إذا كانت النماذج التي تم تقييمها متاحة للاستخدام العام. يجب أن يختبر العمل الإضافي ما إذا كانت النتائج ستنتقل إلى مهام اتصال أخرى، وما إذا كان التدريب يحسن منطق محتوى المصدر، ومدى اعتماد النتائج على تصميم اللعبة واختيارات التعليقات التوضيحية.

يقول المؤلفون إن المعيار والكود متاحان في صفحة المشروع المرتبطة. لا يوثق المصدر المقدم متطلبات الوصول أو الترخيص أو التسعير أو الأطر المدعومة أو ما إذا كان المعيار يتضمن مخرجات نموذجية تتجاوز الرسائل المشروحة.

وتشمل الأمور المجهولة المهمة كيفية إنشاء الرسائل وشرحها، وكيفية تأسيس الثقة، وما إذا كانت النتائج قوية إحصائياً عبر النماذج الفردية، وما إذا كان الاستدلال المحسّن لتاريخ اللعبة في النماذج الأكبر يترجم إلى مقاومة أفضل للتلاعب.

سيساعد النسخ المتماثل عبر مهام الاتصال الإستراتيجية الأخرى في تحديد ما إذا كان هذا تأثيرًا خاصًا بالذئب أو قيدًا أوسع في كيفية دمج وكلاء LLM بين مصداقية المصدر ومحتوى الاتهام.

الأدلة والاختبارات ذات الصلة

شرح نماذج الذكاء الاصطناعيوكلاء الذكاء الاصطناعيأخلاقيات الذكاء الاصطناعياختبر ما تعرفه – جرّب اختبارًا مجانيًا للذكاء الاصطناعيابحث عن مصطلح الذكاء الاصطناعي في قاموسنااتبع أداة تعقب إصدار نموذج الذكاء الاصطناعي
وجدت هذا مفيدا؟