ماذا حدث
قدم الباحثون معيار Werewolf الذي يقيس كيفية تحديث LLMs لمعتقداتهم بعد تلقي رسائل الشك والاتهام. عبر 1,224 رسالة مشروحة و40 تكوينًا للنماذج ذات الوزن المفتوح، حددت النماذج الأكبر حجمًا في كثير من الأحيان الذئاب الحقيقية من تاريخ اللعبة ولكنها ظلت متأثرة بشدة بالاتهامات والجدارة بالثقة للمتهم.
تقترح الورقة تقييم التحولات في المعتقدات بدلاً من الاعتماد فقط على النتيجة النهائية للعبة الاستنتاج الاجتماعي. في إعداده، يتلقى نموذج المراقبة من جانب القرية رسائل اللعبة، بما في ذلك الشكوك والاتهامات، ويقيس الباحثون مدى تغير معتقداته بعد كل رسالة.
تنتج التقارير المجردة عن 40 تكوينًا مفتوح الوزن لـ LLM و1,224 رسالة مشروحة. كان أداء النماذج الأكبر حجمًا أفضل في التمييز بين الذئاب والقرويين باستخدام تاريخ اللعبة الكامل. ومع ذلك، فإن الاتهامات لا تزال تزيد من الشكوك تجاه المتهم وتقلل من الشكوك تجاه المتهم، خاصة عندما يكون المتهم موثوقًا به بالفعل.
استمر النمط المبلغ عنه حتى عندما كان المتهم الموثوق به متحالفًا مع الذئب. وكانت النماذج الأكبر حجمًا أكثر قدرة على مقاومة اتهامات المتهمين الذين لا يثقون بهم بالفعل، لكن النماذج التي يصل عددها إلى 120 مليار معلمة لا تزال تكافح من أجل دمج محتوى الاتهام مع موثوقية مصدره. لا يوفر المصدر أي نتائج تفصيلية لكل نموذج، أو عدم اليقين الإحصائي، أو النسخ المتماثل المستقل في النص المرفق.
لماذا يهم
تحدد الدراسة نقطة ضعف محددة في التواصل الاستراتيجي: قد لا تفصل النماذج بشكل كافٍ بين مصداقية المتحدث والأدلة الواردة في ادعاء ذلك المتحدث. وهذا أمر مهم بالنسبة لوكلاء LLM الذين يعملون في إعدادات يمكن أن تكون فيها الرسائل انتقائية أو خادعة أو معادية. والنتيجة هي نتيجة مرجعية وبحثية، وليس دليلاً على أن جميع أنظمة الذكاء الاصطناعي المنشورة تتصرف بهذه الطريقة أو أن التقييم يعمم إلى ما هو أبعد من المستذئب.
بالنسبة للباحثين الذين يقومون بتقييم وكلاء LLM، تشير النتيجة إلى أن نجاح اللعبة النهائية قد يخفي نقاط ضعف مهمة في التفكير الوسيط وتحديث المعتقدات. يمكن للنموذج أن يتوصل إلى قرار معقول مع الاستمرار في ترجيح من قدم المطالبة بدلاً من تقييم المطالبة جنبًا إلى جنب مع الأدلة المتاحة.
إن الآثار العملية محدودة ولكنها مفيدة: قد تحتاج تقييمات الوكلاء الذين يتواصلون أو يتخذون قرارات من تقارير متعددة إلى قياس التغيرات في المعتقدات بعد الرسائل الفردية، بما في ذلك الحالات التي يكون فيها المتحدث الموثوق مضللا. لم تثبت الدراسة أن نفس السلوك يحدث في المنتجات المنشورة أو في الإعدادات غير المتعلقة باللعبة.
الآلية التفاعلية: كيف تعمل فعليًا
استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.
Which component of an AI application is the machine-learning model itself?
ماذا تشاهد بعد ذلك
يتوفر المعيار والكود من خلال الموقع الإلكتروني للمشروع، لكن المصدر لا يذكر الترخيص أو تفاصيل الاستضافة أو ما إذا كانت النماذج التي تم تقييمها متاحة للاستخدام العام. يجب أن يختبر العمل الإضافي ما إذا كانت النتائج ستنتقل إلى مهام اتصال أخرى، وما إذا كان التدريب يحسن منطق محتوى المصدر، ومدى اعتماد النتائج على تصميم اللعبة واختيارات التعليقات التوضيحية.
يقول المؤلفون إن المعيار والكود متاحان في صفحة المشروع المرتبطة. لا يوثق المصدر المقدم متطلبات الوصول أو الترخيص أو التسعير أو الأطر المدعومة أو ما إذا كان المعيار يتضمن مخرجات نموذجية تتجاوز الرسائل المشروحة.
وتشمل الأمور المجهولة المهمة كيفية إنشاء الرسائل وشرحها، وكيفية تأسيس الثقة، وما إذا كانت النتائج قوية إحصائياً عبر النماذج الفردية، وما إذا كان الاستدلال المحسّن لتاريخ اللعبة في النماذج الأكبر يترجم إلى مقاومة أفضل للتلاعب.
سيساعد النسخ المتماثل عبر مهام الاتصال الإستراتيجية الأخرى في تحديد ما إذا كان هذا تأثيرًا خاصًا بالذئب أو قيدًا أوسع في كيفية دمج وكلاء LLM بين مصداقية المصدر ومحتوى الاتهام.