กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

เกณฑ์มาตรฐานของมนุษย์หมาป่าพบว่า LLM สามารถประเมินค่าสูงเกินไปของผู้กล่าวหาที่เชื่อถือได้

เกณฑ์มาตรฐานของการกำหนดค่า LLM แบบ open-weight จำนวน 40 รายการ พบว่าข้อกล่าวหาสามารถเปลี่ยนความเชื่อของแบบจำลองได้ แม้ว่าผู้กล่าวหาจะอยู่ในแนวเดียวกับฝ่ายตรงข้ามก็ตาม

4 min readRead the primary source
Source-provided image accompanying Werewolf benchmark finds LLMs can overvalue trusted accusers
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
arxiv.org
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2609.12446
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

เกณฑ์มาตรฐาน
การทดสอบหรือชุดข้อมูลที่เป็นมาตรฐานที่ใช้ในการวัดและเปรียบเทียบประสิทธิภาพของโมเดล
โมเดลภาษาขนาดใหญ่ (LLM)
โมเดลภาษาที่ได้รับการฝึกเกี่ยวกับคลังข้อความขนาดใหญ่เพื่อสร้างและวิเคราะห์ข้อความ
คำอธิบายประกอบ
ป้ายกำกับหรือข้อมูลเมตาที่เพิ่มโดยมนุษย์ที่ใช้ในการฝึกหรือประเมินโมเดลการเรียนรู้ของเครื่อง
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

เกิดอะไรขึ้น

นักวิจัยได้แนะนำเกณฑ์มาตรฐานของมนุษย์หมาป่าซึ่งวัดว่าการสังเกต LLM อัปเดตความเชื่อของตนอย่างไร หลังจากได้รับข้อความที่น่าสงสัยและข้อกล่าวหา ในข้อความที่มีคำอธิบายประกอบ 1,224 ข้อความและการกำหนดค่าโมเดลน้ำหนักเปิด 40 แบบ โมเดลขนาดใหญ่มักจะระบุหมาป่าที่แท้จริงจากประวัติเกมได้ แต่ยังคงได้รับอิทธิพลอย่างมากจากการกล่าวหาและการรับรู้ความน่าเชื่อถือของผู้กล่าวหา

บทความนี้เสนอการประเมินการเปลี่ยนแปลงความเชื่อแทนที่จะอาศัยเฉพาะผลลัพธ์สุดท้ายของเกมการหักล้างทางสังคม ในการตั้งค่า โมเดลฝั่งหมู่บ้านที่สังเกตการณ์จะได้รับข้อความในเกม รวมถึงความสงสัยและการกล่าวหา และนักวิจัยจะวัดว่าความเชื่อของมันเปลี่ยนไปอย่างไรหลังจากแต่ละข้อความ

รายงานเชิงนามธรรมเป็นผลมาจากการกำหนดค่า LLM แบบ open-weight 40 รายการ และข้อความที่มีคำอธิบายประกอบ 1,224 รายการ โมเดลขนาดใหญ่ทำงานได้ดีกว่าในการแยกแยะหมาป่าจากชาวบ้านโดยใช้ประวัติเกมทั้งหมด อย่างไรก็ตาม ข้อกล่าวหายังคงเพิ่มความสงสัยต่อผู้ถูกกล่าวหาและลดความสงสัยต่อผู้กล่าวหา โดยเฉพาะอย่างยิ่งเมื่อผู้กล่าวหาได้รับความไว้วางใจแล้ว

รูปแบบการรายงานยังคงอยู่แม้ว่าผู้กล่าวหาที่เชื่อถือได้จะอยู่ในแนวเดียวกับหมาป่าก็ตาม โมเดลขนาดใหญ่สามารถต้านทานข้อกล่าวหาจากผู้กล่าวหาที่พวกเขาไม่ไว้วางใจได้ดีกว่า แต่โมเดลที่มีพารามิเตอร์มากถึง 120 พันล้านยังคงประสบปัญหาในการรวมเนื้อหาของข้อกล่าวหาเข้ากับความน่าเชื่อถือของแหล่งที่มา แหล่งที่มาไม่ได้ให้คะแนนต่อแบบจำลองโดยละเอียด ความไม่แน่นอนทางสถิติ หรือการจำลองแบบอิสระในข้อความที่ให้มา

รายละเอียดที่มา: arxiv.org ↗

ทำไมมันถึงสำคัญ

การศึกษาระบุจุดอ่อนเฉพาะในการสื่อสารเชิงกลยุทธ์: แบบจำลองอาจไม่สามารถแยกความน่าเชื่อถือของผู้พูดออกจากหลักฐานที่มีอยู่ในคำกล่าวอ้างของผู้พูดนั้นได้อย่างเพียงพอ นั่นสำคัญสำหรับตัวแทน LLM ที่ดำเนินการในการตั้งค่าซึ่งข้อความสามารถเลือกได้ หลอกลวง หรือเป็นปฏิปักษ์ ผลลัพธ์ที่ได้คือเกณฑ์มาตรฐานและผลการวิจัย ไม่ใช่หลักฐานว่าระบบ AI ที่ใช้งานทั้งหมดมีพฤติกรรมเช่นนี้ หรือการประเมินเป็นภาพรวมมากกว่ามนุษย์หมาป่า

สำหรับนักวิจัยที่ประเมินตัวแทน LLM ผลลัพธ์ชี้ให้เห็นว่าความสำเร็จในเกมสุดท้ายอาจปกปิดจุดอ่อนที่สำคัญในการให้เหตุผลระดับกลางและการอัปเดตความเชื่อ แบบจำลองสามารถบรรลุการตัดสินใจที่สมเหตุสมผลในขณะที่ยังคงมีน้ำหนักเกินของผู้ยื่นคำร้อง แทนที่จะประเมินคำกล่าวอ้างควบคู่ไปกับหลักฐานที่มีอยู่

ความหมายในทางปฏิบัติมีจำกัดแต่มีประโยชน์: การประเมินตัวแทนที่สื่อสารหรือตัดสินใจจากรายงานหลายฉบับอาจจำเป็นต้องวัดการเปลี่ยนแปลงความเชื่อหลังจากข้อความแต่ละรายการ รวมถึงกรณีที่ผู้พูดที่น่าเชื่อถือทำให้เข้าใจผิด การศึกษาไม่ได้แสดงให้เห็นว่าพฤติกรรมเดียวกันนี้เกิดขึ้นในผลิตภัณฑ์ที่ปรับใช้หรือในการตั้งค่าที่ไม่ใช่เกม

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

เกณฑ์มาตรฐานและโค้ดสามารถดูได้จากเว็บไซต์ของโครงการ แต่แหล่งที่มาไม่ได้ระบุใบอนุญาต รายละเอียดโฮสติ้ง หรือโมเดลที่ได้รับการประเมินนั้นพร้อมใช้งานสาธารณะหรือไม่ การทำงานเพิ่มเติมควรทดสอบว่าการค้นพบนี้ถ่ายโอนไปยังงานการสื่อสารอื่นๆ หรือไม่ การฝึกอบรมช่วยปรับปรุงการใช้เหตุผลของเนื้อหาต้นฉบับหรือไม่ และผลลัพธ์จะขึ้นอยู่กับการออกแบบเกมและตัวเลือกคำอธิบายประกอบมากน้อยเพียงใด

ผู้เขียนกล่าวว่าเกณฑ์มาตรฐานและรหัสมีอยู่ที่หน้าโครงการที่เชื่อมโยง แหล่งที่มาที่ให้มาไม่ได้จัดทำเอกสารข้อกำหนดในการเข้าถึง ใบอนุญาต ราคา กรอบงานที่รองรับ หรือการวัดประสิทธิภาพรวมเอาท์พุตของโมเดลนอกเหนือจากข้อความที่มีคำอธิบายประกอบหรือไม่

สิ่งที่ไม่ทราบที่สำคัญ ได้แก่ วิธีสร้างและใส่คำอธิบายประกอบข้อความ วิธีสร้างความน่าเชื่อถือ ผลลัพธ์มีความแข็งแกร่งทางสถิติในแต่ละโมเดลหรือไม่ และการให้เหตุผลเกี่ยวกับประวัติเกมที่ได้รับการปรับปรุงของโมเดลที่ใหญ่กว่านั้นแปลไปสู่การต่อต้านการบงการได้ดีขึ้นหรือไม่

การจำลองแบบในงานการสื่อสารเชิงกลยุทธ์อื่นๆ จะช่วยพิจารณาว่านี่เป็นผลกระทบเฉพาะของมนุษย์หมาป่าหรือข้อจำกัดที่กว้างขึ้นในการที่ตัวแทน LLM รวมความน่าเชื่อถือของแหล่งที่มาเข้ากับเนื้อหาข้อกล่าวหา

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIตัวแทนเอไอจริยธรรม AIทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?