เกิดอะไรขึ้น
นักวิจัยได้แนะนำเกณฑ์มาตรฐานของมนุษย์หมาป่าซึ่งวัดว่าการสังเกต LLM อัปเดตความเชื่อของตนอย่างไร หลังจากได้รับข้อความที่น่าสงสัยและข้อกล่าวหา ในข้อความที่มีคำอธิบายประกอบ 1,224 ข้อความและการกำหนดค่าโมเดลน้ำหนักเปิด 40 แบบ โมเดลขนาดใหญ่มักจะระบุหมาป่าที่แท้จริงจากประวัติเกมได้ แต่ยังคงได้รับอิทธิพลอย่างมากจากการกล่าวหาและการรับรู้ความน่าเชื่อถือของผู้กล่าวหา
บทความนี้เสนอการประเมินการเปลี่ยนแปลงความเชื่อแทนที่จะอาศัยเฉพาะผลลัพธ์สุดท้ายของเกมการหักล้างทางสังคม ในการตั้งค่า โมเดลฝั่งหมู่บ้านที่สังเกตการณ์จะได้รับข้อความในเกม รวมถึงความสงสัยและการกล่าวหา และนักวิจัยจะวัดว่าความเชื่อของมันเปลี่ยนไปอย่างไรหลังจากแต่ละข้อความ
รายงานเชิงนามธรรมเป็นผลมาจากการกำหนดค่า LLM แบบ open-weight 40 รายการ และข้อความที่มีคำอธิบายประกอบ 1,224 รายการ โมเดลขนาดใหญ่ทำงานได้ดีกว่าในการแยกแยะหมาป่าจากชาวบ้านโดยใช้ประวัติเกมทั้งหมด อย่างไรก็ตาม ข้อกล่าวหายังคงเพิ่มความสงสัยต่อผู้ถูกกล่าวหาและลดความสงสัยต่อผู้กล่าวหา โดยเฉพาะอย่างยิ่งเมื่อผู้กล่าวหาได้รับความไว้วางใจแล้ว
รูปแบบการรายงานยังคงอยู่แม้ว่าผู้กล่าวหาที่เชื่อถือได้จะอยู่ในแนวเดียวกับหมาป่าก็ตาม โมเดลขนาดใหญ่สามารถต้านทานข้อกล่าวหาจากผู้กล่าวหาที่พวกเขาไม่ไว้วางใจได้ดีกว่า แต่โมเดลที่มีพารามิเตอร์มากถึง 120 พันล้านยังคงประสบปัญหาในการรวมเนื้อหาของข้อกล่าวหาเข้ากับความน่าเชื่อถือของแหล่งที่มา แหล่งที่มาไม่ได้ให้คะแนนต่อแบบจำลองโดยละเอียด ความไม่แน่นอนทางสถิติ หรือการจำลองแบบอิสระในข้อความที่ให้มา
ทำไมมันถึงสำคัญ
การศึกษาระบุจุดอ่อนเฉพาะในการสื่อสารเชิงกลยุทธ์: แบบจำลองอาจไม่สามารถแยกความน่าเชื่อถือของผู้พูดออกจากหลักฐานที่มีอยู่ในคำกล่าวอ้างของผู้พูดนั้นได้อย่างเพียงพอ นั่นสำคัญสำหรับตัวแทน LLM ที่ดำเนินการในการตั้งค่าซึ่งข้อความสามารถเลือกได้ หลอกลวง หรือเป็นปฏิปักษ์ ผลลัพธ์ที่ได้คือเกณฑ์มาตรฐานและผลการวิจัย ไม่ใช่หลักฐานว่าระบบ AI ที่ใช้งานทั้งหมดมีพฤติกรรมเช่นนี้ หรือการประเมินเป็นภาพรวมมากกว่ามนุษย์หมาป่า
สำหรับนักวิจัยที่ประเมินตัวแทน LLM ผลลัพธ์ชี้ให้เห็นว่าความสำเร็จในเกมสุดท้ายอาจปกปิดจุดอ่อนที่สำคัญในการให้เหตุผลระดับกลางและการอัปเดตความเชื่อ แบบจำลองสามารถบรรลุการตัดสินใจที่สมเหตุสมผลในขณะที่ยังคงมีน้ำหนักเกินของผู้ยื่นคำร้อง แทนที่จะประเมินคำกล่าวอ้างควบคู่ไปกับหลักฐานที่มีอยู่
ความหมายในทางปฏิบัติมีจำกัดแต่มีประโยชน์: การประเมินตัวแทนที่สื่อสารหรือตัดสินใจจากรายงานหลายฉบับอาจจำเป็นต้องวัดการเปลี่ยนแปลงความเชื่อหลังจากข้อความแต่ละรายการ รวมถึงกรณีที่ผู้พูดที่น่าเชื่อถือทำให้เข้าใจผิด การศึกษาไม่ได้แสดงให้เห็นว่าพฤติกรรมเดียวกันนี้เกิดขึ้นในผลิตภัณฑ์ที่ปรับใช้หรือในการตั้งค่าที่ไม่ใช่เกม
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
เกณฑ์มาตรฐานและโค้ดสามารถดูได้จากเว็บไซต์ของโครงการ แต่แหล่งที่มาไม่ได้ระบุใบอนุญาต รายละเอียดโฮสติ้ง หรือโมเดลที่ได้รับการประเมินนั้นพร้อมใช้งานสาธารณะหรือไม่ การทำงานเพิ่มเติมควรทดสอบว่าการค้นพบนี้ถ่ายโอนไปยังงานการสื่อสารอื่นๆ หรือไม่ การฝึกอบรมช่วยปรับปรุงการใช้เหตุผลของเนื้อหาต้นฉบับหรือไม่ และผลลัพธ์จะขึ้นอยู่กับการออกแบบเกมและตัวเลือกคำอธิบายประกอบมากน้อยเพียงใด
ผู้เขียนกล่าวว่าเกณฑ์มาตรฐานและรหัสมีอยู่ที่หน้าโครงการที่เชื่อมโยง แหล่งที่มาที่ให้มาไม่ได้จัดทำเอกสารข้อกำหนดในการเข้าถึง ใบอนุญาต ราคา กรอบงานที่รองรับ หรือการวัดประสิทธิภาพรวมเอาท์พุตของโมเดลนอกเหนือจากข้อความที่มีคำอธิบายประกอบหรือไม่
สิ่งที่ไม่ทราบที่สำคัญ ได้แก่ วิธีสร้างและใส่คำอธิบายประกอบข้อความ วิธีสร้างความน่าเชื่อถือ ผลลัพธ์มีความแข็งแกร่งทางสถิติในแต่ละโมเดลหรือไม่ และการให้เหตุผลเกี่ยวกับประวัติเกมที่ได้รับการปรับปรุงของโมเดลที่ใหญ่กว่านั้นแปลไปสู่การต่อต้านการบงการได้ดีขึ้นหรือไม่
การจำลองแบบในงานการสื่อสารเชิงกลยุทธ์อื่นๆ จะช่วยพิจารณาว่านี่เป็นผลกระทบเฉพาะของมนุษย์หมาป่าหรือข้อจำกัดที่กว้างขึ้นในการที่ตัวแทน LLM รวมความน่าเชื่อถือของแหล่งที่มาเข้ากับเนื้อหาข้อกล่าวหา