Apa yang berlaku
Penyelidik memperkenalkan penanda aras Werewolf yang mengukur cara pemerhatian LLM mengemas kini kepercayaan mereka selepas menerima mesej syak wasangka dan tuduhan. Merentasi 1,224 mesej beranotasi dan 40 konfigurasi model berat terbuka, model yang lebih besar lebih kerap mengenal pasti serigala sebenar daripada sejarah permainan tetapi kekal kuat dipengaruhi oleh tuduhan dan kepercayaan penuduh yang dilihat.
Makalah itu mencadangkan untuk menilai anjakan kepercayaan dan bukannya hanya bergantung pada hasil akhir permainan potongan sosial. Dalam persediaannya, model sebelah kampung yang memerhati menerima mesej permainan, termasuk syak wasangka dan tuduhan, dan penyelidik mengukur cara kepercayaannya berubah selepas setiap mesej.
Laporan abstrak terhasil daripada 40 konfigurasi LLM berat terbuka dan 1,224 mesej beranotasi. Model yang lebih besar menunjukkan prestasi yang lebih baik dalam membezakan serigala daripada penduduk kampung menggunakan sejarah permainan penuh. Walau bagaimanapun, tuduhan masih meningkatkan syak wasangka terhadap tertuduh dan mengurangkan syak wasangka terhadap penuduh, terutamanya apabila penuduh sudah dipercayai.
Corak yang dilaporkan berterusan walaupun penuduh yang dipercayai adalah sejajar dengan serigala. Model yang lebih besar lebih mampu menahan tuduhan daripada penuduh yang telah mereka tidak percayai, tetapi model sehingga 120 bilion parameter masih bergelut untuk menyepadukan kandungan tuduhan dengan kebolehpercayaan sumbernya. Sumber tidak memberikan skor setiap model terperinci, ketidakpastian statistik atau replikasi bebas dalam teks yang dibekalkan.
Mengapa ia penting
Kajian itu mengenal pasti kelemahan khusus dalam komunikasi strategik: model mungkin tidak memisahkan kredibiliti penceramah dengan secukupnya daripada bukti yang terkandung dalam dakwaan penceramah tersebut. Itu penting bagi ejen LLM yang beroperasi dalam tetapan yang mesej boleh menjadi selektif, mengelirukan atau bermusuhan. Hasilnya ialah penanda aras dan dapatan penyelidikan, bukan bukti bahawa semua sistem AI yang digunakan berkelakuan seperti ini atau penilaian itu digeneralisasikan di luar Werewolf.
Bagi penyelidik yang menilai ejen LLM, keputusan menunjukkan bahawa kejayaan permainan akhir mungkin menyembunyikan kelemahan penting dalam penaakulan pertengahan dan pengemaskinian kepercayaan. Model boleh mencapai keputusan yang munasabah sambil masih menimbang berlebihan siapa yang menyampaikan tuntutan dan bukannya menilai tuntutan bersama bukti yang ada.
Implikasi praktikal adalah terhad tetapi berguna: penilaian ejen yang berkomunikasi atau membuat keputusan daripada berbilang laporan mungkin perlu mengukur perubahan kepercayaan selepas mesej individu, termasuk kes di mana penceramah yang boleh dipercayai mengelirukan. Kajian itu tidak menetapkan bahawa tingkah laku yang sama berlaku dalam produk yang digunakan atau dalam tetapan bukan permainan.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Penanda aras dan kod tersedia melalui tapak web projek, tetapi sumbernya tidak menyatakan pelesenan, butiran pengehosan atau sama ada model yang dinilai tersedia untuk kegunaan awam. Kerja selanjutnya harus menguji sama ada penemuan dipindahkan ke tugas komunikasi lain, sama ada latihan meningkatkan penaakulan kandungan sumber dan berapa banyak hasil bergantung pada reka bentuk permainan dan pilihan anotasi.
Penulis mengatakan penanda aras dan kod tersedia di halaman projek yang dipautkan. Sumber yang dibekalkan tidak mendokumenkan keperluan akses, pelesenan, harga, rangka kerja yang disokong atau sama ada penanda aras termasuk output model di luar mesej beranotasi.
Perkara yang tidak diketahui penting termasuk cara mesej dijana dan diberi anotasi, cara kepercayaan diwujudkan, sama ada hasilnya kukuh secara statistik merentas model individu dan sama ada penaakulan sejarah permainan yang dipertingkatkan oleh model yang lebih besar diterjemahkan kepada rintangan yang lebih baik terhadap manipulasi.
Replikasi merentas tugas komunikasi strategik lain akan membantu menentukan sama ada ini adalah kesan khusus Werewolf atau had yang lebih luas dalam cara ejen LLM menggabungkan kredibiliti sumber dengan kandungan tuduhan.