Kembali ke Berita
InovasiAI Understanding taklimat

Penanda aras Werewolf mendapati LLM boleh melebihkan penuduh yang dipercayai

Penanda aras 40 konfigurasi LLM berwajaran terbuka mendapati bahawa tuduhan boleh mengubah kepercayaan model walaupun apabila penuduh sejajar dengan pihak lawan.

4 min readRead the primary source
Source-provided image accompanying Werewolf benchmark finds LLMs can overvalue trusted accusers
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2609.12446
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Penanda aras
Ujian piawai atau set data yang digunakan untuk mengukur dan membandingkan prestasi model.
Model Bahasa Besar (LLM)
Model bahasa yang dilatih mengenai korpora teks besar-besaran untuk menjana dan menganalisis teks.
Anotasi
Label atau metadata tambahan manusia yang digunakan untuk melatih atau menilai model pembelajaran mesin.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Penyelidik memperkenalkan penanda aras Werewolf yang mengukur cara pemerhatian LLM mengemas kini kepercayaan mereka selepas menerima mesej syak wasangka dan tuduhan. Merentasi 1,224 mesej beranotasi dan 40 konfigurasi model berat terbuka, model yang lebih besar lebih kerap mengenal pasti serigala sebenar daripada sejarah permainan tetapi kekal kuat dipengaruhi oleh tuduhan dan kepercayaan penuduh yang dilihat.

Makalah itu mencadangkan untuk menilai anjakan kepercayaan dan bukannya hanya bergantung pada hasil akhir permainan potongan sosial. Dalam persediaannya, model sebelah kampung yang memerhati menerima mesej permainan, termasuk syak wasangka dan tuduhan, dan penyelidik mengukur cara kepercayaannya berubah selepas setiap mesej.

Laporan abstrak terhasil daripada 40 konfigurasi LLM berat terbuka dan 1,224 mesej beranotasi. Model yang lebih besar menunjukkan prestasi yang lebih baik dalam membezakan serigala daripada penduduk kampung menggunakan sejarah permainan penuh. Walau bagaimanapun, tuduhan masih meningkatkan syak wasangka terhadap tertuduh dan mengurangkan syak wasangka terhadap penuduh, terutamanya apabila penuduh sudah dipercayai.

Corak yang dilaporkan berterusan walaupun penuduh yang dipercayai adalah sejajar dengan serigala. Model yang lebih besar lebih mampu menahan tuduhan daripada penuduh yang telah mereka tidak percayai, tetapi model sehingga 120 bilion parameter masih bergelut untuk menyepadukan kandungan tuduhan dengan kebolehpercayaan sumbernya. Sumber tidak memberikan skor setiap model terperinci, ketidakpastian statistik atau replikasi bebas dalam teks yang dibekalkan.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Kajian itu mengenal pasti kelemahan khusus dalam komunikasi strategik: model mungkin tidak memisahkan kredibiliti penceramah dengan secukupnya daripada bukti yang terkandung dalam dakwaan penceramah tersebut. Itu penting bagi ejen LLM yang beroperasi dalam tetapan yang mesej boleh menjadi selektif, mengelirukan atau bermusuhan. Hasilnya ialah penanda aras dan dapatan penyelidikan, bukan bukti bahawa semua sistem AI yang digunakan berkelakuan seperti ini atau penilaian itu digeneralisasikan di luar Werewolf.

Bagi penyelidik yang menilai ejen LLM, keputusan menunjukkan bahawa kejayaan permainan akhir mungkin menyembunyikan kelemahan penting dalam penaakulan pertengahan dan pengemaskinian kepercayaan. Model boleh mencapai keputusan yang munasabah sambil masih menimbang berlebihan siapa yang menyampaikan tuntutan dan bukannya menilai tuntutan bersama bukti yang ada.

Implikasi praktikal adalah terhad tetapi berguna: penilaian ejen yang berkomunikasi atau membuat keputusan daripada berbilang laporan mungkin perlu mengukur perubahan kepercayaan selepas mesej individu, termasuk kes di mana penceramah yang boleh dipercayai mengelirukan. Kajian itu tidak menetapkan bahawa tingkah laku yang sama berlaku dalam produk yang digunakan atau dalam tetapan bukan permainan.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Penanda aras dan kod tersedia melalui tapak web projek, tetapi sumbernya tidak menyatakan pelesenan, butiran pengehosan atau sama ada model yang dinilai tersedia untuk kegunaan awam. Kerja selanjutnya harus menguji sama ada penemuan dipindahkan ke tugas komunikasi lain, sama ada latihan meningkatkan penaakulan kandungan sumber dan berapa banyak hasil bergantung pada reka bentuk permainan dan pilihan anotasi.

Penulis mengatakan penanda aras dan kod tersedia di halaman projek yang dipautkan. Sumber yang dibekalkan tidak mendokumenkan keperluan akses, pelesenan, harga, rangka kerja yang disokong atau sama ada penanda aras termasuk output model di luar mesej beranotasi.

Perkara yang tidak diketahui penting termasuk cara mesej dijana dan diberi anotasi, cara kepercayaan diwujudkan, sama ada hasilnya kukuh secara statistik merentas model individu dan sama ada penaakulan sejarah permainan yang dipertingkatkan oleh model yang lebih besar diterjemahkan kepada rintangan yang lebih baik terhadap manipulasi.

Replikasi merentas tugas komunikasi strategik lain akan membantu menentukan sama ada ini adalah kesan khusus Werewolf atau had yang lebih luas dalam cara ejen LLM menggabungkan kredibiliti sumber dengan kandungan tuduhan.

Panduan & kuiz berkaitan

Model AI DiterangkanEjen AIEtika AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?