Kembali ke Berita
InovasiAI Understanding pengarahan

Tolok ukur Werewolf menemukan bahwa LLM dapat menilai terlalu tinggi para penuduh yang tepercaya

Tolok ukur dari 40 konfigurasi LLM open-weight menemukan bahwa tuduhan dapat mengubah keyakinan model bahkan ketika penuduh bersekutu dengan pihak lawan.

4 min readRead the primary source
Source-provided image accompanying Werewolf benchmark finds LLMs can overvalue trusted accusers
Dokumen sumber utamaSumber direkam
Penerbit
arxiv.org
Tautan sumber
arxiv.orghttps://arxiv.org/abs/2609.12446
Jenis sumber
Dokumen primer — pengumuman resmi, makalah, pengarsipan, atau halaman pihak pertama yang kita baca langsung.
KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

Tolok ukur
Tes atau kumpulan data standar yang digunakan untuk mengukur dan membandingkan kinerja model.
Model Bahasa Besar (LLM)
Model bahasa yang dilatih pada corpora teks besar untuk menghasilkan dan menganalisis teks.
Anotasi
Label atau metadata yang ditambahkan manusia digunakan untuk melatih atau mengevaluasi model pembelajaran mesin.
Uji diri Anda sendiriKuis Penjelasan Model AI

Apa yang terjadi

Para peneliti memperkenalkan tolok ukur Werewolf yang mengukur bagaimana LLM yang mengamati memperbarui keyakinan mereka setelah menerima pesan kecurigaan dan tuduhan. Dari 1.224 pesan beranotasi dan 40 konfigurasi model bobot terbuka, model yang lebih besar lebih sering mengidentifikasi serigala sejati dari sejarah permainan, namun tetap sangat dipengaruhi oleh tuduhan dan persepsi penuduh yang dapat dipercaya.

Makalah ini mengusulkan untuk mengevaluasi perubahan keyakinan dibandingkan hanya mengandalkan hasil akhir dari permainan deduksi sosial. Dalam pengaturannya, model observasi sisi desa menerima pesan permainan, termasuk kecurigaan dan tuduhan, dan peneliti mengukur bagaimana keyakinannya berubah setelah setiap pesan.

Laporan abstrak dihasilkan dari 40 konfigurasi LLM open-weight dan 1.224 pesan beranotasi. Model yang lebih besar memiliki kinerja lebih baik dalam membedakan serigala dari penduduk desa menggunakan riwayat permainan lengkap. Namun tuduhan tetap meningkatkan kecurigaan terhadap terdakwa dan mengurangi kecurigaan terhadap penuduh, terutama ketika penuduh sudah dipercaya.

Pola yang dilaporkan tetap ada bahkan ketika penuduh terpercaya berpihak pada serigala. Model yang lebih besar lebih mampu menolak tuduhan dari para penuduh yang sudah tidak mereka percayai, namun model dengan parameter hingga 120 miliar masih kesulitan untuk mengintegrasikan konten tuduhan tersebut dengan keandalan sumbernya. Sumber ini tidak memberikan rincian skor per model, ketidakpastian statistik, atau replikasi independen dalam teks yang disediakan.

Detail sumber: arxiv.org ↗

Mengapa itu penting

Studi ini mengidentifikasi kelemahan spesifik dalam komunikasi strategis: model mungkin tidak cukup memisahkan kredibilitas pembicara dari bukti yang terkandung dalam klaim pembicara. Hal ini penting bagi agen LLM yang beroperasi di lingkungan di mana pesan bisa bersifat selektif, menipu, atau bermusuhan. Hasilnya adalah sebuah tolok ukur dan temuan penelitian, bukan bukti bahwa semua sistem AI yang diterapkan berperilaku seperti ini atau bahwa evaluasi tersebut bersifat generalisasi di luar Werewolf.

Bagi peneliti yang mengevaluasi agen LLM, hasilnya menunjukkan bahwa keberhasilan permainan akhir mungkin menyembunyikan kelemahan penting dalam penalaran menengah dan pemutakhiran keyakinan. Sebuah model dapat mencapai keputusan yang masuk akal namun tetap memberikan bobot yang berlebihan pada pihak yang menyampaikan klaim dibandingkan menilai klaim tersebut beserta bukti yang tersedia.

Implikasi praktisnya terbatas namun berguna: evaluasi terhadap agen yang berkomunikasi atau mengambil keputusan dari berbagai laporan mungkin perlu mengukur perubahan keyakinan setelah pesan individual, termasuk kasus di mana pembicara yang kredibel menyesatkan. Studi ini tidak membuktikan bahwa perilaku yang sama terjadi pada produk yang diterapkan atau di lingkungan non-game.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Pemeriksaan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang harus ditonton selanjutnya

Tolok ukur dan kode tersedia melalui situs proyek, namun sumbernya tidak menyatakan perizinan, detail hosting, atau apakah model yang dievaluasi tersedia untuk penggunaan umum. Pekerjaan lebih lanjut harus menguji apakah temuan tersebut dapat ditransfer ke tugas komunikasi lainnya, apakah pelatihan meningkatkan penalaran konten sumber, dan seberapa besar hasil bergantung pada desain game dan pilihan anotasi.

Penulis mengatakan tolok ukur dan kode tersedia di halaman proyek tertaut. Sumber yang disediakan tidak mendokumentasikan persyaratan akses, perizinan, harga, kerangka kerja yang didukung, atau apakah tolok ukur menyertakan keluaran model di luar pesan yang dianotasi.

Hal-hal penting yang belum diketahui mencakup bagaimana pesan dihasilkan dan diberi anotasi, bagaimana kepercayaan dibangun, apakah hasilnya kuat secara statistik pada masing-masing model, dan apakah peningkatan penalaran riwayat permainan pada model yang lebih besar menghasilkan resistensi yang lebih baik terhadap manipulasi.

Replikasi di seluruh tugas komunikasi strategis lainnya akan membantu menentukan apakah ini merupakan efek khusus Manusia Serigala atau batasan yang lebih luas dalam cara agen LLM menggabungkan kredibilitas sumber dengan konten tuduhan.

Panduan & kuis terkait

Model AI DijelaskanAgen AIEtika AIUji pengetahuan Anda — coba kuis AI gratisCari istilah AI di glosarium kamiIkuti pelacak rilis model AI
Apakah ini berguna?