Înapoi la Știri
InovațieAI Understanding briefing

Valoarea de referință Werewolf constată că LLM-urile pot supraevalua acuzatorii de încredere

Un etalon de 40 de configurații LLM deschise a constatat că acuzațiile pot schimba convingerile modelelor chiar și atunci când acuzatorul este aliniat cu partea opusă.

4 min readRead the primary source
Source-provided image accompanying Werewolf benchmark finds LLMs can overvalue trusted accusers
Document sursă primarăSursa înregistrată
Editor
arxiv.org
Link sursă
arxiv.orghttps://arxiv.org/abs/2609.12446
Tip sursă
Document principal — un anunț oficial, hârtie, depunere sau pagină primară pe care o citim direct.
ContextÎnțelege asta în 60 de secunde

Începeți de aici

Termeni cheie

Benchmark
Un test standardizat sau un set de date utilizat pentru a măsura și compara performanța modelului.
Model de limbă mare (LLM)
Un model de limbaj instruit pe corpuri de text masive pentru a genera și analiza text.
Adnotare
Etichete sau metadate adăugate de oameni utilizate pentru a instrui sau evalua modele de învățare automată.
Testează-teTest explicativ pentru modelele AI

Ce sa întâmplat

Cercetătorii au introdus un punct de referință Werewolf care măsoară modul în care observatorii LLM își actualizează convingerile după ce au primit mesaje de suspiciune și acuzație. Din 1.224 de mesaje adnotate și 40 de configurații de model deschis, modelele mai mari au identificat mai des adevărații lupi din istoria jocului, dar au rămas puternic influențate de acuzații și de încrederea percepută a acuzatorului.

Lucrarea propune evaluarea schimbărilor de credință, mai degrabă decât să se bazeze doar pe rezultatul final al unui joc de deducție socială. În configurația sa, un model de observare din partea satului primește mesaje de joc, inclusiv suspiciuni și acuzații, iar cercetătorii măsoară modul în care se schimbă convingerile sale după fiecare mesaj.

Rapoartele rezumate rezultă din 40 de configurații LLM deschise și 1.224 de mesaje adnotate. Modelele mai mari au avut rezultate mai bune la deosebirea lupii de săteni folosind istoria completă a jocului. Cu toate acestea, acuzațiile încă au crescut suspiciunea față de acuzat și au redus suspiciunea față de acuzator, în special atunci când acuzatorul era deja de încredere.

Tiparul raportat a persistat chiar și atunci când acuzatorul de încredere era aliniat cu lupul. Modelele mai mari au putut rezista mai bine acuzațiilor din partea acuzatorilor în care nu aveau deja încredere, dar modelele de până la 120 de miliarde de parametri încă s-au luptat să integreze conținutul acuzației cu fiabilitatea sursei sale. Sursa nu oferă scoruri detaliate pentru fiecare model, incertitudine statistică sau replicare independentă în textul furnizat.

Detalii sursa: arxiv.org ↗

De ce contează

Studiul identifică o slăbiciune specifică în comunicarea strategică: modelele pot să nu separe în mod adecvat credibilitatea unui vorbitor de dovezile conținute în afirmația acelui vorbitor. Acest lucru contează pentru agenții LLM care operează în setări în care mesajele pot fi selective, înșelătoare sau contradictorii. Rezultatul este o descoperire de referință și o cercetare, nu o dovadă că toate sistemele AI implementate se comportă în acest fel sau că evaluarea se generalizează dincolo de Werewolf.

Pentru cercetătorii care evaluează agenții LLM, rezultatul sugerează că succesul final al jocului poate ascunde slăbiciuni importante în raționamentul intermediar și actualizarea credințelor. Un model poate ajunge la o decizie plauzibilă în timp ce încă supraponderează cine a prezentat o cerere, mai degrabă decât să evalueze cererea împreună cu dovezile disponibile.

Implicația practică este limitată, dar utilă: evaluările agenților care comunică sau iau decizii din mai multe rapoarte pot avea nevoie să măsoare schimbările de convingeri după mesaje individuale, inclusiv cazurile în care un vorbitor credibil induce în eroare. Studiul nu stabilește că același comportament are loc în produsele implementate sau în setările non-game.

Interactive Mechanism

Mecanism interactiv: cum funcționează de fapt

Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificare interactivă a conceptului+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Ce să urmărești în continuare

-ul și codul sunt disponibile pe site-ul web al proiectului, dar sursa nu precizează detalii privind licențele, găzduirea sau dacă modelele evaluate sunt disponibile pentru uz public. Lucrările ulterioare ar trebui să testeze dacă descoperirea se transferă la alte sarcini de comunicare, dacă antrenamentul îmbunătățește raționamentul sursă-conținut și cât de mult rezultatele depind de designul jocului și alegerile de adnotare.

Autorii spun că -ul și codul sunt disponibile pe pagina proiectului legată. Sursa furnizată nu documentează cerințele de acces, licențele, prețurile, cadrele acceptate sau dacă benchmark-ul include rezultate ale modelului dincolo de mesajele adnotate.

Necunoscutele importante includ modul în care mesajele au fost generate și adnotate, cum s-a stabilit încrederea, dacă rezultatele sunt robuste din punct de vedere statistic pentru modelele individuale și dacă raționamentul îmbunătățit al istoriei jocului al modelelor mai mari se traduce printr-o rezistență mai bună la manipulare.

Replicarea în alte sarcini de comunicare strategică ar ajuta la determinarea dacă acesta este un efect specific vârcolacului sau o limitare mai largă în modul în care agenții LLM combină credibilitatea sursei cu conținutul acuzațiilor.

Ghiduri și chestionare conexe

Modelele AI explicateAgenți AIEtica IATestați ceea ce știți — încercați un test AI gratuitCăutați un termen AI în glosarul nostruUrmați instrumentul de urmărire a lansării modelului AI
Ai găsit asta util?