Ce sa întâmplat
Cercetătorii au introdus un punct de referință Werewolf care măsoară modul în care observatorii LLM își actualizează convingerile după ce au primit mesaje de suspiciune și acuzație. Din 1.224 de mesaje adnotate și 40 de configurații de model deschis, modelele mai mari au identificat mai des adevărații lupi din istoria jocului, dar au rămas puternic influențate de acuzații și de încrederea percepută a acuzatorului.
Lucrarea propune evaluarea schimbărilor de credință, mai degrabă decât să se bazeze doar pe rezultatul final al unui joc de deducție socială. În configurația sa, un model de observare din partea satului primește mesaje de joc, inclusiv suspiciuni și acuzații, iar cercetătorii măsoară modul în care se schimbă convingerile sale după fiecare mesaj.
Rapoartele rezumate rezultă din 40 de configurații LLM deschise și 1.224 de mesaje adnotate. Modelele mai mari au avut rezultate mai bune la deosebirea lupii de săteni folosind istoria completă a jocului. Cu toate acestea, acuzațiile încă au crescut suspiciunea față de acuzat și au redus suspiciunea față de acuzator, în special atunci când acuzatorul era deja de încredere.
Tiparul raportat a persistat chiar și atunci când acuzatorul de încredere era aliniat cu lupul. Modelele mai mari au putut rezista mai bine acuzațiilor din partea acuzatorilor în care nu aveau deja încredere, dar modelele de până la 120 de miliarde de parametri încă s-au luptat să integreze conținutul acuzației cu fiabilitatea sursei sale. Sursa nu oferă scoruri detaliate pentru fiecare model, incertitudine statistică sau replicare independentă în textul furnizat.
De ce contează
Studiul identifică o slăbiciune specifică în comunicarea strategică: modelele pot să nu separe în mod adecvat credibilitatea unui vorbitor de dovezile conținute în afirmația acelui vorbitor. Acest lucru contează pentru agenții LLM care operează în setări în care mesajele pot fi selective, înșelătoare sau contradictorii. Rezultatul este o descoperire de referință și o cercetare, nu o dovadă că toate sistemele AI implementate se comportă în acest fel sau că evaluarea se generalizează dincolo de Werewolf.
Pentru cercetătorii care evaluează agenții LLM, rezultatul sugerează că succesul final al jocului poate ascunde slăbiciuni importante în raționamentul intermediar și actualizarea credințelor. Un model poate ajunge la o decizie plauzibilă în timp ce încă supraponderează cine a prezentat o cerere, mai degrabă decât să evalueze cererea împreună cu dovezile disponibile.
Implicația practică este limitată, dar utilă: evaluările agenților care comunică sau iau decizii din mai multe rapoarte pot avea nevoie să măsoare schimbările de convingeri după mesaje individuale, inclusiv cazurile în care un vorbitor credibil induce în eroare. Studiul nu stabilește că același comportament are loc în produsele implementate sau în setările non-game.
Mecanism interactiv: cum funcționează de fapt
Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.
Which component of an AI application is the machine-learning model itself?
Ce să urmărești în continuare
-ul și codul sunt disponibile pe site-ul web al proiectului, dar sursa nu precizează detalii privind licențele, găzduirea sau dacă modelele evaluate sunt disponibile pentru uz public. Lucrările ulterioare ar trebui să testeze dacă descoperirea se transferă la alte sarcini de comunicare, dacă antrenamentul îmbunătățește raționamentul sursă-conținut și cât de mult rezultatele depind de designul jocului și alegerile de adnotare.
Autorii spun că -ul și codul sunt disponibile pe pagina proiectului legată. Sursa furnizată nu documentează cerințele de acces, licențele, prețurile, cadrele acceptate sau dacă benchmark-ul include rezultate ale modelului dincolo de mesajele adnotate.
Necunoscutele importante includ modul în care mesajele au fost generate și adnotate, cum s-a stabilit încrederea, dacă rezultatele sunt robuste din punct de vedere statistic pentru modelele individuale și dacă raționamentul îmbunătățit al istoriei jocului al modelelor mai mari se traduce printr-o rezistență mai bună la manipulare.
Replicarea în alte sarcini de comunicare strategică ar ajuta la determinarea dacă acesta este un efect specific vârcolacului sau o limitare mai largă în modul în care agenții LLM combină credibilitatea sursei cu conținutul acuzațiilor.