Vad hände
Forskare introducerade ett Werewolf-riktmärke som mäter hur observerande LLMs uppdaterar sina övertygelser efter att ha fått misstankar och anklagelser. Över 1 224 kommenterade meddelanden och 40 modellkonfigurationer med öppen vikt identifierade större modeller oftare sanna vargar från spelets historia men förblev starkt påverkade av anklagelser och anklagarens upplevda trovärdighet.
Uppsatsen föreslår att man utvärderar trosskiften snarare än att bara förlita sig på det slutliga resultatet av ett socialt avdragsspel. I sin uppställning tar en observerande modell vid byn emot spelmeddelanden, inklusive misstankar och anklagelser, och forskare mäter hur dess övertygelser förändras efter varje meddelande.
Sammanfattningsrapporterna är resultatet av 40 öppna LLM-konfigurationer och 1 224 kommenterade meddelanden. Större modeller presterade bättre på att skilja vargar från bybor med hjälp av hela spelhistoriken. Men anklagelserna ökade fortfarande misstänksamheten mot den anklagade och minskade misstänksamheten mot den anklagade, särskilt när anklagaren redan var betrodd.
Det rapporterade mönstret bestod även när den betrodda anklagaren var vargjusterad. Större modeller kunde bättre motstå anklagelser från anklagare som de redan misstrodde, men modeller upp till 120 miljarder parametrar kämpade fortfarande för att integrera anklagelsens innehåll med tillförlitligheten hos dess källa. Källan ger inga detaljerade poäng per modell, statistisk osäkerhet eller oberoende replikering i den medföljande texten.
Varför det spelar roll
Studien identifierar en specifik svaghet i strategisk kommunikation: modeller kanske inte på ett adekvat sätt separerar en talares trovärdighet från bevisen i den talarens påstående. Det är viktigt för LLM-agenter som arbetar i inställningar där meddelanden kan vara selektiva, vilseledande eller motstridiga. Resultatet är ett riktmärke och forskningsresultat, inte bevis för att alla utplacerade AI-system beter sig på detta sätt eller att utvärderingen generaliserar bortom Werewolf.
För forskare som utvärderar LLM-agenter tyder resultatet på att den slutliga spelframgången kan dölja viktiga svagheter i mellanliggande resonemang och trosuppdatering. En modell kan nå ett rimligt beslut samtidigt som den övervikter vem som lämnat ett krav snarare än att bedöma påståendet tillsammans med den tillgängliga bevisningen.
Den praktiska innebörden är begränsad men användbar: utvärderingar av agenter som kommunicerar eller fattar beslut från flera rapporter kan behöva mäta trosförändringar efter individuella meddelanden, inklusive fall där en trovärdig talare är vilseledande. Studien fastställer inte att samma beteende förekommer i distribuerade produkter eller i icke-spelmiljöer.
Interaktiv mekanism: hur det faktiskt fungerar
Utforska den underliggande tekniken bakom denna utveckling interaktivt.
Which component of an AI application is the machine-learning model itself?
Vad du ska titta på härnäst
Riktmärket och koden är tillgängliga via projektets webbplats, men källan anger inte licensiering, värddetaljer eller om de utvärderade modellerna är tillgängliga för allmänt bruk. Fortsatt arbete bör testa om upptäckten överförs till andra kommunikationsuppgifter, om träning förbättrar källinnehållsresonemang och hur mycket resultat som beror på speldesign och anteckningsval.
Författarna säger att riktmärket och koden är tillgängliga på den länkade projektsidan. Den medföljande källan dokumenterar inte åtkomstkrav, licensiering, prissättning, ramverk som stöds eller om riktmärket inkluderar modellutdata utöver de kommenterade meddelandena.
Viktiga okända faktorer inkluderar hur meddelandena genererades och kommenterades, hur förtroende etablerades, om resultaten är statistiskt robusta över enskilda modeller och om större modellers förbättrade spelhistoriska resonemang översätter till bättre motståndskraft mot manipulation.
Replikering över andra strategiska kommunikationsuppgifter skulle hjälpa till att avgöra om detta är en varulvsspecifik effekt eller en bredare begränsning i hur LLM-agenter kombinerar källans trovärdighet med anklagelseinnehåll.