Tillbaka till Nyheter
InnovationAI Understanding genomgång

Benchmark för varulv finner att LLM:er kan övervärdera betrodda anklagare

Ett riktmärke av 40 öppna LLM-konfigurationer visade att anklagelser kan förändra modellers övertygelser även när anklagaren är i linje med den motsatta sidan.

4 min readRead the primary source
Source-provided image accompanying Werewolf benchmark finds LLMs can overvalue trusted accusers
Primärt källdokumentKälla inspelad
Förläggare
arxiv.org
Källlänk
arxiv.orghttps://arxiv.org/abs/2609.12446
Källtyp
Primärt dokument – ett officiellt meddelande, papper, arkivering eller förstapartssida som vi läser direkt.
SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

Referenspunkt
Ett standardiserat test eller datauppsättning som används för att mäta och jämföra modellprestanda.
Stor språkmodell (LLM)
En språkmodell tränad på massiva textkorpus för att generera och analysera text.
Anteckning
Människotillagda etiketter eller metadata som används för att träna eller utvärdera maskininlärningsmodeller.
Testa dig självAI Models Explained Quiz

Vad hände

Forskare introducerade ett Werewolf-riktmärke som mäter hur observerande LLMs uppdaterar sina övertygelser efter att ha fått misstankar och anklagelser. Över 1 224 kommenterade meddelanden och 40 modellkonfigurationer med öppen vikt identifierade större modeller oftare sanna vargar från spelets historia men förblev starkt påverkade av anklagelser och anklagarens upplevda trovärdighet.

Uppsatsen föreslår att man utvärderar trosskiften snarare än att bara förlita sig på det slutliga resultatet av ett socialt avdragsspel. I sin uppställning tar en observerande modell vid byn emot spelmeddelanden, inklusive misstankar och anklagelser, och forskare mäter hur dess övertygelser förändras efter varje meddelande.

Sammanfattningsrapporterna är resultatet av 40 öppna LLM-konfigurationer och 1 224 kommenterade meddelanden. Större modeller presterade bättre på att skilja vargar från bybor med hjälp av hela spelhistoriken. Men anklagelserna ökade fortfarande misstänksamheten mot den anklagade och minskade misstänksamheten mot den anklagade, särskilt när anklagaren redan var betrodd.

Det rapporterade mönstret bestod även när den betrodda anklagaren var vargjusterad. Större modeller kunde bättre motstå anklagelser från anklagare som de redan misstrodde, men modeller upp till 120 miljarder parametrar kämpade fortfarande för att integrera anklagelsens innehåll med tillförlitligheten hos dess källa. Källan ger inga detaljerade poäng per modell, statistisk osäkerhet eller oberoende replikering i den medföljande texten.

Källinformation: arxiv.org ↗

Varför det spelar roll

Studien identifierar en specifik svaghet i strategisk kommunikation: modeller kanske inte på ett adekvat sätt separerar en talares trovärdighet från bevisen i den talarens påstående. Det är viktigt för LLM-agenter som arbetar i inställningar där meddelanden kan vara selektiva, vilseledande eller motstridiga. Resultatet är ett riktmärke och forskningsresultat, inte bevis för att alla utplacerade AI-system beter sig på detta sätt eller att utvärderingen generaliserar bortom Werewolf.

För forskare som utvärderar LLM-agenter tyder resultatet på att den slutliga spelframgången kan dölja viktiga svagheter i mellanliggande resonemang och trosuppdatering. En modell kan nå ett rimligt beslut samtidigt som den övervikter vem som lämnat ett krav snarare än att bedöma påståendet tillsammans med den tillgängliga bevisningen.

Den praktiska innebörden är begränsad men användbar: utvärderingar av agenter som kommunicerar eller fattar beslut från flera rapporter kan behöva mäta trosförändringar efter individuella meddelanden, inklusive fall där en trovärdig talare är vilseledande. Studien fastställer inte att samma beteende förekommer i distribuerade produkter eller i icke-spelmiljöer.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konceptkontroll+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Vad du ska titta på härnäst

Riktmärket och koden är tillgängliga via projektets webbplats, men källan anger inte licensiering, värddetaljer eller om de utvärderade modellerna är tillgängliga för allmänt bruk. Fortsatt arbete bör testa om upptäckten överförs till andra kommunikationsuppgifter, om träning förbättrar källinnehållsresonemang och hur mycket resultat som beror på speldesign och anteckningsval.

Författarna säger att riktmärket och koden är tillgängliga på den länkade projektsidan. Den medföljande källan dokumenterar inte åtkomstkrav, licensiering, prissättning, ramverk som stöds eller om riktmärket inkluderar modellutdata utöver de kommenterade meddelandena.

Viktiga okända faktorer inkluderar hur meddelandena genererades och kommenterades, hur förtroende etablerades, om resultaten är statistiskt robusta över enskilda modeller och om större modellers förbättrade spelhistoriska resonemang översätter till bättre motståndskraft mot manipulation.

Replikering över andra strategiska kommunikationsuppgifter skulle hjälpa till att avgöra om detta är en varulvsspecifik effekt eller en bredare begränsning i hur LLM-agenter kombinerar källans trovärdighet med anklagelseinnehåll.

Relaterade guider och frågesporter

AI-modeller förklarasAI-agenterAI-etikTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlistaFölj AI-modellens release tracker
Hittade du detta användbart?