Tilbake til Nyheter
InnovasjonAI Understanding orientering

Referanse for varulv finner at LLM-er kan overvurdere pålitelige anklagere

En benchmark av 40 åpne LLM-konfigurasjoner fant at anklager kan endre modellenes tro selv når anklageren er på linje med den motsatte siden.

4 min readRead the primary source
Source-provided image accompanying Werewolf benchmark finds LLMs can overvalue trusted accusers
PrimærkildedokumentKilde registrert
Utgiver
arxiv.org
Kilde lenke
arxiv.orghttps://arxiv.org/abs/2609.12446
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Benchmark
En standardisert test eller datasett som brukes til å måle og sammenligne modellytelse.
Stor språkmodell (LLM)
En språkmodell trent på massive tekstkorpus for å generere og analysere tekst.
Merknad
Etiketter eller metadata som er lagt til mennesker, brukes til å trene eller evaluere maskinlæringsmodeller.
Test deg selvQuiz for forklaring av AI-modeller

Hva skjedde

Forskere introduserte en varulv- som måler hvordan observerende LLM-er oppdaterer deres tro etter å ha mottatt mistanke- og anklagemeldinger. På tvers av 1224 kommenterte meldinger og 40 modellkonfigurasjoner med åpen vekt, identifiserte større modeller oftere ekte ulver fra spillets historie, men forble sterkt påvirket av anklager og anklagerens oppfattede pålitelighet.

Artikkelen foreslår å evaluere trosskifter i stedet for å bare stole på det endelige resultatet av et sosialt deduksjonsspill. I oppsettet mottar en observerende modell fra landsbyen spillmeldinger, inkludert mistanker og anklager, og forskere måler hvordan troen endres etter hver melding.

Sammendragsrapportene er resultatet av 40 åpen vekt LLM-konfigurasjoner og 1224 kommenterte meldinger. Større modeller presterte bedre til å skille ulver fra landsbyboere ved å bruke hele spillets historie. Imidlertid økte anklager fortsatt mistenksomheten mot den siktede og reduserte mistanken mot anklageren, spesielt når anklageren allerede var klarert.

Det rapporterte mønsteret vedvarte selv når den pålitelige anklageren var ulvejustert. Større modeller var bedre i stand til å motstå anklager fra anklagere de allerede mistrodde, men modeller opp til 120 milliarder parametere slet fortsatt med å integrere anklagens innhold med påliteligheten til kilden. Kilden gir ingen detaljerte score per modell, statistisk usikkerhet eller uavhengig replikering i den medfølgende teksten.

Kildedetaljer: arxiv.org ↗

Hvorfor det betyr noe

Studien identifiserer en spesifikk svakhet i strategisk kommunikasjon: modeller kan kanskje ikke adskille troverdigheten til en foredragsholder fra bevisene i den foredragsholderens påstand. Det betyr noe for LLM-agenter som opererer i innstillinger der meldinger kan være selektive, villedende eller motstridende. Resultatet er en og forskningsfunn, ikke bevis på at alle utplasserte AI-systemer oppfører seg på denne måten eller at evalueringen generaliserer utover Werewolf.

For forskere som vurderer LLM-agenter, tyder resultatet på at endelig spillsuksess kan skjule viktige svakheter i mellomresonnement og trosoppdatering. En modell kan nå en plausibel avgjørelse mens den fortsatt overvekter hvem som leverte et krav i stedet for å vurdere kravet sammen med tilgjengelig bevis.

Den praktiske implikasjonen er begrenset, men nyttig: evalueringer av agenter som kommuniserer eller tar avgjørelser fra flere rapporter kan trenge å måle trosendringer etter individuelle meldinger, inkludert tilfeller der en troverdig foredragsholder er villedende. Studien fastslår ikke at den samme oppførselen forekommer i utplasserte produkter eller i ikke-spillmiljøer.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Hva du skal se neste

Referansemerket og koden er tilgjengelig via prosjektets nettside, men kilden oppgir ikke lisensiering, vertsdetaljer eller om de evaluerte modellene er tilgjengelige for offentlig bruk. Videre arbeid bør teste om funnet overføres til andre kommunikasjonsoppgaver, om trening forbedrer kildeinnholdsresonnement, og hvor mye resultater avhenger av spilldesign og merknadsvalg.

Forfatterne sier at og kode er tilgjengelig på den tilknyttede prosjektsiden. Den medfølgende kilden dokumenterer ikke tilgangskrav, lisensiering, priser, støttede rammeverk eller om referansen inkluderer modellutdata utover de kommenterte meldingene.

Viktige ukjente inkluderer hvordan meldingene ble generert og kommentert, hvordan tillit ble etablert, om resultatene er statistisk robuste på tvers av individuelle modeller, og om større modellers forbedrede spillhistorieresonnement oversetter seg til bedre motstand mot manipulasjon.

Replikering på tvers av andre strategiske kommunikasjonsoppgaver vil bidra til å avgjøre om dette er en varulvspesifikk effekt eller en bredere begrensning i hvordan LLM-agenter kombinerer kildetroverdighet med anklageinnhold.

Relaterte guider og quizer

AI-modeller forklartAI-agenterKI-etikkTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren
Fant du dette nyttig?