Tilbake til Nyheter
InnovasjonAI Understanding orientering

Papirrapporter Frontier LLM-dommere Vend dommene 25-71 % under tilbakeslag

Et nytt arXiv preprint stresstester ni grensemodeller som brukes som automatiserte gradere og rapporterer at alle endrer dommene sine under utfordring - og at de endrede dommene vanligvis beveger seg bort fra det riktige svaret, ikke mot det.

7 min readRead the primary source
Source-provided image accompanying Paper Reports Frontier LLM Judges Flip Verdicts 25-71% Under Pushback
PrimærkildedokumentKilde registrert
Utgiver
arxiv.org
Kilde lenke
arxiv.orghttps://arxiv.org/abs/2608.12645
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Stor språkmodell (LLM)
En språkmodell trent på massive tekstkorpus for å generere og analysere tekst.
Klassifikasjon
En oppgave der en modell tilordner en inngang til én eller flere forhåndsdefinerte kategorier.
Grunnsannhet
Pålitelige referanseetiketter som brukes til å trene eller evaluere modellutdata.
Test deg selvQuiz for forklaring av AI-modeller

Hva skjedde

Et forhåndstrykk lagt ut på arXiv 12. august 2026 introduserer «Wiggle Framework», en stresstest for stabiliteten til store språkmodelldommere. Ved å bruke det på ni grensemodeller på tvers av 14 dommeroppgaver, rapporterer forfatterne om vendingsrater for dom på 25-71% under statisk pushback og 62-91% mot en motstridende modellovertaler, og sier at press som endrer en dom nesten alltid er nett-korrupterende i forhold til bakkens sannhet.

Et forhåndstrykk lagt ut på arXiv 12. august 2026 argumenterer for at den vanlige måten å validere "dommere" på store språkmodeller – å måle nøyaktighet mot gylne, menneskemerkede data – går glipp av en feilmodus som betyr noe i praksis: om en dommer holder sin dom når det samme elementet blir stilt på nytt, omformulert eller argumentert mot. Avisen, med tittelen "Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence," er kreditert til Justin Zhao, Himaghna Bhattacharjee, Hannah Korevaar, Bhaktipriya Radharapu og Khalid El-Arini. Ingen institusjonelle tilknytninger vises på arXiv-oppføringssiden. Forfatterne foreslår det de kaller Wiggle Framework, en enkelt stresstest ment å gjøre stabiliteten målbar og sammenlignbar på tvers av datasett.

Rammeverket deler dommerens robusthet i tre deler. Mekanisk konsistens dekker stabilitet under re-promping og reframing - enten dommeren returnerer det samme svaret på det samme spørsmålet igjen eller formulert annerledes. Single-turn Conviction dekker stabilitet under én utfordring, for eksempel at en bruker eller et system presser tilbake en enkelt gang på dommen. Multi-turn Persistence dekker stabilitet under vedvarende eller adaptivt press, inkludert en motstridende modell som fortsetter å krangle og justerer taktikken. De tre dimensjonene tilsvarer "stillhet, press og utholdenhet" i tittelen: hva en dommer gjør når ingenting endres, når den blir utfordret én gang, og når den er slitt ned.

Forfatterne rapporterer å bruke rammeverket på ni grensemodeller på tvers av 14 dømmende oppgaver som spenner over sikkerhet, toksisitet, AI-skriving deteksjon og evaluering av politiske svar. I følge abstraktet viste hver modell som ble testet betydelig ustabilitet. Under statisk pushback snudde modellene sine kjennelser mellom 25 prosent og 71 prosent av tiden. Når en kontradiktorisk språkmodell ble brukt som en overbeviser, steg flip-raten til mellom 62 prosent og 91 prosent. Materialet som er gjennomgått her navngir ikke de ni modellene eller identifiserer de 14 datasettene.

Ytterligere to påstander går utover de rå flip-ratene. For det første uttaler forfatterne at press som vellykket endrer en dommers dom er "nesten alltid nett-korrupterende med hensyn til grunnsannhet" - det vil si at endrede svar har en tendens til å bevege seg bort fra den riktige etiketten i stedet for mot den, så en dommer som revurderer under argumentasjon er dermed ikke selvkorrigerende. For det andre identifiserer de baseline juryens flertallstyrke – hvor skjev avstemningen er når flere dommere vurderer en gjenstand uavhengig, før noe press påføres – som det mest effektive enkeltskuddssignalet for å forutse hvilke gjenstander som vil vrikke. De beskriver arbeidet som den første like-for-like-sammenligningen på tvers av datasett av mekaniske, konformitetstester og overtalbarhetstester i en dømmende kontekst.

Viktige detaljer forblir ubekreftede. Det som er tilgjengelig er arXiv-abstraktsiden for versjon 1, sendt inn 12. august 2026; verket er et forhåndstrykk, og det er ingen indikasjoner på at det har blitt fagfellevurdert. Den nøyaktige definisjonen av en «flip», instruksjonene som brukes til å bruke press, evnen til overtalelsesmodellen og størrelsen på nettkorrupsjonseffekten er ikke fastslått av materialet som er gjennomgått her, og det er heller ikke bekreftet om kode eller data følger med papiret. Påstanden om å være den første i sitt slag er forfatternes egen.

Kildedetaljer: arxiv.org

Hvorfor det betyr noe

LLM-dommere brukes til å score modellutgivelser, gradere produksjonsresultater og trene belønningsmodeller – roller som forutsetter at en dom gjenspeiler varen som blir dømt i stedet for hvor hardt noen kranglet. Hvis disse resultatene gjentar seg, er nøyaktigheten på et fast merket sett ikke tilstrekkelig bevis på at en dommer er pålitelig, og systemer som lar brukere eller rørledninger bestride en dom kan være de mest utsatte.

LLM-dommere er ikke lenger bare en forskningstjeneste. De brukes til å score modellutgivelser, til å gradere utganger online i produksjonssystemer, og som belønningsmodeller som former trening. Disse rollene deler en antagelse: at en dom er en stabil egenskap ved gjenstanden som bedømmes, ikke om hvordan spørsmålet ble formulert eller hvor hardt noen presset tilbake. Hvis de rapporterte flip-ratene holder opp, er denne antagelsen svakere enn nøyaktighetstallene som vanligvis er sitert sammen med dommerutplasseringer, tilsier, og evalueringstall bygget på toppen av dommere arver ustabiliteten.

Nettkorrupsjonsfunnet er det skarpeste av de to påstandene. Det er fristende å lese en dommer som ombestemmer seg under argumentasjon som gjennomtenkt eller åpen for bevis. Avisens påstand er motsatt: Når det gjelder disse oppgavene, forringer bevegelse under press overveiende samsvar med grunnsannheten. I en belønningsmodelleringssløyfe som betyr noe, fordi en policy som trenes opp kan lære at å trykke på graderen fungerer – et insentiv til å argumentere i stedet for å ha rett. Abstraktet demonstrerer ikke at dette skjer i et live treningsløp; det fastslår ingrediensen, ikke resultatet.

Det er også en direkte eksponering for alt som er brukervendt. Sikkerhets- og toksisitetsklassifisering og deteksjon av AI-skriving er områder der personen eller systemet som mottar en dom har både motiv og mulighet til å bestride den, og hvor automatiserte rørledninger rutinemessig spør om en modell eller mater tilbake en motbevisning i den. Ustabilitet av den beskrevne typen vil bety at to personer som sender inn det samme innholdet kan få forskjellige utfall avhengig av hvor vedvarende de presser - et rettferdighetsproblem like mye som et nøyaktighetsproblem, og et som er usynlig for en valideringsprosess som kun måler enkeltpassnøyaktighet.

To grenser er verdt å si tydelig. Mange produksjonsdommere kjører som enkeltsvingsanrop med faste meldinger og ingen motstridende samtalepartner, så tallene med flere svinger beskriver en stresstilstand i stedet for typisk operasjon. Og en benchmark av dommere er ikke en måling av noe utplassert system, som kan legge til juryer, terskler for avholdenhet eller menneskelig vurdering av omstridte gjenstander. Hva papiret ville fastslå, hvis det ble replikert, er smalere, men fortsatt konsekvent: nøyaktighet på et fast merket sett er ikke tilstrekkelig bevis på at en dommer er pålitelig. Det er en påstand om valideringspraksis, som er billigere å handle på enn en påstand om et bestemt produkt.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Models Explained Quiz

What is the best response when AI Models Explained makes a mistake in production?

Hva du skal se neste

Hvorvidt hele papiret navngir modellene og frigir datasettene, spørsmålene og koden; om uavhengige grupper reproduserer flip ratene; om pre-press jury-margin-signalet generaliserer som en billig triage-mekanisme; og om stabilitetsmålinger begynner å vises sammen med nøyaktighet i eval-seler, modellkort og tredjeparts benchmark-rapporter.

Det første du må se er hele papiret og eventuelle tilhørende utgivelser. Hvorvidt de ni modellene er navngitt, om de 14 datasettene og pressemeldingene blir publisert, og om kode er tilgjengelig vil avgjøre hvor raskt andre kan sjekke tallene. Sammenligninger på tvers av modeller av denne typen er følsomme for umiddelbar design og for hvordan en domsendring telles, så uavhengig reproduksjon - inkludert på modeller utgitt etter at denne evalueringen ble kjørt - er testen som teller.

For det andre, om jurymarginsignalet holder. Hvis spredningen av en uavhengig avstemning før presset på en pålitelig måte flagger hvilke gjenstander som vil snu, er det en billig og praktisk avbøtende avbøtende handling: rute gjenstander med lav margin til flere dommere, til avholdenhet eller til menneskelig vurdering, og la trygge gjenstander være i fred. Hvorvidt det generaliserer utover datasettene som er studert, og hvor mye nøyaktighet det gjenvinner i bytte mot ekstrakostnaden, er uløst i materialet som er gjennomgått her.

For det tredje, om evalueringspraksis endres. Det konkrete tegnet vil være stabilitetsmålinger rapportert ved siden av nøyaktighet i modellkort, åpne eval-seler og tredjeparts benchmark-rapporter – re-prompt konsistens, oppførsel under en enkelt utfordring, motstand mot vedvarende pushback. Anskaffelsesprosesser og standardarbeid som siterer dommerscorede referanser vil være den langsommere oppfølgingen, og ingen av dem er foreløpig kjent for å kreve noe slikt.

Til slutt, om avbøtende tiltak fungerer. Rask herding, som krever at dommere gjentar bevisene bak en dom, ensembling på tvers av modeller og eksplisitte instruksjoner om å holde en posisjon uten nye bevis er alle plausible rettelser, og ingen er validert av denne artikkelen. Det er også ukjent om nyere grensemodeller er mer stabile enn eldre, og om stabilitet avveier mot reaksjonsevnen som gjør en dommer nyttig i de tilfellene der den er genuint feil og burde ombestemme seg.

Relaterte guider og quizer

AI-modeller forklartAI treningKI-etikkChatGPT og LLM-erTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vår
Fant du dette nyttig?