Tilbake til Nyheter
InnovasjonAI Understanding orientering

Ny benchmark finner AI-agenter feilaktig blokkerer godkjent arbeid 28 % av tiden

Et forhåndstrykk introduserer SteerBench-Work, en 106-scenariotest av øyeblikket en AI-agent bestemmer seg for å handle eller ta en pause for gjennomgang. På tvers av 30 modellforhold rapporterer forfatterne at det å feilaktig holde ryddet arbeid var omtrent 28 ganger mer vanlig enn å feilaktig tillate usikkert arbeid.

7 min readRead the primary source
Source-provided image accompanying New Benchmark Finds AI Agents Wrongly Block Approved Work 28% of the Time
PrimærkildedokumentKilde registrert
Utgiver
arxiv.org
Kilde lenke
arxiv.orghttps://arxiv.org/abs/2608.12654
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Benchmark
En standardisert test eller datasett som brukes til å måle og sammenligne modellytelse.
Inferens-tidsberegning
Mengden prosessorkraft som forbrukes mens du produserer hver respons.
Menneske-i-løkken
En arbeidsflyt der mennesker gjennomgår, veileder eller overstyrer AI-utdata.
Test deg selvAI Agents Quiz

Hva skjedde

Forskerne Oguz Serdar og Cuneyt Mertayak la ut et forhåndstrykk som beskriver SteerBench-Work, en målestokk for forhåndsbekreftelsen "fortsett eller hold"-avgjørelsen hos AI-agenter på arbeidsplassen. De rapporterer at på tvers av 30 modellforhold, ble modeller feilaktig holdt autorisert, bevisgodkjent arbeid på 28,1 % av mulighetene og feilaktig tillatt utrygt arbeid på 1,0 %.

To forskere, Oguz Serdar og Cuneyt Mertayak, la ut et forhåndstrykk til arXiv 12. august 2026, der de introduserte SteerBench-Work, et bygget rundt en enkelt beslutning i en langvarig AI-agents arbeidsflyt: om man skal foreta en handling eller holde den for menneskelig eller policy-gjennomgang. Forfatterne kaller dette styringsavgjørelsen og plasserer den ved det de kaller handlingsgrensen - punktet rett før en agent sender en e-post, slår sammen en pull-forespørsel eller overfører en betaling. Referansemålet skårer ikke om en agent kan fullføre en oppgave. Den scorer om agenten krysser eller holder den grensen riktig.

Utgivelsen beskrevet i sammendraget er merket v2026-05 og inneholder 106 scenarier som spenner over utviklerdrift, kundeservice, økonomi, juridisk, medisinsk, HR og sikkerhet. Scenariene er forankret i offentlige hendelser. Hver er sammenkoblet med det forfatterne kaller et bevis-omvendt speil - en versjon av den samme situasjonen der det underliggende beviset peker den andre veien - sammen med kalibreringskontroller. Etiketter er delt nesten jevnt mellom fortsett og hold, noe forfatterne sier er bevisst: det gir de to feilretningene nær samme antall sjanser til å oppstå, så en modell kan ikke score godt ved å misligholde forsiktighet. I hvert element vises en modell en foreslått handling og tilgjengelig bevis, og returnerer en gatebeslutning.

På tvers av 30 modellforhold rapporterer forfatterne at feil går nesten utelukkende i én retning. Modeller som feilaktig ble holdt autorisert, bevisgodkjent arbeider på 28,1 % av mulighetene, mens de feilaktig tillater usikkert arbeid på 1,0 %. Den vanskeligste kategorien, ifølge abstraktet, er det forfatterne kaller risikoløste forpliktelser: tilfeller der en ekte risikoutløser er avfyrt, men signerte eller strukturerte bevis allerede har fjernet den, og det riktige svaret er å fortsette. Ytelsen divergerte også kraftig mellom kjente hendelser og speilene deres - 98,5 % på hendelsene i seg selv mot 63,8 % på de bevis-reverserte versjonene.

Forfatterne trekker et ytterligere skille mellom generell kapasitet og styringskalibrering. Modeller med høyere kapasitet, skriver de, nekter ofte for mye ved forpliktelsesgrensen, og ytterligere resonnementer kan reparere en svak gate mens de lar en allerede kalibrert en flat. Sammendraget peker til en offentlig ledertavle, men kildesiden gjengir adressen som en plassholder i stedet for en fungerende lenke.

Flere ting er ikke fastslått av materialet som er tilgjengelig her. Abstraktet navngir ikke modellene som er testet, definerer ikke hva som teller som en distinkt "modelltilstand" blant de 30, og gir ingen oppdeling per domene eller per modell. Den beskriver ikke hvem som skrev grunnsannhetsetikettene eller hvordan uenigheter ble løst, og versjonsetiketten v2026-05 er ikke forklart mot innleveringsdatoen i august. Dette er en versjon én forhåndstrykk uten indikasjon på fagfellevurdering, og ingen av figurene er uavhengig gjengitt.

Kildedetaljer: arxiv.org

Hvorfor det betyr noe

De fleste agentsikkerhetstester måler om modeller blokkerer skadelige handlinger. Dette arbeidet måler begge feilretningene og finner ut at den dominerende feilen er overblokkering, som medfører reelle driftskostnader og kan presse mennesker til gummistempling. Tallene kommer fra et ugjennomgått forhåndstrykk og har ikke blitt bekreftet uavhengig.

AI-agenter blir i økende grad utplassert for å utføre handlinger i stedet for bare å produsere tekst, og punktet der et forslag blir en irreversibel effekt er der risikoen faktisk lander. Mye publisert sikkerhetsarbeid stiller ett spørsmål – nektet modellen det skadelige? — og et system som nekter alt, scorer perfekt på det spørsmålet samtidig som det er ubrukelig. Ved å balansere fortsett og hold-etiketter og rapportere begge feilratene, måler denne referansen avveiningen i stedet for den ene siden av den.

Hvis den rapporterte asymmetrien generaliserer, kan det praktiske problemet ved distribusjon av bedriftsagenter være nærmere overblokkering enn løpsk handling. Falske oppbevaringer er ikke gratis. Hver enkelt ruter arbeid tilbake til en person, noe som tærer på effektivitetssaken for å automatisere oppgaven i det hele tatt, og legger latens til prosesser som billettoppløsning eller kodegjennomgang der selve forsinkelsen har en kostnad. Det er også en mer subtil risiko: en anmeldelseskø full av unødvendige eskaleringer trener anmelderne til å godkjenne raskt, noe som svekker det menneskelige tilsynet som holdemekanismen eksisterer for å gi. Den nedstrømseffekten er en rimelig slutning fra oppsettet, ikke noe måler.

Gapet mellom 98,5 % på kjente hendelser og 63,8 % på deres bevis-reverserte speil er resultatet som er mest verdt å granske. Det stemmer overens med modeller som gjenkjenner formen til en godt dokumentert feil og reagerer på denne erkjennelsen i stedet for å lese bevisene foran dem. Hvis den lesningen holder, kompliserer det hvordan kjøpere bør tolke agentsikkerhetsscore generelt: en modell kan se pålitelig ut på scenarier som ligner publiserte advarende historier mens den håndterer den samme strukturelle situasjonen dårlig når fakta omorganiseres. Forfatternes kategori "risk-resolved commits" tester akkurat dette - det finnes bevis som fjerner en utløst risiko, og modellen må faktisk behandle den.

Funnene har også betydning for hvordan menneske-i-løkken-krav er skrevet. Retningslinjer som krever gjennomgang for handlingskategorier, antar at porten er den sikre standarden. Dette arbeidet antyder at porten har sin egen feilrate, i retning av blokkering av ryddet arbeid, og at hastigheten bør måles i stedet for å antas å være nær null.

Veier opp mot alt dette: referanseindeksen evaluerer en enkelt forhåndsavgjørelse gitt en kurert bevispakke, ikke en agent som driver en ekte verktøysløyfe med ufullstendig informasjon den må samle selv. Ekte distribusjoner sitter også bak tillatelsessystemer og organisatorisk kontekst som scenariene ikke fullt ut kan representere. Hvorvidt 106 konstruerte scenarier, uansett hvor nøye forankret, forutsier atferd i produksjon er et åpent spørsmål, og påstandene her er forfatternes egne.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Agents Quiz

What is the most accurate way to describe what AI Agents can do today?

Hva du skal se neste

Hvorvidt hele papiret, datasettet og ledertavlen identifiserer modellene som er testet; om uavhengige grupper reproduserer gapet med overavslag; om resultatene av speilvendte bevis holder opp som et tegn på mønstertilpasning; og om kjøpere og regulatorer begynner å behandle falske tilbakehold som en målt feil snarere enn en sikker standard.

Det mest umiddelbare å se etter er avsløring. Hele papiret, ethvert utgitt datasett eller kode, og ledertavlen, de abstrakte referansene ville vise hvilke modeller som ble testet, hvordan de 30 forholdene var sammensatt, og hvordan tallet på 28,1 % fordeler seg på tvers av modeller og domener. Et samlet antall som spenner over 30 forhold kan skjule stor variasjon, og det praktiske spørsmålet for alle som velger en modell er hvilke systemer som sitter i hvilken ende av det området.

Uavhengig replikering betyr mer enn overskriften. Se etter andre grupper som kjører scenariene, for gransking av grunnsannhetens etiketter på de vanskeligste "risiko-løste forpliktelsene"-sakene, og for om gapet mellom hendelse og speil overlever testing av folk som ikke bygde referansen. Det gapet er avisens mest konsekvenspåstand, og det er også det som er mest avhengig av hvordan speilene ble konstruert.

Også verdt å spore er om enkelt-trinns framing overføres. En modell som blir bedt om å lukke en foreslått handling med bevis levert, er i en annen posisjon enn en agent midt i oppgaven som må bestemme hvilket bevis som skal samles før den begår. Oppfølgingsarbeid ved å plassere de samme scenariene i hele agentsløyfer vil teste om kalibreringen målt her forutsier reell oppførsel.

På adopsjonssiden er spørsmålet om falske-hold-priser kommer inn i anskaffelses- og systemkort sammen med avslagsrater, og om modellutviklere begynner å tune inn for kalibrering ved handlingsgrensen i stedet for for forsiktighet alene. Forfatternes påstand om at ekstra resonnement hjelper svake porter, men ikke allerede kalibrerte porter, hvis de bekreftes, ville presset mot antagelsen om at mer slutningstidsberegning på en pålitelig måte forbedrer sikkerhetsrelevant dømmekraft.

Til slutt, se versjonen. En merket v2026-05 og forankret i offentlige hendelser står overfor et forurensningsproblem ettersom scenariene sirkulerer og fremtidige modeller trener på dem. Hvordan forfatterne oppdaterer settet - og om speilytelsen forbedres gjennom reelle resonnementgevinster eller gjennom eksponering - vil avgjøre hvor lenge tallene betyr det de betyr i dag.

Relaterte guider og quizer

AI-agenterKI-etikkAI-modeller forklartTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vår
Fant du dette nyttig?