Vad hände
Forskarna Oguz Serdar och Cuneyt Mertayak publicerade ett förtryck som beskrev SteerBench-Work, ett riktmärke för beslutet "fortsätt eller håll" i förväg hos AI-agenter på arbetsplatsen. De rapporterar att över 30 modellförhållanden, modeller som felaktigt hölls auktoriserade, evidensgodkända arbete på 28,1 % av möjligheterna och felaktigt tillåtet osäkert arbete på 1,0 %.
Två forskare, Oguz Serdar och Cuneyt Mertayak, publicerade ett förtryck till arXiv den 12 augusti 2026 och introducerade SteerBench-Work, ett riktmärke byggt kring ett enda beslut i en långvarig AI-agents arbetsflöde: om man ska utföra en handling eller hålla den för mänsklig eller policyöversyn. Författarna kallar detta styrbeslutet och placerar det vid vad de kallar handlingsgränsen - punkten precis innan en agent skickar ett e-postmeddelande, slår samman en pull-begäran eller överför en betalning. Riktmärket ger inte poäng om en agent kan utföra en uppgift. Det poängsätter om agenten korsar eller håller den gränsen korrekt.
Utgåvan som beskrivs i sammandraget är märkt v2026-05 och innehåller 106 scenarier som spänner över utvecklarverksamhet, kundservice, ekonomi, juridik, medicinsk, HR och säkerhet. Scenarierna är förankrade i offentliga incidenter. Var och en är parad med vad författarna kallar en evidens-omvänd spegel - en version av samma situation där de underliggande bevisen pekar åt andra hållet - tillsammans med kalibreringskontroller. Etiketter delas nästan jämnt mellan fortsätt och håll, vilket författarna säger är avsiktligt: det ger de två felriktningarna nära samma antal chanser att inträffa, så en modell kan inte få bra resultat helt enkelt genom att försumma att vara försiktig. I varje punkt visas en modell en föreslagen åtgärd och tillgängligt bevis, och returnerar ett gatebeslut.
Över 30 modellförhållanden rapporterar författarna att fel går nästan helt i en riktning. Modeller som felaktigt hålls auktoriserade, bevisgodkända fungerar på 28,1 % av möjligheterna, medan de felaktigt tillåter osäkert arbete på 1,0 %. Den svåraste kategorin, enligt abstraktet, är vad författarna kallar risklösta åtaganden: fall där en äkta riskutlösare har avfyrats men undertecknade eller strukturerade bevis redan har klarat den, och det korrekta svaret är att fortsätta. Prestanda skiljde sig också kraftigt mellan kända incidenter och deras speglar – 98,5 % på själva incidenterna mot 63,8 % på de omvända versionerna.
Författarna gör ytterligare en distinktion mellan generell förmåga och styrkalibrering. Modeller med högre kapacitet, skriver de, övervägrar ofta vid gränsen för begåvning, och ytterligare resonemang kan reparera en svag grind samtidigt som de lämnar en redan kalibrerad en platt. Sammanfattningen pekar på en offentlig topplista, men källsidan återger adressen som en platshållare snarare än en fungerande länk.
Flera saker är inte fastslagna av det material som finns här. Sammanfattningen namnger inte de testade modellerna, definierar inte vad som räknas som ett distinkt "modelltillstånd" bland de 30, och ger ingen uppdelning per domän eller per modell. Den beskriver inte vem som skrev sanningsetiketterna eller hur meningsskiljaktigheter löstes, och versionsetiketten v2026-05 förklaras inte mot inlämningsdatumet i augusti. Detta är ett förtryck i version ett utan indikation på referentgranskning, och ingen av siffrorna har reproducerats oberoende.
Varför det spelar roll
De flesta agentsäkerhetstester mäter om modeller blockerar skadliga handlingar. Detta arbete mäter båda felriktningarna och finner att det dominerande felet är överblockering, vilket medför verkliga driftskostnader och kan pressa människor till gummistämpling. Siffrorna kommer från ett ej granskat förtryck och har inte verifierats oberoende av varandra.
AI-agenter används alltmer för att vidta åtgärder snarare än att bara producera text, och punkten där ett förslag blir en oåterkallelig effekt är där risken faktiskt landar. En hel del publicerat säkerhetsarbete ställer en fråga - vägrade modellen det skadliga? — och ett system som vägrar allt ger perfekt poäng på den frågan samtidigt som det är värdelöst. Genom att balansera fortsätt och hålla etiketter och rapportera båda felfrekvenserna, mäter detta riktmärke avvägningen istället för ena sidan av den.
Om den rapporterade asymmetrin generaliserar kan det praktiska problemet vid implementering av företagsagenter vara närmare överblockering än skenande åtgärder. Falska spärrar är inte gratis. Var och en dirigerar arbete tillbaka till en person, vilket urholkar effektivitetsfallet för att automatisera uppgiften överhuvudtaget, och lägger till latens till processer som biljettupplösning eller kodgranskning där förseningen i sig har en kostnad. Det finns också en mer subtil risk: en granskningskö full av onödiga upptrappningar tränar granskarna att snabbt godkänna, vilket försvagar den mänskliga tillsynen som hållmekanismen finns för att ge. Den nedströmseffekten är en rimlig slutledning från installationen, inte något riktmärket mäter.
Gapet mellan 98,5 % på berömda incidenter och 63,8 % på deras bevis-omvända speglar är det resultat som är mest värt att granska. Det överensstämmer med modeller som känner igen formen av ett väldokumenterat misslyckande och svarar på det erkännandet snarare än att läsa bevisen framför dem. Om den läsningen håller, komplicerar det hur köpare bör tolka agentsäkerhetspoäng generellt: en modell kan se tillförlitlig ut på scenarier som liknar publicerade varningsberättelser samtidigt som den hanterar samma strukturella situation dåligt när fakta omarrangeras. Författarnas kategori "riskupplösta åtaganden" testar exakt detta - bevis finns som rensar en utlöst risk, och modellen måste faktiskt bearbeta den.
Resultaten har också betydelse för hur kraven på människan i slingan skrivs. Policyer som kräver granskning av åtgärdskategorier antar att porten är den säkra standarden. Detta arbete antyder att grinden har sin egen felfrekvens, i riktning mot att blockera rensat arbete, och att hastigheten bör mätas snarare än antas vara nära noll.
Att väga mot allt detta: riktmärket utvärderar en enda pre-commit dom som ges ett kurerat bevispaket, inte en agent som driver en verklig verktygsloop med ofullständig information som den måste samla in själv. Verkliga implementeringar sitter också bakom behörighetssystem och organisatoriska sammanhang som scenarierna inte helt kan representera. Huruvida 106 konstruerade scenarier, hur noggrant förankrade än, förutsäger beteende i produktionen är en öppen fråga, och påståendena här är författarnas egna.
Interaktiv mekanism: hur det faktiskt fungerar
Utforska den underliggande tekniken bakom denna utveckling interaktivt.
What most distinguishes an AI agent from a basic chatbot?
Vad du ska titta på härnäst
Huruvida hela papper, dataset och leaderboard identifierar de testade modellerna; huruvida oberoende grupper reproducerar gapet med alltför avslag; huruvida resultaten av bevis-omvända spegel håller upp som ett tecken på mönstermatchning; och huruvida köpare och tillsynsmyndigheter börjar behandla falska innehav som ett uppmätt misslyckande snarare än en säker standard.
Det mest omedelbara att leta efter är avslöjande. Hela papper, eventuella släppta datauppsättningar eller koder, och leaderboarden som referenserna till abstrakta skulle visa vilka modeller som testades, hur de 30 villkoren var sammansatta och hur siffran på 28,1 % fördelar sig över modeller och domäner. Ett sammanlagt antal som spänner över 30 förhållanden kan dölja stor variation, och den praktiska frågan för alla som väljer en modell är vilka system som sitter i vilken ände av det intervallet.
Oberoende replikering är viktigare än rubriken. Håll utkik efter andra grupper som kör scenarierna, för granskning av marksanningsetiketterna för de svåraste "risklösta åtagandena" och för om gapet mellan incident och spegel överlever testning av personer som inte byggde riktmärket. Det gapet är tidningens mest följdriktiga påstående, och det är också det som är mest beroende av hur speglarna var konstruerade.
Också värt att spåra är om enkelstegsinramningen överförs. En modell som uppmanas att gate en föreslagen åtgärd med bevis som tillhandahålls är i en annan position än en agent mitt i uppgiften som måste bestämma vilka bevis som ska samlas innan de begår. Uppföljningsarbete genom att placera samma scenarier i hela agentslingor skulle testa om kalibreringen som mäts här förutsäger verkligt beteende.
På adoptionssidan är frågan om falska hållpriser kommer in i inköps- och systemkort tillsammans med avslagsfrekvens, och om modellutvecklare börjar ställa in för kalibrering vid åtgärdsgränsen snarare än för försiktighet ensam. Författarnas påstående att tillagda resonemang hjälper svaga portar men inte redan kalibrerade sådana, om de bekräftas, skulle motverka antagandet att mer inferens-tidsberäkning på ett tillförlitligt sätt förbättrar säkerhetsrelevant bedömning.
Slutligen, titta på versioneringen. Ett riktmärke märkt v2026-05 och förankrat i offentliga incidenter står inför ett kontamineringsproblem när dess scenarier cirkulerar och framtida modeller tränar på dem. Hur författarna uppdaterar uppsättningen - och om spegelprestanda förbättras genom genuina resonemangsvinster eller genom exponering - kommer att avgöra hur länge siffrorna betyder vad de betyder idag.