Назад към Новини
ИновацияAI Understanding брифинг

Нов бенчмарк открива, че AI агентите погрешно блокират одобрена работа в 28% от случаите

Предварителен печат въвежда SteerBench-Work, тест от 106 сценария за момента, в който AI агент реши да действа или да спре за преглед. В 30 моделни условия авторите съобщават, че погрешното задържане на разрешена работа е приблизително 28 пъти по-често, отколкото погрешното допускане на опасна работа.

7 min readRead the primary source
Source-provided image accompanying New Benchmark Finds AI Agents Wrongly Block Approved Work 28% of the Time
Документ с първичен източникИзточникът е записан
Издател
arxiv.org
Изходна връзка
arxiv.orghttps://arxiv.org/abs/2608.12654
Тип източник
Първичен документ — официално съобщение, документ, документ или първа страна, която четем директно.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Бенчмарк
Стандартизиран тест или набор от данни, използвани за измерване и сравняване на ефективността на модела.
Извод-изчисляване на времето
Количеството процесорна мощност, изразходвана при генериране на всеки отговор.
Човек в цикъла
Работен процес, при който хората преглеждат, насочват или отменят изходите на AI.
Тествайте себе сиAI Агенти Викторина

Какво стана

Изследователите Oguz Serdar и Cuneyt Mertayak публикуваха предпечат, описващ SteerBench-Work, бенчмарк за решението „продължи или задръж“ преди ангажиране в агентите на ИИ на работното място. Те съобщават, че при 30 условия на модела, моделите неправилно държани разрешени, изчистени от доказателства работят върху 28,1% от възможностите и неправилно разрешена опасна работа върху 1,0%.

Двама изследователи, Oguz Serdar и Cuneyt Mertayak, публикуваха препринт в arXiv на 12 август 2026 г., представяйки SteerBench-Work, бенчмарк, изграден около едно решение в дългосрочен работен процес на AI агент: дали да се извърши действие или да се задържи за преглед от хора или правила. Авторите наричат ​​това решение за управление и го поставят на това, което те наричат ​​граница на действие - точката точно преди агент да изпрати имейл, да обедини заявка за изтегляне или да преведе плащане. Бенчмаркът не оценява дали даден агент може да изпълни задача. Той оценява дали агентът пресича или държи тази граница правилно.

Изданието, описано в резюмето, е обозначено като v2026-05 и съдържа 106 сценария, обхващащи операции на разработчици, обслужване на клиенти, финанси, правни, медицински, човешки ресурси и сигурност. Сценариите са закотвени в обществени инциденти. Всеки от тях е съчетан с това, което авторите наричат ​​огледало, обърнато на доказателства - версия на същата ситуация, в която основните доказателства сочат другата посока - заедно с контролите за калибриране. Етикетите са разделени почти поравно между продължаване и задържане, което авторите казват, че е умишлено: дава на двете посоки на грешка близо еднакъв брой шансове да се появят, така че моделът не може да даде добър резултат, просто като по подразбиране предпазливо. Във всеки елемент моделът показва предложено действие и наличните доказателства и връща решение за достъп.

При 30 моделни условия авторите съобщават, че неуспехите протичат почти изцяло в една посока. Моделите погрешно държаха оторизирана, изчистена от доказателства работа върху 28,1% от възможностите, като същевременно погрешно позволяваха опасна работа върху 1,0%. Най-трудната категория, според резюмето, е това, което авторите наричат ​​рисково разрешени ангажименти: случаи, при които е задействан истински тригер за риск, но подписани или структурирани доказателства вече са го изчистили и правилният отговор е да продължите. Представянето също се различава рязко между известните инциденти и техните огледала — 98,5% за самите инциденти срещу 63,8% за версиите с обърнати доказателства.

Авторите правят допълнително разграничение между обща способност и калибриране на кормилното управление. Моделите с по-висок капацитет, пишат те, често прекомерно отказват на границата на ангажиране и допълнителни разсъждения могат да поправят слаб гейт, като същевременно оставят вече калибриран непроменен. Резюмето сочи към публична класация, но страницата източник изобразява адреса като заместител, а не като работеща връзка.

Няколко неща не се установяват от наличните тук материали. Резюмето не посочва тестваните модели, не определя какво се счита за отделно „условие на модела“ сред 30-те и не дава разбивка по домейн или по модел. Не се описва кой е написал етикетите за основната истина или как са разрешени несъгласията, а етикетът на версията v2026-05 не е обяснен спрямо датата на подаване през август. Това е предварителна версия на първа версия без индикация за партньорска проверка и нито една от фигурите не е независимо възпроизведена.

Детайли за източника: arxiv.org

Защо има значение

Повечето тестове за безопасност на агенти измерват дали моделите блокират вредни действия. Тази работа измерва и двете посоки на грешките и установява, че доминиращият отказ е свръхблокирането, което носи реални оперативни разходи и може да тласне хората към гумено щамповане. Числата идват от непрегледан предпечат и не са независимо проверени.

AI агентите все повече се използват, за да предприемат действия, вместо само да създават текст, и точката, в която едно предложение се превръща в необратим ефект, е мястото, където рискът всъщност се приземява. Голяма част от публикуваната работа по безопасността на агентите задава един въпрос - дали моделът е отказал вредното нещо? — и система, която отказва всичко, дава перфектни резултати по този въпрос, като същевременно е безполезна. Чрез балансиране на етикетите за продължаване и задържане и отчитане на двата процента грешки, този показател измерва компромиса вместо едната му страна.

Ако докладваната асиметрия се обобщи, практическият проблем при внедряването на корпоративни агенти може да е по-близък до свръхблокиране, отколкото до избягало действие. Фалшивите задържания не са безплатни. Всеки един маршрут работи обратно към човек, което подкопава ефективността за автоматизиране на задачата изобщо и добавя латентност към процеси като разрешаване на билети или преглед на код, където самото забавяне има цена. Съществува и по-фин риск: опашка за преглед, пълна с ненужни ескалации, обучава рецензентите да одобряват бързо, което отслабва човешкия надзор, който механизмът за задържане съществува, за да осигури. Този ефект надолу по веригата е разумен извод от настройката, а не нещо, което измерва бенчмаркът.

Разликата между 98,5% за известни инциденти и 63,8% за техните обратни огледала на доказателства е резултатът, който най-много си заслужава да бъде разгледан. Това е в съответствие с моделите, които разпознават формата на добре документиран провал и реагират на това разпознаване, вместо да четат доказателствата пред тях. Ако това четене е валидно, това усложнява начина, по който купувачите трябва да тълкуват резултатите за безопасност на агентите като цяло: един модел може да изглежда надежден при сценарии, които приличат на публикувани предупредителни истории, докато се справя лошо със същата структурна ситуация, когато фактите са пренаредени. Категорията на авторите „задължения с разрешаване на риска“ тества точно това – съществуват доказателства, които изчистват задействан риск и моделът трябва действително да го обработи.

Констатациите се отразяват и на начина, по който са написани изискванията за човек в цикъла. Политиките, които налагат преглед за категории действия, предполагат, че портата е безопасната настройка по подразбиране. Тази работа предполага, че порталът има свой собствен процент на грешки, в посока на блокиране на изчистена работа, и че процентът трябва да се измерва, а не да се приема, че е близо до нула.

Претегляйки всичко това: бенчмаркът оценява единична преценка преди ангажимент, дадена на подбран пакет от доказателства, а не агент, управляващ реален цикъл на инструмента с непълна информация, която трябва да събере сам. Истинските внедрявания също стоят зад системи за разрешения и организационен контекст, които сценариите не могат да представят напълно. Дали 106 изградени сценария, колкото и внимателно да са закотвени, предсказват поведение в производството е открит въпрос и твърденията тук са собствени на авторите.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивна проверка на концепцията+10 Points
AI Agents Quiz

What is the most accurate way to describe what AI Agents can do today?

Какво да гледате след това

Дали пълният документ, набор от данни и табло идентифицират тестваните модели; дали независимите групи възпроизвеждат разликата в прекомерния отказ; дали резултатите от обърнато огледало на доказателства се задържат като знак за съпоставяне на модела; и дали купувачите и регулаторите започват да третират фалшивите задържания като премерен провал, а не като безопасно неизпълнение.

Най-непосредственото нещо, което трябва да търсите, е разкриването. Пълният документ, всеки пуснат набор от данни или код и таблото с абстрактни препратки ще покажат кои модели са тествани, как са съставени 30-те условия и как цифрата от 28,1% се разпределя между моделите и домейните. Общо число, обхващащо 30 условия, може да крие голямо разнообразие и практическият въпрос за всеки, който избира модел, е кои системи се намират в кой край на този диапазон.

Независимото копиране е по-важно от фигурата в заглавието. Гледайте за други групи, изпълняващи сценариите, за проверка на етикетите на основната истина за най-трудните случаи на „разрешаване на риска“ случаи и за това дали празнината инцидент срещу огледало оцелява при тестване от хора, които не са изградили бенчмарка. Тази празнина е най-последователното твърдение на статията и също така е и най-зависимото от това как са конструирани огледалата.

Също така си струва да се проследи дали едноетапното рамкиране се прехвърля. Модел, който е помолен да задейства едно предложено действие с предоставено доказателство, е в различна позиция от агент по средата на задачата, който трябва да реши какви доказателства да събере, преди да се ангажира. Последващата работа, поставяща същите сценарии в рамките на пълните агентски цикли, ще тества дали измереното тук калибриране предвижда реално поведение.

Що се отнася до възприемането, въпросът е дали нивата на фалшиво задържане влизат в доставките и системните карти заедно с процентите на отказ и дали разработчиците на модели започват настройка за калибриране на границата на действие, а не само за предпазливост. Твърдението на авторите, че добавеното разсъждение помага на слабите порти, но не и на вече калибрираните, ако бъде потвърдено, би противопоставило предположението, че повече изчисляване на времето за извод надеждно подобрява преценката, свързана с безопасността.

И накрая, гледайте версиите. Бенчмарк, означен като v2026-05 и закотвен в обществени инциденти, е изправен пред проблем със замърсяване, тъй като неговите сценарии циркулират и бъдещите модели се обучават върху тях. Начинът, по който авторите опресняват комплекта – и дали ефективността на огледалото се подобрява чрез истинско разсъждение или чрез излагане – ще определи колко дълго числата означават това, което означават днес.

Свързани ръководства и викторини

AI агентиЕтика на ИИОбяснени модели на AIТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речник
Намирате ли това за полезно?