समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

नए बेंचमार्क ने पाया कि एआई एजेंट 28% बार गलत तरीके से स्वीकृत कार्य को रोकते हैं

एक प्रीप्रिंट स्टीयरबेंच-वर्क का परिचय देता है, जो उस समय का 106-परिदृश्य परीक्षण है जब एक एआई एजेंट समीक्षा के लिए कार्य करने या रुकने का निर्णय लेता है। 30 मॉडल स्थितियों में, लेखकों की रिपोर्ट है कि गलत तरीके से असुरक्षित काम की अनुमति देने की तुलना में गलत तरीके से स्वीकृत कार्य को रोकना लगभग 28 गुना अधिक आम था।

7 min readRead the primary source
Source-provided image accompanying New Benchmark Finds AI Agents Wrongly Block Approved Work 28% of the Time
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.12654
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बेंचमार्क
मॉडल प्रदर्शन को मापने और तुलना करने के लिए उपयोग किया जाने वाला एक मानकीकृत परीक्षण या डेटासेट।
अनुमान-समय गणना
प्रत्येक प्रतिक्रिया उत्पन्न करते समय उपभोग की गई प्रसंस्करण शक्ति की मात्रा।
लूप में मानव
एक वर्कफ़्लो जहां मनुष्य एआई आउटपुट की समीक्षा, मार्गदर्शन या ओवरराइड करते हैं।
स्वयं की जांच करोएआई एजेंट प्रश्नोत्तरी

क्या हुआ?

शोधकर्ताओं ओगुज़ सर्दार और क्यूनेट मेर्टायक ने स्टीयरबेंच-वर्क का वर्णन करते हुए एक प्रीप्रिंट पोस्ट किया, जो कार्यस्थल एआई एजेंटों में प्री-कमिट "आगे बढ़ें या रोकें" निर्णय के लिए एक बेंचमार्क है। वे रिपोर्ट करते हैं कि 30 मॉडल स्थितियों में, मॉडलों ने 28.1% अवसरों पर गलत तरीके से अधिकृत, साक्ष्य-मुक्त कार्य को मान्यता दी और 1.0% पर गलत तरीके से असुरक्षित कार्य की अनुमति दी।

दो शोधकर्ताओं, ओगुज़ सर्दार और क्यूनेट मर्टयाक ने 12 अगस्त 2026 को arXiv पर एक प्रीप्रिंट पोस्ट किया, जिसमें स्टीयरबेंच-वर्क की शुरुआत की गई, जो लंबे समय से चल रहे एआई एजेंट के वर्कफ़्लो के अंदर एक ही निर्णय के आसपास बनाया गया एक बेंचमार्क है: क्या कोई कार्रवाई करनी है या इसे मानव या नीति समीक्षा के लिए रखना है। लेखक इसे स्टीयरिंग निर्णय कहते हैं और इसे कार्रवाई सीमा पर रखते हैं - एक एजेंट द्वारा ईमेल भेजने, पुल अनुरोध को मर्ज करने, या भुगतान को तार करने से ठीक पहले का बिंदु। बेंचमार्क यह स्कोर नहीं करता कि कोई एजेंट किसी कार्य को पूरा कर सकता है या नहीं। यह स्कोर करता है कि एजेंट उस सीमा को सही ढंग से पार करता है या रखता है।

सार में वर्णित रिलीज़ को v2026-05 लेबल किया गया है और इसमें डेवलपर संचालन, ग्राहक सेवा, वित्त, कानूनी, चिकित्सा, मानव संसाधन और सुरक्षा से संबंधित 106 परिदृश्य शामिल हैं। परिदृश्य सार्वजनिक घटनाओं पर आधारित होते हैं। प्रत्येक को उस चीज़ के साथ जोड़ा जाता है जिसे लेखक साक्ष्य-उलट दर्पण कहते हैं - उसी स्थिति का एक संस्करण जिसमें अंतर्निहित साक्ष्य दूसरी तरफ इंगित करते हैं - अंशांकन नियंत्रण के साथ। लेबल को आगे बढ़ने और होल्ड करने के बीच लगभग समान रूप से विभाजित किया जाता है, जिसके बारे में लेखकों का कहना है कि यह जानबूझकर किया गया है: यह दो त्रुटि दिशाओं को घटित होने की समान संख्या के करीब देता है, इसलिए कोई मॉडल केवल सावधानी बरतने में चूक करके अच्छा स्कोर नहीं कर सकता है। प्रत्येक आइटम में, एक मॉडल एक प्रस्तावित कार्रवाई और उपलब्ध साक्ष्य दिखाता है, और एक गेट निर्णय लौटाता है।

30 मॉडल स्थितियों में, लेखक रिपोर्ट करते हैं कि विफलताएँ लगभग पूरी तरह से एक ही दिशा में चलती हैं। मॉडलों ने 28.1% अवसरों पर गलत तरीके से अधिकृत, साक्ष्य-मुक्त कार्य को मान्यता दी, जबकि 1.0% पर गलत तरीके से असुरक्षित कार्य की अनुमति दी। सार के अनुसार, सबसे कठिन श्रेणी वह है जिसे लेखक जोखिम-समाधान प्रतिबद्धता कहते हैं: ऐसे मामले जहां एक वास्तविक जोखिम ट्रिगर हुआ लेकिन हस्ताक्षरित या संरचित साक्ष्य ने इसे पहले ही साफ़ कर दिया है, और सही उत्तर आगे बढ़ना है। प्रसिद्ध घटनाओं और उनके दर्पणों के बीच प्रदर्शन में भी तेजी से अंतर आया - स्वयं घटनाओं पर 98.5% बनाम साक्ष्य-उलट संस्करणों पर 63.8%।

लेखक सामान्य क्षमता और स्टीयरिंग अंशांकन के बीच एक और अंतर बताते हैं। उच्च-क्षमता वाले मॉडल, वे लिखते हैं, अक्सर प्रतिबद्ध सीमा पर अति-अस्वीकार करते हैं, और अतिरिक्त तर्क पहले से ही कैलिब्रेटेड एक फ्लैट को छोड़कर एक कमजोर गेट की मरम्मत कर सकते हैं। सार एक सार्वजनिक लीडरबोर्ड की ओर इशारा करता है, लेकिन स्रोत पृष्ठ पते को एक कार्यशील लिंक के बजाय प्लेसहोल्डर के रूप में प्रस्तुत करता है।

यहां उपलब्ध सामग्री से कई बातें स्थापित नहीं होतीं। सार परीक्षण किए गए मॉडलों का नाम नहीं देता है, यह परिभाषित नहीं करता है कि 30 के बीच एक विशिष्ट "मॉडल स्थिति" के रूप में क्या गिना जाता है, और कोई प्रति-डोमेन या प्रति-मॉडल ब्रेकडाउन नहीं देता है। इसमें यह वर्णन नहीं किया गया है कि जमीनी सच्चाई वाले लेबल किसने लिखे या असहमतियों का समाधान कैसे किया गया, और संस्करण लेबल v2026-05 को अगस्त सबमिशन तिथि के विरुद्ध समझाया नहीं गया है। यह एक संस्करण-एक प्रीप्रिंट है जिसमें सहकर्मी समीक्षा का कोई संकेत नहीं है, और कोई भी आंकड़ा स्वतंत्र रूप से पुन: प्रस्तुत नहीं किया गया है।

स्रोत विवरण: arxiv.org

यह क्यों मायने रखता है?

अधिकांश एजेंट सुरक्षा परीक्षण यह मापते हैं कि मॉडल हानिकारक कार्यों को रोकते हैं या नहीं। यह कार्य दोनों त्रुटि दिशाओं को मापता है और पाता है कि प्रमुख विफलता ओवर-ब्लॉकिंग है, जो वास्तविक परिचालन लागत वहन करती है और मनुष्यों को रबर-स्टैंपिंग में धकेल सकती है। ये संख्याएँ बिना समीक्षा किए गए प्रीप्रिंट से आई हैं और इन्हें स्वतंत्र रूप से सत्यापित नहीं किया गया है।

एआई एजेंटों को केवल पाठ तैयार करने के बजाय कार्रवाई करने के लिए तेजी से तैनात किया जा रहा है, और वह बिंदु जहां एक सुझाव एक अपरिवर्तनीय प्रभाव बन जाता है, वह वास्तव में जोखिम पैदा करता है। बहुत सारे प्रकाशित एजेंट सुरक्षा कार्य एक प्रश्न पूछते हैं - क्या मॉडल ने हानिकारक चीज़ से इंकार कर दिया? - और एक प्रणाली जो हर चीज़ को अस्वीकार कर देती है, वह बेकार होते हुए भी उस प्रश्न पर उत्कृष्ट अंक प्राप्त करती है। आगे बढ़ने और लेबल को संतुलित करके और दोनों त्रुटि दरों की रिपोर्ट करके, यह बेंचमार्क इसके एक तरफ के बजाय ट्रेडऑफ़ को मापता है।

यदि रिपोर्ट की गई विषमता सामान्य हो जाती है, तो एंटरप्राइज़ एजेंट तैनाती में व्यावहारिक समस्या भगोड़ा कार्रवाई की तुलना में ओवर-ब्लॉकिंग के करीब हो सकती है। गलत धारण मुक्त नहीं हैं. प्रत्येक मार्ग एक व्यक्ति के पास वापस काम करता है, जो कार्य को स्वचालित करने के लिए दक्षता के मामले को नष्ट कर देता है, और टिकट समाधान या कोड समीक्षा जैसी प्रक्रियाओं में विलंबता जोड़ता है जहां देरी की अपनी लागत होती है। एक सूक्ष्म जोखिम भी है: अनावश्यक वृद्धि से भरी एक समीक्षा कतार समीक्षकों को जल्दी से मंजूरी देने के लिए प्रशिक्षित करती है, जो मानवीय निरीक्षण को कमजोर करती है जिसे प्रदान करने के लिए होल्ड तंत्र मौजूद है। डाउनस्ट्रीम प्रभाव सेटअप से एक उचित अनुमान है, बेंचमार्क उपाय नहीं।

प्रसिद्ध घटनाओं पर 98.5% और उनके साक्ष्य-उलट दर्पणों पर 63.8% के बीच का अंतर जांच के लायक परिणाम है। यह उन मॉडलों के अनुरूप है जो एक अच्छी तरह से प्रलेखित विफलता के आकार को पहचानते हैं और उनके सामने मौजूद सबूतों को पढ़ने के बजाय उस मान्यता पर प्रतिक्रिया करते हैं। यदि वह रीडिंग सही है, तो यह जटिल है कि खरीदारों को आम तौर पर एजेंट सुरक्षा स्कोर की व्याख्या कैसे करनी चाहिए: एक मॉडल उन परिदृश्यों पर विश्वसनीय दिख सकता है जो प्रकाशित चेतावनी कहानियों से मिलते जुलते हैं, जबकि तथ्यों को पुनर्व्यवस्थित करने पर समान संरचनात्मक स्थिति को खराब तरीके से संभालते हैं। लेखकों की "जोखिम-समाधान प्रतिबद्धताएं" श्रेणी वास्तव में इसका परीक्षण करती है - सबूत मौजूद हैं जो ट्रिगर जोखिम को साफ़ करता है, और मॉडल को वास्तव में इसे संसाधित करना चाहिए।

निष्कर्ष इस बात पर भी निर्भर करते हैं कि मानव-इन-द-लूप आवश्यकताओं को कैसे लिखा जाता है। नीतियाँ जो कार्रवाई की श्रेणियों के लिए समीक्षा अनिवार्य करती हैं, मानती हैं कि गेट सुरक्षित डिफ़ॉल्ट है। यह कार्य सुझाव देता है कि साफ़ किए गए कार्य को अवरुद्ध करने की दिशा में गेट की अपनी त्रुटि दर है, और दर को शून्य के करीब मानने के बजाय मापा जाना चाहिए।

इस सब के विरुद्ध वजन करते हुए: बेंचमार्क एक क्यूरेटेड साक्ष्य पैकेट दिए गए एकल प्री-कमिट निर्णय का मूल्यांकन करता है, न कि एक एजेंट जो अधूरी जानकारी के साथ वास्तविक टूल लूप का संचालन करता है जिसे उसे स्वयं इकट्ठा करना होगा। वास्तविक तैनाती भी अनुमति प्रणालियों और संगठनात्मक संदर्भ के पीछे होती है जिसे परिदृश्य पूरी तरह से प्रस्तुत नहीं कर सकते हैं। क्या 106 निर्मित परिदृश्य, चाहे कितनी भी सावधानी से बनाए गए हों, उत्पादन में व्यवहार की भविष्यवाणी करते हैं, यह एक खुला प्रश्न है, और यहां दावे लेखकों के अपने हैं।

Interactive Mechanism

Interactive Mechanism: How It Actually Works

Explore the underlying technology behind this development interactively.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactive Concept Check+10 Points
AI Agents Quiz

What is the most accurate way to describe what AI Agents can do today?

आगे क्या देखना है

क्या पूरा पेपर, डेटासेट और लीडरबोर्ड परीक्षण किए गए मॉडल की पहचान करता है; क्या स्वतंत्र समूह अति-इनकार अंतर को पुन: उत्पन्न करते हैं; क्या साक्ष्य-उलट दर्पण परिणाम पैटर्न-मिलान के संकेत के रूप में मान्य हैं; और क्या खरीदार और नियामक गलत होल्ड को सुरक्षित डिफ़ॉल्ट के बजाय मापी गई विफलता के रूप में मानना ​​शुरू करते हैं।

देखने लायक सबसे तत्काल चीज़ प्रकटीकरण है। पूरा पेपर, कोई भी जारी किया गया डेटासेट या कोड, और लीडरबोर्ड में अमूर्त संदर्भ दिखाएंगे कि किन मॉडलों का परीक्षण किया गया था, 30 स्थितियां कैसे बनाई गईं, और 28.1% का आंकड़ा मॉडल और डोमेन में कैसे वितरित होता है। 30 स्थितियों में फैली एक समग्र संख्या व्यापक भिन्नता को छुपा सकती है, और मॉडल का चयन करने वाले किसी भी व्यक्ति के लिए व्यावहारिक प्रश्न यह है कि कौन सी प्रणालियाँ उस सीमा के किस छोर पर बैठती हैं।

स्वतंत्र प्रतिकृति शीर्षक आंकड़े से अधिक मायने रखती है। परिदृश्यों को चलाने वाले अन्य समूहों पर नज़र रखें, सबसे कठिन "जोखिम-समाधान प्रतिबद्ध" मामलों पर जमीनी सच्चाई लेबल की जांच के लिए, और क्या घटना-बनाम-दर्पण अंतर उन लोगों द्वारा परीक्षण में बचता है जिन्होंने बेंचमार्क का निर्माण नहीं किया था। यह अंतर अखबार का सबसे परिणामी दावा है, और यह इस पर भी सबसे अधिक निर्भर है कि दर्पणों का निर्माण कैसे किया गया था।

यह भी ट्रैकिंग के लायक है कि क्या सिंगल-स्टेप फ़्रेमिंग स्थानांतरित होती है। एक मॉडल को एक प्रस्तावित कार्रवाई को आपूर्ति किए गए सबूतों के साथ पूरा करने के लिए कहा जाता है, वह कार्य के बीच में एक एजेंट से अलग स्थिति में होता है, जिसे यह तय करना होता है कि प्रतिबद्ध होने से पहले कौन से सबूत इकट्ठा करने हैं। समान परिदृश्यों को पूर्ण एजेंट लूप के अंदर रखकर अनुवर्ती कार्य यह परीक्षण करेगा कि क्या यहां मापा गया अंशांकन वास्तविक व्यवहार की भविष्यवाणी करता है।

गोद लेने के पक्ष में, सवाल यह है कि क्या झूठी-पकड़ दरें खरीद और सिस्टम कार्ड में इनकार दरों के साथ प्रवेश करती हैं, और क्या मॉडल डेवलपर्स अकेले सावधानी बरतने के बजाय कार्रवाई सीमा पर अंशांकन के लिए ट्यूनिंग शुरू करते हैं। लेखकों का दावा है कि अतिरिक्त तर्क से कमजोर गेटों को मदद मिलती है, लेकिन पहले से ही कैलिब्रेटेड गेट्स को मदद नहीं मिलती है, अगर पुष्टि की जाती है, तो यह इस धारणा के खिलाफ होगा कि अधिक अनुमान-समय की गणना विश्वसनीय रूप से सुरक्षा-प्रासंगिक निर्णय में सुधार करती है।

अंत में, संस्करण देखें। V2026-05 लेबल वाला और सार्वजनिक घटनाओं पर आधारित एक बेंचमार्क संदूषण की समस्या का सामना करता है क्योंकि इसके परिदृश्य प्रसारित होते हैं और भविष्य के मॉडल उन पर प्रशिक्षित होते हैं। लेखक सेट को कैसे ताज़ा करते हैं - और क्या वास्तविक तर्क लाभ के माध्यम से या एक्सपोज़र के माध्यम से दर्पण प्रदर्शन में सुधार होता है - यह निर्धारित करेगा कि संख्याओं का आज क्या मतलब है।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई एजेंटएआई नैतिकताएआई मॉडल की व्याख्याआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखें
क्या यह उपयोगी पाया गया?