क्या हुआ?
शोधकर्ताओं ओगुज़ सर्दार और क्यूनेट मेर्टायक ने स्टीयरबेंच-वर्क का वर्णन करते हुए एक प्रीप्रिंट पोस्ट किया, जो कार्यस्थल एआई एजेंटों में प्री-कमिट "आगे बढ़ें या रोकें" निर्णय के लिए एक बेंचमार्क है। वे रिपोर्ट करते हैं कि 30 मॉडल स्थितियों में, मॉडलों ने 28.1% अवसरों पर गलत तरीके से अधिकृत, साक्ष्य-मुक्त कार्य को मान्यता दी और 1.0% पर गलत तरीके से असुरक्षित कार्य की अनुमति दी।
दो शोधकर्ताओं, ओगुज़ सर्दार और क्यूनेट मर्टयाक ने 12 अगस्त 2026 को arXiv पर एक प्रीप्रिंट पोस्ट किया, जिसमें स्टीयरबेंच-वर्क की शुरुआत की गई, जो लंबे समय से चल रहे एआई एजेंट के वर्कफ़्लो के अंदर एक ही निर्णय के आसपास बनाया गया एक बेंचमार्क है: क्या कोई कार्रवाई करनी है या इसे मानव या नीति समीक्षा के लिए रखना है। लेखक इसे स्टीयरिंग निर्णय कहते हैं और इसे कार्रवाई सीमा पर रखते हैं - एक एजेंट द्वारा ईमेल भेजने, पुल अनुरोध को मर्ज करने, या भुगतान को तार करने से ठीक पहले का बिंदु। बेंचमार्क यह स्कोर नहीं करता कि कोई एजेंट किसी कार्य को पूरा कर सकता है या नहीं। यह स्कोर करता है कि एजेंट उस सीमा को सही ढंग से पार करता है या रखता है।
सार में वर्णित रिलीज़ को v2026-05 लेबल किया गया है और इसमें डेवलपर संचालन, ग्राहक सेवा, वित्त, कानूनी, चिकित्सा, मानव संसाधन और सुरक्षा से संबंधित 106 परिदृश्य शामिल हैं। परिदृश्य सार्वजनिक घटनाओं पर आधारित होते हैं। प्रत्येक को उस चीज़ के साथ जोड़ा जाता है जिसे लेखक साक्ष्य-उलट दर्पण कहते हैं - उसी स्थिति का एक संस्करण जिसमें अंतर्निहित साक्ष्य दूसरी तरफ इंगित करते हैं - अंशांकन नियंत्रण के साथ। लेबल को आगे बढ़ने और होल्ड करने के बीच लगभग समान रूप से विभाजित किया जाता है, जिसके बारे में लेखकों का कहना है कि यह जानबूझकर किया गया है: यह दो त्रुटि दिशाओं को घटित होने की समान संख्या के करीब देता है, इसलिए कोई मॉडल केवल सावधानी बरतने में चूक करके अच्छा स्कोर नहीं कर सकता है। प्रत्येक आइटम में, एक मॉडल एक प्रस्तावित कार्रवाई और उपलब्ध साक्ष्य दिखाता है, और एक गेट निर्णय लौटाता है।
30 मॉडल स्थितियों में, लेखक रिपोर्ट करते हैं कि विफलताएँ लगभग पूरी तरह से एक ही दिशा में चलती हैं। मॉडलों ने 28.1% अवसरों पर गलत तरीके से अधिकृत, साक्ष्य-मुक्त कार्य को मान्यता दी, जबकि 1.0% पर गलत तरीके से असुरक्षित कार्य की अनुमति दी। सार के अनुसार, सबसे कठिन श्रेणी वह है जिसे लेखक जोखिम-समाधान प्रतिबद्धता कहते हैं: ऐसे मामले जहां एक वास्तविक जोखिम ट्रिगर हुआ लेकिन हस्ताक्षरित या संरचित साक्ष्य ने इसे पहले ही साफ़ कर दिया है, और सही उत्तर आगे बढ़ना है। प्रसिद्ध घटनाओं और उनके दर्पणों के बीच प्रदर्शन में भी तेजी से अंतर आया - स्वयं घटनाओं पर 98.5% बनाम साक्ष्य-उलट संस्करणों पर 63.8%।
लेखक सामान्य क्षमता और स्टीयरिंग अंशांकन के बीच एक और अंतर बताते हैं। उच्च-क्षमता वाले मॉडल, वे लिखते हैं, अक्सर प्रतिबद्ध सीमा पर अति-अस्वीकार करते हैं, और अतिरिक्त तर्क पहले से ही कैलिब्रेटेड एक फ्लैट को छोड़कर एक कमजोर गेट की मरम्मत कर सकते हैं। सार एक सार्वजनिक लीडरबोर्ड की ओर इशारा करता है, लेकिन स्रोत पृष्ठ पते को एक कार्यशील लिंक के बजाय प्लेसहोल्डर के रूप में प्रस्तुत करता है।
यहां उपलब्ध सामग्री से कई बातें स्थापित नहीं होतीं। सार परीक्षण किए गए मॉडलों का नाम नहीं देता है, यह परिभाषित नहीं करता है कि 30 के बीच एक विशिष्ट "मॉडल स्थिति" के रूप में क्या गिना जाता है, और कोई प्रति-डोमेन या प्रति-मॉडल ब्रेकडाउन नहीं देता है। इसमें यह वर्णन नहीं किया गया है कि जमीनी सच्चाई वाले लेबल किसने लिखे या असहमतियों का समाधान कैसे किया गया, और संस्करण लेबल v2026-05 को अगस्त सबमिशन तिथि के विरुद्ध समझाया नहीं गया है। यह एक संस्करण-एक प्रीप्रिंट है जिसमें सहकर्मी समीक्षा का कोई संकेत नहीं है, और कोई भी आंकड़ा स्वतंत्र रूप से पुन: प्रस्तुत नहीं किया गया है।
यह क्यों मायने रखता है?
अधिकांश एजेंट सुरक्षा परीक्षण यह मापते हैं कि मॉडल हानिकारक कार्यों को रोकते हैं या नहीं। यह कार्य दोनों त्रुटि दिशाओं को मापता है और पाता है कि प्रमुख विफलता ओवर-ब्लॉकिंग है, जो वास्तविक परिचालन लागत वहन करती है और मनुष्यों को रबर-स्टैंपिंग में धकेल सकती है। ये संख्याएँ बिना समीक्षा किए गए प्रीप्रिंट से आई हैं और इन्हें स्वतंत्र रूप से सत्यापित नहीं किया गया है।
एआई एजेंटों को केवल पाठ तैयार करने के बजाय कार्रवाई करने के लिए तेजी से तैनात किया जा रहा है, और वह बिंदु जहां एक सुझाव एक अपरिवर्तनीय प्रभाव बन जाता है, वह वास्तव में जोखिम पैदा करता है। बहुत सारे प्रकाशित एजेंट सुरक्षा कार्य एक प्रश्न पूछते हैं - क्या मॉडल ने हानिकारक चीज़ से इंकार कर दिया? - और एक प्रणाली जो हर चीज़ को अस्वीकार कर देती है, वह बेकार होते हुए भी उस प्रश्न पर उत्कृष्ट अंक प्राप्त करती है। आगे बढ़ने और लेबल को संतुलित करके और दोनों त्रुटि दरों की रिपोर्ट करके, यह बेंचमार्क इसके एक तरफ के बजाय ट्रेडऑफ़ को मापता है।
यदि रिपोर्ट की गई विषमता सामान्य हो जाती है, तो एंटरप्राइज़ एजेंट तैनाती में व्यावहारिक समस्या भगोड़ा कार्रवाई की तुलना में ओवर-ब्लॉकिंग के करीब हो सकती है। गलत धारण मुक्त नहीं हैं. प्रत्येक मार्ग एक व्यक्ति के पास वापस काम करता है, जो कार्य को स्वचालित करने के लिए दक्षता के मामले को नष्ट कर देता है, और टिकट समाधान या कोड समीक्षा जैसी प्रक्रियाओं में विलंबता जोड़ता है जहां देरी की अपनी लागत होती है। एक सूक्ष्म जोखिम भी है: अनावश्यक वृद्धि से भरी एक समीक्षा कतार समीक्षकों को जल्दी से मंजूरी देने के लिए प्रशिक्षित करती है, जो मानवीय निरीक्षण को कमजोर करती है जिसे प्रदान करने के लिए होल्ड तंत्र मौजूद है। डाउनस्ट्रीम प्रभाव सेटअप से एक उचित अनुमान है, बेंचमार्क उपाय नहीं।
प्रसिद्ध घटनाओं पर 98.5% और उनके साक्ष्य-उलट दर्पणों पर 63.8% के बीच का अंतर जांच के लायक परिणाम है। यह उन मॉडलों के अनुरूप है जो एक अच्छी तरह से प्रलेखित विफलता के आकार को पहचानते हैं और उनके सामने मौजूद सबूतों को पढ़ने के बजाय उस मान्यता पर प्रतिक्रिया करते हैं। यदि वह रीडिंग सही है, तो यह जटिल है कि खरीदारों को आम तौर पर एजेंट सुरक्षा स्कोर की व्याख्या कैसे करनी चाहिए: एक मॉडल उन परिदृश्यों पर विश्वसनीय दिख सकता है जो प्रकाशित चेतावनी कहानियों से मिलते जुलते हैं, जबकि तथ्यों को पुनर्व्यवस्थित करने पर समान संरचनात्मक स्थिति को खराब तरीके से संभालते हैं। लेखकों की "जोखिम-समाधान प्रतिबद्धताएं" श्रेणी वास्तव में इसका परीक्षण करती है - सबूत मौजूद हैं जो ट्रिगर जोखिम को साफ़ करता है, और मॉडल को वास्तव में इसे संसाधित करना चाहिए।
निष्कर्ष इस बात पर भी निर्भर करते हैं कि मानव-इन-द-लूप आवश्यकताओं को कैसे लिखा जाता है। नीतियाँ जो कार्रवाई की श्रेणियों के लिए समीक्षा अनिवार्य करती हैं, मानती हैं कि गेट सुरक्षित डिफ़ॉल्ट है। यह कार्य सुझाव देता है कि साफ़ किए गए कार्य को अवरुद्ध करने की दिशा में गेट की अपनी त्रुटि दर है, और दर को शून्य के करीब मानने के बजाय मापा जाना चाहिए।
इस सब के विरुद्ध वजन करते हुए: बेंचमार्क एक क्यूरेटेड साक्ष्य पैकेट दिए गए एकल प्री-कमिट निर्णय का मूल्यांकन करता है, न कि एक एजेंट जो अधूरी जानकारी के साथ वास्तविक टूल लूप का संचालन करता है जिसे उसे स्वयं इकट्ठा करना होगा। वास्तविक तैनाती भी अनुमति प्रणालियों और संगठनात्मक संदर्भ के पीछे होती है जिसे परिदृश्य पूरी तरह से प्रस्तुत नहीं कर सकते हैं। क्या 106 निर्मित परिदृश्य, चाहे कितनी भी सावधानी से बनाए गए हों, उत्पादन में व्यवहार की भविष्यवाणी करते हैं, यह एक खुला प्रश्न है, और यहां दावे लेखकों के अपने हैं।
Interactive Mechanism: How It Actually Works
Explore the underlying technology behind this development interactively.
What is the most accurate way to describe what AI Agents can do today?
आगे क्या देखना है
क्या पूरा पेपर, डेटासेट और लीडरबोर्ड परीक्षण किए गए मॉडल की पहचान करता है; क्या स्वतंत्र समूह अति-इनकार अंतर को पुन: उत्पन्न करते हैं; क्या साक्ष्य-उलट दर्पण परिणाम पैटर्न-मिलान के संकेत के रूप में मान्य हैं; और क्या खरीदार और नियामक गलत होल्ड को सुरक्षित डिफ़ॉल्ट के बजाय मापी गई विफलता के रूप में मानना शुरू करते हैं।
देखने लायक सबसे तत्काल चीज़ प्रकटीकरण है। पूरा पेपर, कोई भी जारी किया गया डेटासेट या कोड, और लीडरबोर्ड में अमूर्त संदर्भ दिखाएंगे कि किन मॉडलों का परीक्षण किया गया था, 30 स्थितियां कैसे बनाई गईं, और 28.1% का आंकड़ा मॉडल और डोमेन में कैसे वितरित होता है। 30 स्थितियों में फैली एक समग्र संख्या व्यापक भिन्नता को छुपा सकती है, और मॉडल का चयन करने वाले किसी भी व्यक्ति के लिए व्यावहारिक प्रश्न यह है कि कौन सी प्रणालियाँ उस सीमा के किस छोर पर बैठती हैं।
स्वतंत्र प्रतिकृति शीर्षक आंकड़े से अधिक मायने रखती है। परिदृश्यों को चलाने वाले अन्य समूहों पर नज़र रखें, सबसे कठिन "जोखिम-समाधान प्रतिबद्ध" मामलों पर जमीनी सच्चाई लेबल की जांच के लिए, और क्या घटना-बनाम-दर्पण अंतर उन लोगों द्वारा परीक्षण में बचता है जिन्होंने बेंचमार्क का निर्माण नहीं किया था। यह अंतर अखबार का सबसे परिणामी दावा है, और यह इस पर भी सबसे अधिक निर्भर है कि दर्पणों का निर्माण कैसे किया गया था।
यह भी ट्रैकिंग के लायक है कि क्या सिंगल-स्टेप फ़्रेमिंग स्थानांतरित होती है। एक मॉडल को एक प्रस्तावित कार्रवाई को आपूर्ति किए गए सबूतों के साथ पूरा करने के लिए कहा जाता है, वह कार्य के बीच में एक एजेंट से अलग स्थिति में होता है, जिसे यह तय करना होता है कि प्रतिबद्ध होने से पहले कौन से सबूत इकट्ठा करने हैं। समान परिदृश्यों को पूर्ण एजेंट लूप के अंदर रखकर अनुवर्ती कार्य यह परीक्षण करेगा कि क्या यहां मापा गया अंशांकन वास्तविक व्यवहार की भविष्यवाणी करता है।
गोद लेने के पक्ष में, सवाल यह है कि क्या झूठी-पकड़ दरें खरीद और सिस्टम कार्ड में इनकार दरों के साथ प्रवेश करती हैं, और क्या मॉडल डेवलपर्स अकेले सावधानी बरतने के बजाय कार्रवाई सीमा पर अंशांकन के लिए ट्यूनिंग शुरू करते हैं। लेखकों का दावा है कि अतिरिक्त तर्क से कमजोर गेटों को मदद मिलती है, लेकिन पहले से ही कैलिब्रेटेड गेट्स को मदद नहीं मिलती है, अगर पुष्टि की जाती है, तो यह इस धारणा के खिलाफ होगा कि अधिक अनुमान-समय की गणना विश्वसनीय रूप से सुरक्षा-प्रासंगिक निर्णय में सुधार करती है।
अंत में, संस्करण देखें। V2026-05 लेबल वाला और सार्वजनिक घटनाओं पर आधारित एक बेंचमार्क संदूषण की समस्या का सामना करता है क्योंकि इसके परिदृश्य प्रसारित होते हैं और भविष्य के मॉडल उन पर प्रशिक्षित होते हैं। लेखक सेट को कैसे ताज़ा करते हैं - और क्या वास्तविक तर्क लाभ के माध्यम से या एक्सपोज़र के माध्यम से दर्पण प्रदर्शन में सुधार होता है - यह निर्धारित करेगा कि संख्याओं का आज क्या मतलब है।