समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

के-बेंच वास्तविक वैज्ञानिक अनुरोधों पर एआई एजेंटों का परीक्षण करता है और सटीकता अंतर पाता है

लाइव वैज्ञानिक-एजेंट अनुरोधों से निर्मित एक नए बेंचमार्क से पता चलता है कि कोई भी परीक्षण किया गया मॉडल लगातार अध्ययन की स्वीकृति सीमा को पूरा नहीं करता है। पेपर वैज्ञानिक सटीकता की तुलना में अधिक मजबूत संचार की रिपोर्ट करता है, जिसमें सबसे आम विफलता टैग पर अधिक दावा किया गया है।

5 min readRead the primary source
Primary-source image accompanying K-Bench tests AI agents on real scientific requests and finds accuracy gap
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.21601
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बेंचमार्क
मॉडल प्रदर्शन को मापने और तुलना करने के लिए उपयोग किया जाने वाला एक मानकीकृत परीक्षण या डेटासेट।
एआई एजेंट
एक सॉफ़्टवेयर सिस्टम जो किसी लक्ष्य को प्राप्त करने के लिए अक्सर टूल और मेमोरी का उपयोग करके निरीक्षण कर सकता है, तर्क कर सकता है और कार्रवाई कर सकता है।
विलंबता
अनुरोध भेजने और मॉडल का आउटपुट प्राप्त करने के बीच का समय।
स्वयं की जांच करोएआई एजेंट प्रश्नोत्तरी

क्या हुआ?

एक arXiv प्रीप्रिंट के-बेंच 01 का परिचय देता है, जो के-डेंस वेब पर लाइव उपयोगकर्ता ट्रैफ़िक से नमूना किए गए 1,602 प्रथम-मोड़ वैज्ञानिक अनुरोधों को संभालने वाले नौ फ्रंटियर एआई मॉडल का मूल्यांकन है। अनुरोधों में कम निर्दिष्ट कार्य और अनुलग्नक शामिल थे और उन्हें समान सैंडबॉक्स में शुरू से अंत तक चलाया गया था, फिर तीन अंध भाषा-मॉडल न्यायाधीशों द्वारा आठ-आयाम रूब्रिक में स्कोर किया गया था।

लेखक के-बेंच 01 को के-डेंस वेब पर लाइव उपयोगकर्ता ट्रैफ़िक से लिए गए फर्स्ट-टर्न अनुरोधों से निर्मित मूल्यांकन के रूप में वर्णित करते हैं। मुख्य रूप से बहुविकल्पीय प्रश्नों, संदर्भ समाधानों के साथ क्यूरेटेड कार्यों या ज्ञात नियमों वाले सिमुलेटर पर आधारित बेंचमार्क के विपरीत, इन अनुरोधों को कम निर्दिष्ट, संलग्नक ले जाने में सक्षम और जमीनी सच्चाई वाले उत्तरों की कमी के रूप में वर्णित किया गया है। यह डिज़ाइन बेंचमार्क को उन स्थितियों के करीब बनाता है जिनमें वैज्ञानिक उपयोगकर्ता एआई एजेंट से मदद मांग सकते हैं, हालांकि स्रोत आपूर्ति किए गए पाठ में पूरा अनुरोध सेट प्रदान नहीं करता है।

अध्ययन में नौ सीमांत मॉडलों को एक जैसे सैंडबॉक्स में शुरू से अंत तक चलाया गया और 1,602 पूर्ण एजेंट रन की रिपोर्ट दी गई। तीन अंधे भाषा-मॉडल न्यायाधीशों ने आठ-आयाम रूब्रिक के विरुद्ध प्रत्येक रन बनाया। पेपर रूब्रिक के 8-एंकर को उस कार्य के रूप में परिभाषित करता है जिसे एक डोमेन वैज्ञानिक मामूली संपादन के साथ स्वीकार करेगा। उस मानक पर, लेखक रिपोर्ट करते हैं कि किसी भी मॉडल ने सभी तीन न्यायाधीशों के तहत लाइन को मंजूरी नहीं दी।

सार जीपीटी-5.6-सोल को 7.80 से 8.23 ​​के 95% अंतराल के साथ उच्चतम पूल्ड माध्य स्कोर, 8.04 के रूप में पहचानता है। वह अंतराल दहलीज तक फैला है, और तीन में से दो न्यायाधीशों ने क्लाउड-ओपस-5 को प्रथम स्थान दिया। उस कारण से, लेखक सिस्टम के क्रम को अधिक प्रतिलिपि प्रस्तुत करने योग्य परिणाम के रूप में मानते हैं, जबकि पूर्ण स्तर और तालिका के शीर्ष को क्रमशः मूल्यांकन उपकरण पर निर्भर और अनसुलझे के रूप में वर्णित करते हैं।

39,934 में लागू नहीं होने वाले चिह्नित कक्षों को छोड़कर, 47.6% 8-बिंदु सीमा से नीचे गिर गए। सूत्र का कहना है कि कुल में आठ आयाम स्कोर और प्रत्येक मूल्यांकन के लिए एक समग्र समग्र स्कोर शामिल है। यह वैज्ञानिक सटीकता के बीच एक अंतर की भी रिपोर्ट करता है, जिसका औसत 6.22 था, और संचार, जिसका औसत 7.33 था, नौ मॉडलों में से प्रत्येक के भीतर एक ही दिशा देखी गई। ओवरक्लेमिंग प्रमुख विफलता टैग था, जो 31.4% मूल्यांकनों पर प्रदर्शित हुआ।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

बेंचमार्क कई एआई मूल्यांकनों में एक व्यावहारिक कमजोरी को संबोधित करता है: वैज्ञानिक कार्य में अक्सर एक संदर्भ उत्तर का अभाव होता है और इसका मूल्यांकन उत्पादित कार्य और इसके बारे में किए गए दावों दोनों पर किया जाना चाहिए। इसके परिणाम बताते हैं कि संचार गुणवत्ता वैज्ञानिक सटीकता से अधिक हो सकती है, जबकि अनुसंधान वर्कफ़्लो में उपयोग की जाने वाली प्रणालियों के लिए ओवरक्लेमिंग एक बड़ा जोखिम बना हुआ है।

के-बेंच का केंद्रीय योगदान पद्धतिगत होने के साथ-साथ तुलनात्मक भी है। वैज्ञानिक सहायता हमेशा उत्तर के रूप में एक सही स्ट्रिंग वाला प्रश्न नहीं होता है। एक उपयोगी प्रणाली को अधूरे अनुरोध की व्याख्या करने, आपूर्ति की गई सामग्रियों के साथ काम करने, कलाकृतियों का उत्पादन करने, सीमाओं की व्याख्या करने और अपने साक्ष्य समर्थन से अधिक का दावा करने से बचने की आवश्यकता हो सकती है। बेंचमार्क उस संयुक्त प्रदर्शन को एकल उत्तर-सटीकता माप तक सीमित करने के बजाय स्कोर करने का प्रयास करता है।

रिपोर्ट की गई सटीकता-संचार अंतर अनुसंधान उपयोगकर्ताओं के लिए परिणामी है। एक एजेंट वैज्ञानिक रूप से कमजोर या अपर्याप्त रूप से समर्थित दावे करते हुए भी स्पष्ट गद्य प्रस्तुत कर सकता है। स्रोत यह स्थापित नहीं करता है कि किसी विशेष मॉडल ने नुकसान पहुंचाया है या बेंचमार्क वास्तविक दुनिया की विफलता दर की भविष्यवाणी करता है, लेकिन यह एक विफलता मोड की पहचान करता है जो कि जहां भी एआई-जनित विश्लेषण वैज्ञानिकों, इंजीनियरों, समीक्षकों या निर्णय निर्माताओं को दिया जाता है, वहां मायने रखता है।

ओवरक्लेमिंग परिणाम विशेष रूप से निरीक्षण के लिए प्रासंगिक है। यदि किसी सिस्टम का स्पष्टीकरण उसके अंतर्निहित कार्य वारंट से अधिक परिष्कृत लगता है, तो उपयोगकर्ताओं को यह पहचानने में कठिनाई हो सकती है कि अतिरिक्त जाँच की आवश्यकता कब है। लेखकों के अनुसार, क्या वितरित किया गया, क्या दावा किया गया और कौन सी कलाकृतियों का उत्पादन किया गया, इसके संयुक्त वितरण पर के-बेंच का जोर अकेले लीडरबोर्ड की तुलना में एजेंटों के मूल्यांकन के लिए अधिक व्यावहारिक ढांचा प्रदान करता है।

परिणाम वैज्ञानिक कार्यों के लिए फ्रंटियर मॉडल की तत्परता के बारे में व्यापक दावों पर भी खरा उतरते हैं। इस रूब्रिक पर और इन परीक्षण शर्तों के तहत, सूत्र का कहना है कि कोई भी मॉडल लगातार तीनों न्यायाधीशों के बीच बताई गई स्वीकृति रेखा तक नहीं पहुंचा। इससे यह नहीं पता चलता कि प्रणालियाँ आम तौर पर उपयोगी वैज्ञानिक सहायता देने में असमर्थ हैं; इससे पता चलता है कि इस मूल्यांकन में पेपर की स्वीकृति मानदंड विश्वसनीय रूप से पूरा नहीं किया गया था। अंतर मायने रखता है क्योंकि अध्ययन एक प्रीप्रिंट है और इसका साक्ष्य वर्णित बेंचमार्क तक ही सीमित है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

आगे क्या देखना है

पेपर की रैंकिंग मॉडल गुणवत्ता का एक निश्चित माप नहीं है। लेखकों का कहना है कि सिस्टम का क्रम पूर्ण स्कोर की तुलना में अधिक प्रतिलिपि प्रस्तुत करने योग्य है, और शीर्ष स्थान अनसुलझा है। आगे की जांच में अनुरोध नमूना, मॉडल और जज की पहचान, रूब्रिक डिजाइन, सैंडबॉक्स की स्थिति और क्या स्वतंत्र मूल्यांकनकर्ता निष्कर्षों को पुन: प्रस्तुत करते हैं, पर ध्यान केंद्रित करना चाहिए।

स्वतंत्र प्रतिकृति को यह जांच करनी चाहिए कि क्या के-बेंच के निष्कर्ष नमूना किए गए के-डेंस वेब ट्रैफ़िक से बाहर हैं। आपूर्ति किया गया स्रोत यह नहीं बताता है कि कितने उपयोगकर्ताओं ने अनुरोधों में योगदान दिया, अनुरोधों का चयन कैसे किया गया, उन्होंने किस वैज्ञानिक डोमेन को कवर किया, अनुलग्नकों को कैसे संभाला गया, या क्या नमूना विशिष्ट शोध कार्य को दर्शाता है। वे अज्ञात प्रभाव प्रभावित करते हैं कि परिणाम कितने व्यापक रूप से लागू किए जा सकते हैं।

सभी नौ परीक्षण किए गए मॉडलों की पहचान और कॉन्फ़िगरेशन स्रोत पाठ में नहीं दिए गए हैं। अमूर्त नाम gpt-5.6-sol और claude-opus-5 हैं, लेकिन अन्य प्रणालियों, उनके संस्करणों, पहुंच की शर्तों, उपकरण अनुमतियों, संदर्भ सीमाओं, या लागत और विलंबता बाधाओं को सूचीबद्ध नहीं करते हैं। वे विवरण प्रतिलिपि प्रस्तुत करने योग्यता और व्यावहारिक व्याख्या दोनों को प्रभावित कर सकते हैं।

तीन अंध भाषा-मॉडल न्यायाधीशों का उपयोग जांच का एक अन्य क्षेत्र है। स्रोत जज मॉडल की पहचान नहीं करता है, यह नहीं बताता है कि उन्हें कैसे कैलिब्रेट किया गया था, समझौते के आँकड़े रिपोर्ट करते हैं, या यह वर्णन नहीं करते हैं कि असहमति का समाधान कैसे किया गया था। चूँकि पेपर स्वयं कहता है कि पूर्ण स्कोर उपकरण की विशेषताएँ हैं, भविष्य के काम में यह परीक्षण किया जाना चाहिए कि क्या मानव डोमेन वैज्ञानिक और अन्य निर्णय प्रक्रियाएँ समान निष्कर्ष निकालती हैं।

बेंचमार्क का सबसे उपयोगी अनुवर्ती किसी अन्य समग्र रैंकिंग के बजाय आर्टिफैक्ट-स्तरीय ऑडिटिंग हो सकता है। शोधकर्ताओं और तैनातीकर्ताओं को ऐसे मूल्यांकनों की तलाश करनी चाहिए जो अलग-अलग क्षेत्रों और कार्य की लंबाई में वैज्ञानिक शुद्धता, साक्ष्य के उपयोग, अनिश्चितता, संचार और ओवरक्लेमिंग का अलग से निरीक्षण करें। पेपर परिनियोजन परिणामों, उपयोगकर्ता निर्भरता, या वास्तविक दुनिया की वैज्ञानिक खोजों की रिपोर्ट नहीं करता है, इसलिए वे व्यावहारिक प्रभाव अज्ञात रहते हैं।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई एजेंटएआई मॉडल की व्याख्याएआई प्रशिक्षणChatGPT और एलएलएमआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?