क्या हुआ?
एक arXiv प्रीप्रिंट के-बेंच 01 का परिचय देता है, जो के-डेंस वेब पर लाइव उपयोगकर्ता ट्रैफ़िक से नमूना किए गए 1,602 प्रथम-मोड़ वैज्ञानिक अनुरोधों को संभालने वाले नौ फ्रंटियर एआई मॉडल का मूल्यांकन है। अनुरोधों में कम निर्दिष्ट कार्य और अनुलग्नक शामिल थे और उन्हें समान सैंडबॉक्स में शुरू से अंत तक चलाया गया था, फिर तीन अंध भाषा-मॉडल न्यायाधीशों द्वारा आठ-आयाम रूब्रिक में स्कोर किया गया था।
लेखक के-बेंच 01 को के-डेंस वेब पर लाइव उपयोगकर्ता ट्रैफ़िक से लिए गए फर्स्ट-टर्न अनुरोधों से निर्मित मूल्यांकन के रूप में वर्णित करते हैं। मुख्य रूप से बहुविकल्पीय प्रश्नों, संदर्भ समाधानों के साथ क्यूरेटेड कार्यों या ज्ञात नियमों वाले सिमुलेटर पर आधारित बेंचमार्क के विपरीत, इन अनुरोधों को कम निर्दिष्ट, संलग्नक ले जाने में सक्षम और जमीनी सच्चाई वाले उत्तरों की कमी के रूप में वर्णित किया गया है। यह डिज़ाइन बेंचमार्क को उन स्थितियों के करीब बनाता है जिनमें वैज्ञानिक उपयोगकर्ता एआई एजेंट से मदद मांग सकते हैं, हालांकि स्रोत आपूर्ति किए गए पाठ में पूरा अनुरोध सेट प्रदान नहीं करता है।
अध्ययन में नौ सीमांत मॉडलों को एक जैसे सैंडबॉक्स में शुरू से अंत तक चलाया गया और 1,602 पूर्ण एजेंट रन की रिपोर्ट दी गई। तीन अंधे भाषा-मॉडल न्यायाधीशों ने आठ-आयाम रूब्रिक के विरुद्ध प्रत्येक रन बनाया। पेपर रूब्रिक के 8-एंकर को उस कार्य के रूप में परिभाषित करता है जिसे एक डोमेन वैज्ञानिक मामूली संपादन के साथ स्वीकार करेगा। उस मानक पर, लेखक रिपोर्ट करते हैं कि किसी भी मॉडल ने सभी तीन न्यायाधीशों के तहत लाइन को मंजूरी नहीं दी।
सार जीपीटी-5.6-सोल को 7.80 से 8.23 के 95% अंतराल के साथ उच्चतम पूल्ड माध्य स्कोर, 8.04 के रूप में पहचानता है। वह अंतराल दहलीज तक फैला है, और तीन में से दो न्यायाधीशों ने क्लाउड-ओपस-5 को प्रथम स्थान दिया। उस कारण से, लेखक सिस्टम के क्रम को अधिक प्रतिलिपि प्रस्तुत करने योग्य परिणाम के रूप में मानते हैं, जबकि पूर्ण स्तर और तालिका के शीर्ष को क्रमशः मूल्यांकन उपकरण पर निर्भर और अनसुलझे के रूप में वर्णित करते हैं।
39,934 में लागू नहीं होने वाले चिह्नित कक्षों को छोड़कर, 47.6% 8-बिंदु सीमा से नीचे गिर गए। सूत्र का कहना है कि कुल में आठ आयाम स्कोर और प्रत्येक मूल्यांकन के लिए एक समग्र समग्र स्कोर शामिल है। यह वैज्ञानिक सटीकता के बीच एक अंतर की भी रिपोर्ट करता है, जिसका औसत 6.22 था, और संचार, जिसका औसत 7.33 था, नौ मॉडलों में से प्रत्येक के भीतर एक ही दिशा देखी गई। ओवरक्लेमिंग प्रमुख विफलता टैग था, जो 31.4% मूल्यांकनों पर प्रदर्शित हुआ।
यह क्यों मायने रखता है?
बेंचमार्क कई एआई मूल्यांकनों में एक व्यावहारिक कमजोरी को संबोधित करता है: वैज्ञानिक कार्य में अक्सर एक संदर्भ उत्तर का अभाव होता है और इसका मूल्यांकन उत्पादित कार्य और इसके बारे में किए गए दावों दोनों पर किया जाना चाहिए। इसके परिणाम बताते हैं कि संचार गुणवत्ता वैज्ञानिक सटीकता से अधिक हो सकती है, जबकि अनुसंधान वर्कफ़्लो में उपयोग की जाने वाली प्रणालियों के लिए ओवरक्लेमिंग एक बड़ा जोखिम बना हुआ है।
के-बेंच का केंद्रीय योगदान पद्धतिगत होने के साथ-साथ तुलनात्मक भी है। वैज्ञानिक सहायता हमेशा उत्तर के रूप में एक सही स्ट्रिंग वाला प्रश्न नहीं होता है। एक उपयोगी प्रणाली को अधूरे अनुरोध की व्याख्या करने, आपूर्ति की गई सामग्रियों के साथ काम करने, कलाकृतियों का उत्पादन करने, सीमाओं की व्याख्या करने और अपने साक्ष्य समर्थन से अधिक का दावा करने से बचने की आवश्यकता हो सकती है। बेंचमार्क उस संयुक्त प्रदर्शन को एकल उत्तर-सटीकता माप तक सीमित करने के बजाय स्कोर करने का प्रयास करता है।
रिपोर्ट की गई सटीकता-संचार अंतर अनुसंधान उपयोगकर्ताओं के लिए परिणामी है। एक एजेंट वैज्ञानिक रूप से कमजोर या अपर्याप्त रूप से समर्थित दावे करते हुए भी स्पष्ट गद्य प्रस्तुत कर सकता है। स्रोत यह स्थापित नहीं करता है कि किसी विशेष मॉडल ने नुकसान पहुंचाया है या बेंचमार्क वास्तविक दुनिया की विफलता दर की भविष्यवाणी करता है, लेकिन यह एक विफलता मोड की पहचान करता है जो कि जहां भी एआई-जनित विश्लेषण वैज्ञानिकों, इंजीनियरों, समीक्षकों या निर्णय निर्माताओं को दिया जाता है, वहां मायने रखता है।
ओवरक्लेमिंग परिणाम विशेष रूप से निरीक्षण के लिए प्रासंगिक है। यदि किसी सिस्टम का स्पष्टीकरण उसके अंतर्निहित कार्य वारंट से अधिक परिष्कृत लगता है, तो उपयोगकर्ताओं को यह पहचानने में कठिनाई हो सकती है कि अतिरिक्त जाँच की आवश्यकता कब है। लेखकों के अनुसार, क्या वितरित किया गया, क्या दावा किया गया और कौन सी कलाकृतियों का उत्पादन किया गया, इसके संयुक्त वितरण पर के-बेंच का जोर अकेले लीडरबोर्ड की तुलना में एजेंटों के मूल्यांकन के लिए अधिक व्यावहारिक ढांचा प्रदान करता है।
परिणाम वैज्ञानिक कार्यों के लिए फ्रंटियर मॉडल की तत्परता के बारे में व्यापक दावों पर भी खरा उतरते हैं। इस रूब्रिक पर और इन परीक्षण शर्तों के तहत, सूत्र का कहना है कि कोई भी मॉडल लगातार तीनों न्यायाधीशों के बीच बताई गई स्वीकृति रेखा तक नहीं पहुंचा। इससे यह नहीं पता चलता कि प्रणालियाँ आम तौर पर उपयोगी वैज्ञानिक सहायता देने में असमर्थ हैं; इससे पता चलता है कि इस मूल्यांकन में पेपर की स्वीकृति मानदंड विश्वसनीय रूप से पूरा नहीं किया गया था। अंतर मायने रखता है क्योंकि अध्ययन एक प्रीप्रिंट है और इसका साक्ष्य वर्णित बेंचमार्क तक ही सीमित है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
आगे क्या देखना है
पेपर की रैंकिंग मॉडल गुणवत्ता का एक निश्चित माप नहीं है। लेखकों का कहना है कि सिस्टम का क्रम पूर्ण स्कोर की तुलना में अधिक प्रतिलिपि प्रस्तुत करने योग्य है, और शीर्ष स्थान अनसुलझा है। आगे की जांच में अनुरोध नमूना, मॉडल और जज की पहचान, रूब्रिक डिजाइन, सैंडबॉक्स की स्थिति और क्या स्वतंत्र मूल्यांकनकर्ता निष्कर्षों को पुन: प्रस्तुत करते हैं, पर ध्यान केंद्रित करना चाहिए।
स्वतंत्र प्रतिकृति को यह जांच करनी चाहिए कि क्या के-बेंच के निष्कर्ष नमूना किए गए के-डेंस वेब ट्रैफ़िक से बाहर हैं। आपूर्ति किया गया स्रोत यह नहीं बताता है कि कितने उपयोगकर्ताओं ने अनुरोधों में योगदान दिया, अनुरोधों का चयन कैसे किया गया, उन्होंने किस वैज्ञानिक डोमेन को कवर किया, अनुलग्नकों को कैसे संभाला गया, या क्या नमूना विशिष्ट शोध कार्य को दर्शाता है। वे अज्ञात प्रभाव प्रभावित करते हैं कि परिणाम कितने व्यापक रूप से लागू किए जा सकते हैं।
सभी नौ परीक्षण किए गए मॉडलों की पहचान और कॉन्फ़िगरेशन स्रोत पाठ में नहीं दिए गए हैं। अमूर्त नाम gpt-5.6-sol और claude-opus-5 हैं, लेकिन अन्य प्रणालियों, उनके संस्करणों, पहुंच की शर्तों, उपकरण अनुमतियों, संदर्भ सीमाओं, या लागत और विलंबता बाधाओं को सूचीबद्ध नहीं करते हैं। वे विवरण प्रतिलिपि प्रस्तुत करने योग्यता और व्यावहारिक व्याख्या दोनों को प्रभावित कर सकते हैं।
तीन अंध भाषा-मॉडल न्यायाधीशों का उपयोग जांच का एक अन्य क्षेत्र है। स्रोत जज मॉडल की पहचान नहीं करता है, यह नहीं बताता है कि उन्हें कैसे कैलिब्रेट किया गया था, समझौते के आँकड़े रिपोर्ट करते हैं, या यह वर्णन नहीं करते हैं कि असहमति का समाधान कैसे किया गया था। चूँकि पेपर स्वयं कहता है कि पूर्ण स्कोर उपकरण की विशेषताएँ हैं, भविष्य के काम में यह परीक्षण किया जाना चाहिए कि क्या मानव डोमेन वैज्ञानिक और अन्य निर्णय प्रक्रियाएँ समान निष्कर्ष निकालती हैं।
बेंचमार्क का सबसे उपयोगी अनुवर्ती किसी अन्य समग्र रैंकिंग के बजाय आर्टिफैक्ट-स्तरीय ऑडिटिंग हो सकता है। शोधकर्ताओं और तैनातीकर्ताओं को ऐसे मूल्यांकनों की तलाश करनी चाहिए जो अलग-अलग क्षेत्रों और कार्य की लंबाई में वैज्ञानिक शुद्धता, साक्ष्य के उपयोग, अनिश्चितता, संचार और ओवरक्लेमिंग का अलग से निरीक्षण करें। पेपर परिनियोजन परिणामों, उपयोगकर्ता निर्भरता, या वास्तविक दुनिया की वैज्ञानिक खोजों की रिपोर्ट नहीं करता है, इसलिए वे व्यावहारिक प्रभाव अज्ञात रहते हैं।