क्या हुआ?
शोधकर्ताओं ने BixBench3 पेश किया, जो प्रत्यायोजित अनुसंधान कार्य पर आधारित कम्प्यूटेशनल जीवविज्ञान कार्यों पर एआई एजेंटों का परीक्षण करने के लिए डिज़ाइन किया गया एक बेंचमार्क है। एक वैज्ञानिक अनुसंधान प्रश्न और उच्च-स्तरीय तरीकों की आपूर्ति करता है, जबकि एजेंट को विश्लेषण लागू करना होगा और अंतर्निहित प्रकाशित अध्ययनों में रिपोर्ट किए गए आउटपुट के साथ तुलनीय आउटपुट उत्पन्न करना होगा।
BixBench3 कच्चे जैविक डेटा से लेकर मध्यवर्ती कम्प्यूटेशनल कलाकृतियों के माध्यम से वैज्ञानिक परिणामों तक AI एजेंटों का मूल्यांकन करता है। बेंचमार्क में प्रकाशित वैज्ञानिक अध्ययनों से लिए गए 20 कार्य शामिल हैं और इसमें 138 अद्वितीय कलाकृतियाँ शामिल हैं, जिनमें पीक कॉल मैट्रिसेस और अंतर-अभिव्यक्ति तालिकाएँ शामिल हैं। उन कलाकृतियों को मूल अध्ययनों में उत्पन्न और रिपोर्ट की गई संबंधित कलाकृतियों के विरुद्ध प्रोग्रामेटिक रूप से वर्गीकृत किया गया है।
बेंचमार्क श्रम के एक विशिष्ट विभाजन के आसपास डिज़ाइन किया गया है। एक वैज्ञानिक शोध प्रश्न चुनता है और पद्धतिगत मार्गदर्शन प्रदान करता है; एआई एजेंट विश्लेषणों को लागू करने के लिए जिम्मेदार है। यह इस बात से अधिक परीक्षण करता है कि क्या कोई मॉडल जीव विज्ञान के प्रश्न का उत्तर दे सकता है या कोड का एक अलग टुकड़ा उत्पन्न कर सकता है। यह परीक्षण करता है कि क्या सिस्टम कई परिचालनों में सुसंगत वर्कफ़्लो बनाए रख सकता है और अपेक्षित रूप में आउटपुट उत्पन्न कर सकता है।
लेखक 13 सीमांत मॉडलों में Gemini 3.1 फ्लैश लाइट के लिए 0.00 से लेकर GPT 5.6 Sol के लिए 0.48 तक स्कोर की रिपोर्ट करते हैं। बड़े कच्चे डेटासेट वाले कार्यों पर प्रदर्शन गिर गया, 100 जीबी डेटा वाले कार्यों पर 0.36 का स्कोर बताया गया। अनुक्रमिक विश्लेषण चरणों की संख्या बढ़ने से इसमें भी गिरावट आई: एक या दो चरणों की आवश्यकता वाले कार्यों के लिए स्कोर 0.36 था और तीन या अधिक चरणों की आवश्यकता वाले कार्यों के लिए 0.24 था।
संसाधन आवश्यकताएँ पर्याप्त थीं। एजेंटों ने प्रति कार्य औसतन 6.8 घंटे, 102 मिलियन टोकन और $43 का उपयोग किया। सबसे लंबे प्रयासों में 24 घंटे लगे, 1.07 बिलियन टोकन का उपयोग किया गया और लागत $525 थी। लेखक यह भी रिपोर्ट करते हैं कि उच्चतम स्कोरिंग एजेंटों ने कम टोकन का उपयोग किया और कम प्रदर्शन वाले विकल्पों की तुलना में सस्ते थे, यह दर्शाता है कि अधिक व्यय स्वचालित रूप से बेहतर परिणाम नहीं देता है।
यह क्यों मायने रखता है?
नतीजे बताते हैं कि अलग-अलग परीक्षणों पर मजबूत प्रदर्शन जरूरी नहीं कि संपूर्ण वैज्ञानिक वर्कफ़्लो के विश्वसनीय निष्पादन में तब्दील हो। बेंचमार्क व्यावहारिक बाधाओं को मापता है - आश्रित चरणों के लंबे अनुक्रम, बड़े कच्चे डेटासेट और जैविक डोमेन में अंतर - जो यह निर्धारित कर सकते हैं कि एजेंट वास्तविक अनुसंधान सेटिंग्स में उपयोगी हैं या नहीं।
कम्प्यूटेशनल जीव विज्ञान अक्सर एक भविष्यवाणी के बजाय परिवर्तनों की श्रृंखला पर निर्भर करता है। एक एजेंट को पद्धति संबंधी निर्देशों की व्याख्या करने, कच्चे डेटा में हेरफेर करने, कई विश्लेषण चलाने और मध्यवर्ती परिणामों के बीच स्थिरता बनाए रखने की आवश्यकता हो सकती है। लंबे समय तक वर्कफ़्लो पर BixBench3 की रिपोर्ट की गई गिरावट इस बात के लिए प्रासंगिक है कि वास्तविक अनुसंधान में AI सिस्टम का उपयोग कैसे किया जा सकता है, जहां एक प्रारंभिक गलती हर बाद की कलाकृति को प्रभावित कर सकती है।
बेंचमार्क भी परिष्कृत प्रदर्शनों से सत्यापन योग्य आउटपुट पर ध्यान केंद्रित करता है। केवल लिखित स्पष्टीकरण की ग्रेडिंग करने के बजाय, लेखक एजेंटों द्वारा उत्पादित कलाकृतियों की तुलना मूल अध्ययनों की कलाकृतियों से करते हैं। वह दृष्टिकोण उन विफलताओं को प्रकट कर सकता है जिन्हें एक धाराप्रवाह सारांश छुपा सकता है, हालांकि एक अपेक्षित कलाकृति का मिलान एक नई वैज्ञानिक खोज को मान्य करने के समान नहीं है।
परीक्षण किए गए मॉडलों में रिपोर्ट की गई विस्तृत स्कोर रेंज इंगित करती है कि मॉडल की पसंद भौतिक रूप से प्रभावित कर सकती है कि कोई एजेंट कम्प्यूटेशनल जीवविज्ञान असाइनमेंट पूरा कर सकता है या नहीं। स्रोत यह स्थापित नहीं करता है कि मॉडल अलग-अलग क्यों हैं, क्या परिणाम परीक्षण किए गए सिस्टम से परे सामान्यीकृत होते हैं या क्या कम स्कोर एक विशिष्ट तकनीकी कमजोरी को दर्शाता है। यह स्थापित करता है कि मूल्यांकन किए गए एजेंटों ने कार्य के समान व्यापक वर्ग पर समान रूप से प्रदर्शन नहीं किया।
लागत और समय के आंकड़े विश्वसनीयता को परिचालन के साथ-साथ तकनीकी मुद्दा भी बनाते हैं। एक औसत कार्य जिसमें घंटों और लाखों टोकन की आवश्यकता होती है, कुछ शोध टीमों के लिए प्रबंधनीय हो सकता है लेकिन नियमित, उच्च-मात्रा विश्लेषण के लिए अव्यावहारिक है। रिपोर्ट किए गए सबसे लंबे समय तक चलने से पता चलता है कि कठिन कार्य कहीं अधिक संसाधनों का उपभोग कर सकते हैं। यह निष्कर्ष कि सर्वोत्तम स्कोरिंग एजेंट सस्ते भी थे, यह सुझाव देता है कि दक्षता और क्षमता कभी-कभी एक-दूसरे को सुदृढ़ कर सकती हैं, लेकिन स्रोत कारण की पहचान करने के लिए पर्याप्त विवरण प्रदान नहीं करता है।
शोधकर्ताओं के लिए, व्यावहारिक निहितार्थ चौकियों के बिना पूर्ण विश्लेषण सौंपने के बारे में सावधानी है। बेंचमार्क किसी एजेंट को भरोसेमंद अनुसंधान सहायक के रूप में मानने से पहले मध्यवर्ती आउटपुट, अनुक्रम हैंडलिंग और डेटासेट स्केल का मूल्यांकन करने का समर्थन करता है। यह नहीं दिखाता है कि एआई एजेंट वैज्ञानिकों की जगह लेने के लिए तैयार हैं, न ही यह दिखाता है कि उन्होंने स्वतंत्र रूप से नए जैविक ज्ञान का उत्पादन किया है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
आगे क्या देखना है
पेपर एक नया सबमिट किया गया arXiv प्रीप्रिंट है, इसलिए इसके निष्कर्षों को सहकर्मी समीक्षा के माध्यम से स्वतंत्र रूप से स्थापित नहीं किया गया है। अनुवर्ती कार्य को यह परीक्षण करना चाहिए कि क्या बेंचमार्क कार्य व्यापक कम्प्यूटेशनल जीवविज्ञान अभ्यास का प्रतिनिधित्व करते हैं, क्या एजेंट बेहतर उपकरण या पर्यवेक्षण के साथ सुधार कर सकते हैं, और आर्टिफैक्ट-स्तर के स्कोर वैज्ञानिक रूप से सार्थक निष्कर्षों को कितनी बारीकी से ट्रैक करते हैं।
तत्काल सीमा साक्ष्य स्थिति है: BixBench3 को 26 अगस्त, 2026 को प्रस्तुत arXiv प्रीप्रिंट के रूप में पहचाना गया है। स्रोत लेखकों के बेंचमार्क डिज़ाइन और परिणाम प्रदान करता है लेकिन कोई स्वतंत्र प्रतिकृति, सहकर्मी-समीक्षा मूल्यांकन या बाहरी तुलना नहीं करता है। रिपोर्ट किए गए स्कोर और संसाधन खपत की व्याख्या करते समय वे अज्ञात मायने रखते हैं।
भविष्य के मूल्यांकन से यह स्पष्ट होना चाहिए कि कम्प्यूटेशनल जीव विज्ञान के 20 कार्य कितने प्रतिनिधि हैं। सूत्र का कहना है कि कार्य प्रकाशित अध्ययनों से प्राप्त हुए हैं, लेकिन यह निर्दिष्ट नहीं करता है कि अध्ययन या जैविक डोमेन का चयन कैसे किया गया था, प्रत्येक कार्य कितना कठिन था, या क्या बेंचमार्क अनुसंधान समूहों द्वारा उपयोग किए जाने वाले डेटा प्रकारों और वर्कफ़्लो की पूरी श्रृंखला को कवर करता है।
बेंचमार्क को कार्यान्वयन विफलता को वैज्ञानिक विफलता से अलग करने की भी आवश्यकता हो सकती है। एक प्रोग्रामेटिक रूप से गलत पीक कॉल मैट्रिक्स या डिफरेंशियल-एक्सप्रेशन टेबल से पता चलता है कि एक अपेक्षित कम्प्यूटेशनल आर्टिफैक्ट को पुन: प्रस्तुत नहीं किया गया था, लेकिन स्रोत यह नहीं बताता है कि त्रुटियों को कैसे वर्गीकृत किया गया था, क्या वैकल्पिक वैध तरीकों को क्रेडिट प्राप्त हो सकता है, या क्या एक निकट-मिस अभी भी वैज्ञानिक रूप से उपयोगी निष्कर्ष का समर्थन कर सकता है।
डेटासेट आकार और चरण गणना पर रिपोर्ट की गई निर्भरता का परीक्षण उपकरण, संदर्भ, गणना बजट और मानव पर्यवेक्षण में नियंत्रित परिवर्तनों के तहत किया जाना चाहिए। यह अज्ञात बना हुआ है कि क्या एजेंट बेहतर वर्कफ़्लो ऑर्केस्ट्रेशन, डोमेन-विशिष्ट सॉफ़्टवेयर, छोटे कार्य अपघटन या वैज्ञानिकों द्वारा समीक्षा के माध्यम से इन बाधाओं को दूर कर सकते हैं। स्रोत मॉडलों के अलग-अलग अंकों के कारणों की भी पहचान नहीं करता है।
एक उपयोगी अगला कदम बेंचमार्क प्रदर्शन को वास्तविक प्रयोगशाला या अनुसंधान-समूह परिणामों से जोड़ना होगा: समय की बचत, त्रुटि का पता लगाना, प्रतिलिपि प्रस्तुत करने योग्यता और निष्कर्ष की गुणवत्ता। जब तक उन कड़ियों को मापा नहीं जाता, BixBench3 को कम्प्यूटेशनल जीव विज्ञान वर्कफ़्लो के एक परिभाषित सेट पर वर्तमान एजेंट निष्पादन के बारे में साक्ष्य के रूप में सबसे अच्छा पढ़ा जाता है, न कि स्वायत्त वैज्ञानिक अनुसंधान के सामान्य पूर्वानुमान के रूप में।