समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

BixBench3 ने पाया कि AI एजेंट पूर्ण पैमाने पर कम्प्यूटेशनल जीवविज्ञान अध्ययन के साथ संघर्ष करते हैं

एक नया बेंचमार्क मूल्यांकन करता है कि क्या एआई एजेंट कच्चे जैविक डेटा को संपूर्ण कम्प्यूटेशनल जीव विज्ञान वर्कफ़्लो में अनुसंधान आउटपुट में बदल सकते हैं। 20 कार्यों में, 13 फ्रंटियर मॉडल ने 0.00 और 0.48 के बीच स्कोर किया, डेटासेट और विश्लेषण चरणों के अनुक्रम बढ़ने के साथ प्रदर्शन में गिरावट आई।

5 min readRead the primary source
Primary-source image accompanying BixBench3 finds AI agents struggle with full-scale computational biology studies
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.25286
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

बेंचमार्क
मॉडल प्रदर्शन को मापने और तुलना करने के लिए उपयोग किया जाने वाला एक मानकीकृत परीक्षण या डेटासेट।
एआई एजेंट
एक सॉफ़्टवेयर सिस्टम जो किसी लक्ष्य को प्राप्त करने के लिए अक्सर टूल और मेमोरी का उपयोग करके निरीक्षण कर सकता है, तर्क कर सकता है और कार्रवाई कर सकता है।
गणना करें
मॉडलों को प्रशिक्षित करने और चलाने के लिए आवश्यक प्रसंस्करण संसाधनों को अक्सर फ्लॉप्स या जीपीयू घंटों में मापा जाता है।
स्वयं की जांच करोएआई एजेंट प्रश्नोत्तरी

क्या हुआ?

शोधकर्ताओं ने BixBench3 पेश किया, जो प्रत्यायोजित अनुसंधान कार्य पर आधारित कम्प्यूटेशनल जीवविज्ञान कार्यों पर एआई एजेंटों का परीक्षण करने के लिए डिज़ाइन किया गया एक बेंचमार्क है। एक वैज्ञानिक अनुसंधान प्रश्न और उच्च-स्तरीय तरीकों की आपूर्ति करता है, जबकि एजेंट को विश्लेषण लागू करना होगा और अंतर्निहित प्रकाशित अध्ययनों में रिपोर्ट किए गए आउटपुट के साथ तुलनीय आउटपुट उत्पन्न करना होगा।

BixBench3 कच्चे जैविक डेटा से लेकर मध्यवर्ती कम्प्यूटेशनल कलाकृतियों के माध्यम से वैज्ञानिक परिणामों तक AI एजेंटों का मूल्यांकन करता है। बेंचमार्क में प्रकाशित वैज्ञानिक अध्ययनों से लिए गए 20 कार्य शामिल हैं और इसमें 138 अद्वितीय कलाकृतियाँ शामिल हैं, जिनमें पीक कॉल मैट्रिसेस और अंतर-अभिव्यक्ति तालिकाएँ शामिल हैं। उन कलाकृतियों को मूल अध्ययनों में उत्पन्न और रिपोर्ट की गई संबंधित कलाकृतियों के विरुद्ध प्रोग्रामेटिक रूप से वर्गीकृत किया गया है।

बेंचमार्क श्रम के एक विशिष्ट विभाजन के आसपास डिज़ाइन किया गया है। एक वैज्ञानिक शोध प्रश्न चुनता है और पद्धतिगत मार्गदर्शन प्रदान करता है; एआई एजेंट विश्लेषणों को लागू करने के लिए जिम्मेदार है। यह इस बात से अधिक परीक्षण करता है कि क्या कोई मॉडल जीव विज्ञान के प्रश्न का उत्तर दे सकता है या कोड का एक अलग टुकड़ा उत्पन्न कर सकता है। यह परीक्षण करता है कि क्या सिस्टम कई परिचालनों में सुसंगत वर्कफ़्लो बनाए रख सकता है और अपेक्षित रूप में आउटपुट उत्पन्न कर सकता है।

लेखक 13 सीमांत मॉडलों में Gemini 3.1 फ्लैश लाइट के लिए 0.00 से लेकर GPT 5.6 Sol के लिए 0.48 तक स्कोर की रिपोर्ट करते हैं। बड़े कच्चे डेटासेट वाले कार्यों पर प्रदर्शन गिर गया, 100 जीबी डेटा वाले कार्यों पर 0.36 का स्कोर बताया गया। अनुक्रमिक विश्लेषण चरणों की संख्या बढ़ने से इसमें भी गिरावट आई: एक या दो चरणों की आवश्यकता वाले कार्यों के लिए स्कोर 0.36 था और तीन या अधिक चरणों की आवश्यकता वाले कार्यों के लिए 0.24 था।

संसाधन आवश्यकताएँ पर्याप्त थीं। एजेंटों ने प्रति कार्य औसतन 6.8 घंटे, 102 मिलियन टोकन और $43 का उपयोग किया। सबसे लंबे प्रयासों में 24 घंटे लगे, 1.07 बिलियन टोकन का उपयोग किया गया और लागत $525 थी। लेखक यह भी रिपोर्ट करते हैं कि उच्चतम स्कोरिंग एजेंटों ने कम टोकन का उपयोग किया और कम प्रदर्शन वाले विकल्पों की तुलना में सस्ते थे, यह दर्शाता है कि अधिक व्यय स्वचालित रूप से बेहतर परिणाम नहीं देता है।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

नतीजे बताते हैं कि अलग-अलग परीक्षणों पर मजबूत प्रदर्शन जरूरी नहीं कि संपूर्ण वैज्ञानिक वर्कफ़्लो के विश्वसनीय निष्पादन में तब्दील हो। बेंचमार्क व्यावहारिक बाधाओं को मापता है - आश्रित चरणों के लंबे अनुक्रम, बड़े कच्चे डेटासेट और जैविक डोमेन में अंतर - जो यह निर्धारित कर सकते हैं कि एजेंट वास्तविक अनुसंधान सेटिंग्स में उपयोगी हैं या नहीं।

कम्प्यूटेशनल जीव विज्ञान अक्सर एक भविष्यवाणी के बजाय परिवर्तनों की श्रृंखला पर निर्भर करता है। एक एजेंट को पद्धति संबंधी निर्देशों की व्याख्या करने, कच्चे डेटा में हेरफेर करने, कई विश्लेषण चलाने और मध्यवर्ती परिणामों के बीच स्थिरता बनाए रखने की आवश्यकता हो सकती है। लंबे समय तक वर्कफ़्लो पर BixBench3 की रिपोर्ट की गई गिरावट इस बात के लिए प्रासंगिक है कि वास्तविक अनुसंधान में AI सिस्टम का उपयोग कैसे किया जा सकता है, जहां एक प्रारंभिक गलती हर बाद की कलाकृति को प्रभावित कर सकती है।

बेंचमार्क भी परिष्कृत प्रदर्शनों से सत्यापन योग्य आउटपुट पर ध्यान केंद्रित करता है। केवल लिखित स्पष्टीकरण की ग्रेडिंग करने के बजाय, लेखक एजेंटों द्वारा उत्पादित कलाकृतियों की तुलना मूल अध्ययनों की कलाकृतियों से करते हैं। वह दृष्टिकोण उन विफलताओं को प्रकट कर सकता है जिन्हें एक धाराप्रवाह सारांश छुपा सकता है, हालांकि एक अपेक्षित कलाकृति का मिलान एक नई वैज्ञानिक खोज को मान्य करने के समान नहीं है।

परीक्षण किए गए मॉडलों में रिपोर्ट की गई विस्तृत स्कोर रेंज इंगित करती है कि मॉडल की पसंद भौतिक रूप से प्रभावित कर सकती है कि कोई एजेंट कम्प्यूटेशनल जीवविज्ञान असाइनमेंट पूरा कर सकता है या नहीं। स्रोत यह स्थापित नहीं करता है कि मॉडल अलग-अलग क्यों हैं, क्या परिणाम परीक्षण किए गए सिस्टम से परे सामान्यीकृत होते हैं या क्या कम स्कोर एक विशिष्ट तकनीकी कमजोरी को दर्शाता है। यह स्थापित करता है कि मूल्यांकन किए गए एजेंटों ने कार्य के समान व्यापक वर्ग पर समान रूप से प्रदर्शन नहीं किया।

लागत और समय के आंकड़े विश्वसनीयता को परिचालन के साथ-साथ तकनीकी मुद्दा भी बनाते हैं। एक औसत कार्य जिसमें घंटों और लाखों टोकन की आवश्यकता होती है, कुछ शोध टीमों के लिए प्रबंधनीय हो सकता है लेकिन नियमित, उच्च-मात्रा विश्लेषण के लिए अव्यावहारिक है। रिपोर्ट किए गए सबसे लंबे समय तक चलने से पता चलता है कि कठिन कार्य कहीं अधिक संसाधनों का उपभोग कर सकते हैं। यह निष्कर्ष कि सर्वोत्तम स्कोरिंग एजेंट सस्ते भी थे, यह सुझाव देता है कि दक्षता और क्षमता कभी-कभी एक-दूसरे को सुदृढ़ कर सकती हैं, लेकिन स्रोत कारण की पहचान करने के लिए पर्याप्त विवरण प्रदान नहीं करता है।

शोधकर्ताओं के लिए, व्यावहारिक निहितार्थ चौकियों के बिना पूर्ण विश्लेषण सौंपने के बारे में सावधानी है। बेंचमार्क किसी एजेंट को भरोसेमंद अनुसंधान सहायक के रूप में मानने से पहले मध्यवर्ती आउटपुट, अनुक्रम हैंडलिंग और डेटासेट स्केल का मूल्यांकन करने का समर्थन करता है। यह नहीं दिखाता है कि एआई एजेंट वैज्ञानिकों की जगह लेने के लिए तैयार हैं, न ही यह दिखाता है कि उन्होंने स्वतंत्र रूप से नए जैविक ज्ञान का उत्पादन किया है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

आगे क्या देखना है

पेपर एक नया सबमिट किया गया arXiv प्रीप्रिंट है, इसलिए इसके निष्कर्षों को सहकर्मी समीक्षा के माध्यम से स्वतंत्र रूप से स्थापित नहीं किया गया है। अनुवर्ती कार्य को यह परीक्षण करना चाहिए कि क्या बेंचमार्क कार्य व्यापक कम्प्यूटेशनल जीवविज्ञान अभ्यास का प्रतिनिधित्व करते हैं, क्या एजेंट बेहतर उपकरण या पर्यवेक्षण के साथ सुधार कर सकते हैं, और आर्टिफैक्ट-स्तर के स्कोर वैज्ञानिक रूप से सार्थक निष्कर्षों को कितनी बारीकी से ट्रैक करते हैं।

तत्काल सीमा साक्ष्य स्थिति है: BixBench3 को 26 अगस्त, 2026 को प्रस्तुत arXiv प्रीप्रिंट के रूप में पहचाना गया है। स्रोत लेखकों के बेंचमार्क डिज़ाइन और परिणाम प्रदान करता है लेकिन कोई स्वतंत्र प्रतिकृति, सहकर्मी-समीक्षा मूल्यांकन या बाहरी तुलना नहीं करता है। रिपोर्ट किए गए स्कोर और संसाधन खपत की व्याख्या करते समय वे अज्ञात मायने रखते हैं।

भविष्य के मूल्यांकन से यह स्पष्ट होना चाहिए कि कम्प्यूटेशनल जीव विज्ञान के 20 कार्य कितने प्रतिनिधि हैं। सूत्र का कहना है कि कार्य प्रकाशित अध्ययनों से प्राप्त हुए हैं, लेकिन यह निर्दिष्ट नहीं करता है कि अध्ययन या जैविक डोमेन का चयन कैसे किया गया था, प्रत्येक कार्य कितना कठिन था, या क्या बेंचमार्क अनुसंधान समूहों द्वारा उपयोग किए जाने वाले डेटा प्रकारों और वर्कफ़्लो की पूरी श्रृंखला को कवर करता है।

बेंचमार्क को कार्यान्वयन विफलता को वैज्ञानिक विफलता से अलग करने की भी आवश्यकता हो सकती है। एक प्रोग्रामेटिक रूप से गलत पीक कॉल मैट्रिक्स या डिफरेंशियल-एक्सप्रेशन टेबल से पता चलता है कि एक अपेक्षित कम्प्यूटेशनल आर्टिफैक्ट को पुन: प्रस्तुत नहीं किया गया था, लेकिन स्रोत यह नहीं बताता है कि त्रुटियों को कैसे वर्गीकृत किया गया था, क्या वैकल्पिक वैध तरीकों को क्रेडिट प्राप्त हो सकता है, या क्या एक निकट-मिस अभी भी वैज्ञानिक रूप से उपयोगी निष्कर्ष का समर्थन कर सकता है।

डेटासेट आकार और चरण गणना पर रिपोर्ट की गई निर्भरता का परीक्षण उपकरण, संदर्भ, गणना बजट और मानव पर्यवेक्षण में नियंत्रित परिवर्तनों के तहत किया जाना चाहिए। यह अज्ञात बना हुआ है कि क्या एजेंट बेहतर वर्कफ़्लो ऑर्केस्ट्रेशन, डोमेन-विशिष्ट सॉफ़्टवेयर, छोटे कार्य अपघटन या वैज्ञानिकों द्वारा समीक्षा के माध्यम से इन बाधाओं को दूर कर सकते हैं। स्रोत मॉडलों के अलग-अलग अंकों के कारणों की भी पहचान नहीं करता है।

एक उपयोगी अगला कदम बेंचमार्क प्रदर्शन को वास्तविक प्रयोगशाला या अनुसंधान-समूह परिणामों से जोड़ना होगा: समय की बचत, त्रुटि का पता लगाना, प्रतिलिपि प्रस्तुत करने योग्यता और निष्कर्ष की गुणवत्ता। जब तक उन कड़ियों को मापा नहीं जाता, BixBench3 को कम्प्यूटेशनल जीव विज्ञान वर्कफ़्लो के एक परिभाषित सेट पर वर्तमान एजेंट निष्पादन के बारे में साक्ष्य के रूप में सबसे अच्छा पढ़ा जाता है, न कि स्वायत्त वैज्ञानिक अनुसंधान के सामान्य पूर्वानुमान के रूप में।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई एजेंटएआई मॉडल की व्याख्याएआई प्रशिक्षणआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?