क्या हुआ?
OpenAI ने एक आंतरिक स्नैपशॉट प्रकाशित किया कि उसके अनुसंधान संगठन द्वारा कोडिंग एजेंटों का उपयोग कैसे किया जा रहा है। कंपनी का कहना है कि उसने "स्वचालित अनुसंधान प्रशिक्षु" के अपने घोषित लक्ष्य को पूरा कर लिया है: एक ऐसी प्रणाली जो मानव निर्देशन के तहत अच्छी तरह से परिभाषित अनुसंधान कार्यों को करने में सक्षम है, जिसमें ऐसे कार्य भी शामिल हैं जिनमें एक कुशल शोधकर्ता को कई दिन लग सकते हैं। OpenAI का कहना है कि वह मार्च 2028 तक एक स्वचालित AI शोधकर्ता को लक्षित कर रहा है। कंपनी के माप के अनुसार, एजेंट का उपयोग 2026 के दौरान तेजी से बढ़ गया। अगस्त के मध्य तक, औसत शोधकर्ता एपीआई कीमतों पर गणना के अनुसार प्रति दिन $ 600 से अधिक पर कोडिंग एजेंटों का उपयोग कर रहा था, जबकि 90-प्रतिशत उपयोगकर्ता प्रति दिन $ 7,000 से अधिक था। अनुसंधान संगठन में, OpenAI का कहना है कि एजेंट रनटाइम प्रत्येक मानव कार्यदिवस के लिए 3.1 मानक आठ घंटे के एजेंट-कार्यदिवस तक पहुंच गया है। OpenAI प्रति सक्रिय प्रयोगकर्ता पर अधिक प्रयोगों, उच्च-स्तरीय और लंबे-क्षितिज कार्यों के लिए एजेंटों के बढ़ते उपयोग और आम तौर पर ज्ञात परिणाम वाले कार्यों पर जनवरी से जुलाई तक सफलता दर में सुधार की रिपोर्ट करता है। हालाँकि, आधे से अधिक सफल कार्यों में चार से आठ घंटे के मानव कार्य की आवश्यकता होती है, जिसमें पिछले छह महीनों के दौरान कम से कम एक मानवीय हस्तक्षेप शामिल होता है। रिपोर्ट इन्हें OpenAI के स्वयं के प्रारंभिक माप और आंतरिक छापों के रूप में वर्णित करती है। यह स्थापित नहीं करता है कि एजेंटों ने अनुसंधान आउटपुट में सभी देखी गई वृद्धि का कारण बना है: कंपनी का कहना है कि उपलब्ध गणना में भी उल्लेखनीय वृद्धि हुई है, और गणना, कार्य चयन, मूल्यांकन, सुरक्षा जांच और मुख्य प्रशिक्षण रनों में एकीकरण जैसी बाधाएं समग्र प्रगति को सीमित कर सकती हैं।
OpenAI का कहना है कि इसके शोधकर्ता अब पूरे दिन, अक्सर समवर्ती सत्रों में कोडिंग एजेंटों का उपयोग करते हैं, और यह उपयोग अन्य OpenAI टीमों की तुलना में तेजी से बढ़ रहा है। कंपनी की रिपोर्ट है कि औसत शोधकर्ता 2026 की शुरुआत में मामूली उपयोग से अगस्त के मध्य तक दैनिक उपयोग में आ गया। यह औसत शोधकर्ता के लिए एपीआई कीमतों के अनुमान के अनुसार $600 प्रति दिन से अधिक और 90वें-प्रतिशत उपयोगकर्ता के लिए प्रति दिन $7,000 से अधिक का आंतरिक खर्च अनुमान देता है। ये किसी स्वचालित शोधकर्ता के लिए जनता को दी जाने वाली कीमतें नहीं हैं।
कंपनी मानक आठ-घंटे के कार्यदिवस का उपयोग करके मानव श्रम के विरुद्ध कुल एजेंट रनटाइम को मापती है। इसमें कहा गया है कि जून 2026 से पहले, कुल एजेंट रनटाइम कुल मानव श्रम से कम था, लेकिन अगस्त के मध्य तक अनुसंधान संगठन ने प्रत्येक मानव कार्यदिवस के लिए 3.1 एजेंट-कार्यदिवस का उपयोग किया। माप में शोधकर्ताओं और डाउनस्ट्रीम उप-एजेंटों द्वारा सीधे लॉन्च किए गए एजेंट शामिल हैं।
OpenAI का कहना है कि एजेंट गतिविधि का विस्तार उसके AI अनुसंधान और विकास वर्गीकरण के छह चरणों में हुआ: निर्णय लेना, डिजाइन करना, निर्माण करना, चलाना, विश्लेषण करना और संचार करना। अनुसंधान और बुनियादी ढांचा कोड प्रमुख श्रेणी बने रहे, जबकि तकनीकी सहायता और निगरानी रन में उल्लेखनीय वृद्धि हुई। उच्च-स्तरीय योजना एजेंट आउटपुट टोकन का एक छोटा सा अंश बनी रही। OpenAI का कहना है कि एजेंट आंतरिक अनुसंधान बुनियादी ढांचे की समस्या के निवारण के लिए विशेष रूप से उपयोगी रहे हैं, जो कुछ मानव-संचालित तकनीकी-सहायता सत्रों में कम उपस्थिति के साथ मेल खाता है।
रिपोर्ट में कहा गया है कि कोडिंग-एजेंट कार्य की सफलता आमतौर पर कई अनुमानित मानव-समय अवधियों में जनवरी से जुलाई तक बढ़ी है, लेकिन एजेंटों को अभी भी पर्याप्त मार्गदर्शन की आवश्यकता है क्योंकि कार्य अधिक जटिल हो गए हैं। चार से आठ घंटे के सफल कार्यों में से आधे से अधिक में पिछले छह महीनों में एक या अधिक हस्तक्षेप शामिल थे। OpenAI का यह भी कहना है कि उसने हाल ही में बुनियादी ढांचे की घटना के बाद कुछ नवीनतम तैनाती मॉडल पर सुदृढीकरण-सीखने के प्रशिक्षण को रोक दिया, मजबूत प्रतिबंधों के तहत कुछ कार्यभार को बहाल किया, और महत्वपूर्ण साइबर क्षमताओं के प्रारंभिक साक्ष्य के बाद एस्ट्रा-श्रेणी के प्रयोगों पर अतिरिक्त प्रतिबंध लगाए। यह रिपोर्ट करता है कि एस्ट्रा-क्लास जीपीयू आवंटन अगले सप्ताह में 59.2% गिर गया, जबकि अन्य मॉडल वर्गों में 17.2% की वृद्धि हुई, जिससे लगभग 85% गिरावट की भरपाई हुई।
यह क्यों मायने रखता है?
रिपोर्ट एक असामान्य रूप से ठोस दृष्टिकोण प्रस्तुत करती है कि कैसे एक अग्रणी एआई प्रयोगशाला अधिक सक्षम एआई विकसित करने के काम में एआई सिस्टम को शामिल कर रही है। यदि प्रवृत्ति सामान्य हो जाती है, तो कोडिंग एजेंट शोधकर्ताओं के समय को नियमित कार्यान्वयन और बुनियादी ढांचे की समस्या निवारण से दूर उन कार्यों की ओर स्थानांतरित कर सकते हैं जिन्हें स्वचालित करना कठिन रहता है, संभावित रूप से मॉडल-विकास चक्र के कुछ हिस्सों को छोटा कर देता है। लेकिन साक्ष्य कंपनी द्वारा तैयार किया गया है, प्रारंभिक है और वैज्ञानिक गुणवत्ता या मॉडल क्षमता में स्वतंत्र रूप से सत्यापित लाभ के बजाय चयनित परिचालन मेट्रिक्स पर केंद्रित है।
रिपोर्ट मायने रखती है क्योंकि एआई सिस्टम का उपयोग उस प्रक्रिया पर किया जा रहा है जो केवल नियमित कार्यालय के काम में सहायता करने के बजाय भविष्य के एआई सिस्टम का निर्माण करती है। OpenAI के आंकड़े बताते हैं कि एजेंट क्षमता आंतरिक अनुसंधान कार्यों का एक सार्थक हिस्सा बन रही है, समवर्ती निष्पादन और उच्च कार्य जटिलता के साथ शोधकर्ता अपना समय आवंटित करने के तरीके को बदल रहे हैं।
व्यावहारिक निहितार्थ मिश्रित है. एजेंट कोडिंग, इंफ्रास्ट्रक्चर डिबगिंग और प्रयोग सेटअप के कारण होने वाली देरी को कम कर सकते हैं, जिससे शोधकर्ताओं को अधिक परीक्षण चलाने की अनुमति मिलती है। साथ ही, तेजी से निष्पादन मूल्यांकन, निगरानी और सुरक्षा समीक्षा को और अधिक महत्वपूर्ण बना सकता है क्योंकि त्रुटियां अधिक तेजी से उत्पन्न और प्रसारित हो सकती हैं। OpenAI स्वयं कहता है कि विशिष्ट मेट्रिक्स में प्रगति आवश्यक रूप से समग्र अनुसंधान प्रगति की समान गति के बराबर नहीं होगी।
रिपोर्ट मानव नियंत्रण को भी एक केंद्रीय शर्त बनाती है। OpenAI का कहना है कि लोग अभी भी प्राथमिकताएं तय करते हैं, निर्णय लेते हैं कि किन विचारों और परिणामों को आगे बढ़ाया जाए, और निर्णय लेते हैं कि सिस्टम को स्केल करना है, रोकना है या तैनात करना है। यह स्वीकार करता है कि संरेखण और सुरक्षा प्रगति क्षमता प्रगति के साथ तालमेल नहीं रख सकती है और अधिक सक्षम प्रणालियों की निगरानी करना कठिन हो सकता है।
स्रोत में कोई स्वतंत्र अध्ययन, सार्वजनिक बेंचमार्क या बाहरी ऑडिट प्रदान नहीं किया गया है। इसलिए रिपोर्ट किए गए खर्च, रनटाइम, कार्य-सफलता और हस्तक्षेप के आंकड़ों को अपने स्वयं के संगठन के बारे में OpenAI के दावों के रूप में माना जाना चाहिए, न कि स्थापित साक्ष्य के रूप में कि एआई अनुसंधान को एक विशिष्ट मापी गई राशि से तेज किया गया है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
आगे क्या देखना है
मुख्य प्रश्न यह है कि क्या उच्च एजेंट का उपयोग अनुसंधान गुणवत्ता, सुरक्षा और मॉडल विकास गति में टिकाऊ, स्वतंत्र रूप से मापने योग्य सुधार में तब्दील होता है। कार्य की सफलता, बाहरी सत्यापन, त्रुटियों के बारे में साक्ष्य और छिपे हुए मानव श्रम की स्पष्ट परिभाषाओं के लिए देखें, और क्या शेष बाधाएं गणना, मूल्यांकन, संरेखण या निर्णय लेने की ओर बढ़ती हैं। OpenAI ने इन आंतरिक वर्कफ़्लोज़ या किसी संबंधित मूल्य तक सार्वजनिक पहुंच का दस्तावेजीकरण नहीं किया है, और रिपोर्ट यह नहीं दिखाती है कि एक सामान्य-उद्देश्य स्वचालित शोधकर्ता उपलब्ध है।
OpenAI का कहना है कि इसकी माप विधियां अभी भी विकसित हो रही हैं। भविष्य के खुलासे से यह स्पष्ट होना चाहिए कि कार्यों का नमूना कैसे लिया जाता है, सफलता का सत्यापन कैसे किया जाता है, अनिश्चित परिणामों को कैसे संभाला जाता है, और एजेंट-जनित कोड या प्रयोगों को उस कार्य से कैसे अलग किया जाता है जो अन्यथा मनुष्यों द्वारा किया जाता।
सबसे महत्वपूर्ण गुम साक्ष्य यह है कि क्या एजेंट-सहायता प्राप्त कार्य बेहतर अनुसंधान परिणाम उत्पन्न करता है, न कि केवल अधिक कोड, प्रयोग या टोकन। उपयोगी अनुवर्ती साक्ष्य में प्रतिलिपि प्रस्तुत करने योग्य उदाहरण, त्रुटि दर, पुनः कार्य, असफल प्रयोग, सुरक्षा निष्कर्ष और प्रत्येक चरण में आवश्यक मानव समीक्षा की मात्रा शामिल होगी।
रिपोर्ट में यह नहीं बताया गया है कि स्वचालित अनुसंधान इंटर्न एक सार्वजनिक रूप से सुलभ उत्पाद है। यह उपभोक्ता या उद्यम मूल्य, तैनाती आवश्यकताओं, पात्रता मानदंड या रिलीज की तारीख भी प्रदान नहीं करता है। इसलिए पहुंच और मूल्य निर्धारण अज्ञात है।
OpenAI का कहना है कि यह सुरक्षा और मालिकाना जानकारी की सुरक्षा करते हुए स्वचालित AI अनुसंधान की दिशा में प्रगति की रिपोर्ट करना जारी रखेगा। इसके भविष्य के खुलासे से पता चलेगा कि रिपोर्ट की गई त्वरण का कितना स्वतंत्र रूप से मूल्यांकन किया जा सकता है और अनुसंधान प्रतिबंध उपलब्ध गणना के वितरण को कैसे प्रभावित करते हैं।