समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

OpenAI का कहना है कि कोडिंग एजेंट अब इसकी प्रयोगशालाओं में मानव अनुसंधान श्रम से आगे निकल गए हैं

OpenAI की रिपोर्ट है कि इसके शोधकर्ताओं ने अगस्त के मध्य तक प्रत्येक मानव कार्यदिवस के लिए 3.1 एजेंट-कार्यदिवस का उपयोग किया, जबकि चेतावनी दी कि आंतरिक मेट्रिक्स प्रारंभिक हैं और सीधे समग्र शोध प्रगति को मापते नहीं हैं।

5 min readRead the primary source
Source-provided image accompanying OpenAI says coding agents now exceed human research labor in its labs
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
openai.com
स्रोत लिंक
openai.comhttps://openai.com/index/research-acceleration-view-inside-openai
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

एपीआई (एप्लिकेशन प्रोग्रामिंग इंटरफ़ेस)
एक सॉफ्टवेयर सिस्टम के लिए दूसरे सिस्टम को अनुरोध भेजने और उससे प्रतिक्रिया प्राप्त करने का एक संरचित तरीका।
बेंचमार्क
मॉडल प्रदर्शन को मापने और तुलना करने के लिए उपयोग किया जाने वाला एक मानकीकृत परीक्षण या डेटासेट।
अनुमान
रनटाइम चरण जहां एक प्रशिक्षित मॉडल भविष्यवाणियां या आउटपुट उत्पन्न करता है।
स्वयं की जांच करोएआई एजेंट प्रश्नोत्तरी

क्या हुआ?

OpenAI ने एक आंतरिक स्नैपशॉट प्रकाशित किया कि उसके अनुसंधान संगठन द्वारा कोडिंग एजेंटों का उपयोग कैसे किया जा रहा है। कंपनी का कहना है कि उसने "स्वचालित अनुसंधान प्रशिक्षु" के अपने घोषित लक्ष्य को पूरा कर लिया है: एक ऐसी प्रणाली जो मानव निर्देशन के तहत अच्छी तरह से परिभाषित अनुसंधान कार्यों को करने में सक्षम है, जिसमें ऐसे कार्य भी शामिल हैं जिनमें एक कुशल शोधकर्ता को कई दिन लग सकते हैं। OpenAI का कहना है कि वह मार्च 2028 तक एक स्वचालित AI शोधकर्ता को लक्षित कर रहा है। कंपनी के माप के अनुसार, एजेंट का उपयोग 2026 के दौरान तेजी से बढ़ गया। अगस्त के मध्य तक, औसत शोधकर्ता एपीआई कीमतों पर गणना के अनुसार प्रति दिन $ 600 से अधिक पर कोडिंग एजेंटों का उपयोग कर रहा था, जबकि 90-प्रतिशत उपयोगकर्ता प्रति दिन $ 7,000 से अधिक था। अनुसंधान संगठन में, OpenAI का कहना है कि एजेंट रनटाइम प्रत्येक मानव कार्यदिवस के लिए 3.1 मानक आठ घंटे के एजेंट-कार्यदिवस तक पहुंच गया है। OpenAI प्रति सक्रिय प्रयोगकर्ता पर अधिक प्रयोगों, उच्च-स्तरीय और लंबे-क्षितिज कार्यों के लिए एजेंटों के बढ़ते उपयोग और आम तौर पर ज्ञात परिणाम वाले कार्यों पर जनवरी से जुलाई तक सफलता दर में सुधार की रिपोर्ट करता है। हालाँकि, आधे से अधिक सफल कार्यों में चार से आठ घंटे के मानव कार्य की आवश्यकता होती है, जिसमें पिछले छह महीनों के दौरान कम से कम एक मानवीय हस्तक्षेप शामिल होता है। रिपोर्ट इन्हें OpenAI के स्वयं के प्रारंभिक माप और आंतरिक छापों के रूप में वर्णित करती है। यह स्थापित नहीं करता है कि एजेंटों ने अनुसंधान आउटपुट में सभी देखी गई वृद्धि का कारण बना है: कंपनी का कहना है कि उपलब्ध गणना में भी उल्लेखनीय वृद्धि हुई है, और गणना, कार्य चयन, मूल्यांकन, सुरक्षा जांच और मुख्य प्रशिक्षण रनों में एकीकरण जैसी बाधाएं समग्र प्रगति को सीमित कर सकती हैं।

OpenAI का कहना है कि इसके शोधकर्ता अब पूरे दिन, अक्सर समवर्ती सत्रों में कोडिंग एजेंटों का उपयोग करते हैं, और यह उपयोग अन्य OpenAI टीमों की तुलना में तेजी से बढ़ रहा है। कंपनी की रिपोर्ट है कि औसत शोधकर्ता 2026 की शुरुआत में मामूली उपयोग से अगस्त के मध्य तक दैनिक उपयोग में आ गया। यह औसत शोधकर्ता के लिए एपीआई कीमतों के अनुमान के अनुसार $600 प्रति दिन से अधिक और 90वें-प्रतिशत उपयोगकर्ता के लिए प्रति दिन $7,000 से अधिक का आंतरिक खर्च अनुमान देता है। ये किसी स्वचालित शोधकर्ता के लिए जनता को दी जाने वाली कीमतें नहीं हैं।

कंपनी मानक आठ-घंटे के कार्यदिवस का उपयोग करके मानव श्रम के विरुद्ध कुल एजेंट रनटाइम को मापती है। इसमें कहा गया है कि जून 2026 से पहले, कुल एजेंट रनटाइम कुल मानव श्रम से कम था, लेकिन अगस्त के मध्य तक अनुसंधान संगठन ने प्रत्येक मानव कार्यदिवस के लिए 3.1 एजेंट-कार्यदिवस का उपयोग किया। माप में शोधकर्ताओं और डाउनस्ट्रीम उप-एजेंटों द्वारा सीधे लॉन्च किए गए एजेंट शामिल हैं।

OpenAI का कहना है कि एजेंट गतिविधि का विस्तार उसके AI अनुसंधान और विकास वर्गीकरण के छह चरणों में हुआ: निर्णय लेना, डिजाइन करना, निर्माण करना, चलाना, विश्लेषण करना और संचार करना। अनुसंधान और बुनियादी ढांचा कोड प्रमुख श्रेणी बने रहे, जबकि तकनीकी सहायता और निगरानी रन में उल्लेखनीय वृद्धि हुई। उच्च-स्तरीय योजना एजेंट आउटपुट टोकन का एक छोटा सा अंश बनी रही। OpenAI का कहना है कि एजेंट आंतरिक अनुसंधान बुनियादी ढांचे की समस्या के निवारण के लिए विशेष रूप से उपयोगी रहे हैं, जो कुछ मानव-संचालित तकनीकी-सहायता सत्रों में कम उपस्थिति के साथ मेल खाता है।

रिपोर्ट में कहा गया है कि कोडिंग-एजेंट कार्य की सफलता आमतौर पर कई अनुमानित मानव-समय अवधियों में जनवरी से जुलाई तक बढ़ी है, लेकिन एजेंटों को अभी भी पर्याप्त मार्गदर्शन की आवश्यकता है क्योंकि कार्य अधिक जटिल हो गए हैं। चार से आठ घंटे के सफल कार्यों में से आधे से अधिक में पिछले छह महीनों में एक या अधिक हस्तक्षेप शामिल थे। OpenAI का यह भी कहना है कि उसने हाल ही में बुनियादी ढांचे की घटना के बाद कुछ नवीनतम तैनाती मॉडल पर सुदृढीकरण-सीखने के प्रशिक्षण को रोक दिया, मजबूत प्रतिबंधों के तहत कुछ कार्यभार को बहाल किया, और महत्वपूर्ण साइबर क्षमताओं के प्रारंभिक साक्ष्य के बाद एस्ट्रा-श्रेणी के प्रयोगों पर अतिरिक्त प्रतिबंध लगाए। यह रिपोर्ट करता है कि एस्ट्रा-क्लास जीपीयू आवंटन अगले सप्ताह में 59.2% गिर गया, जबकि अन्य मॉडल वर्गों में 17.2% की वृद्धि हुई, जिससे लगभग 85% गिरावट की भरपाई हुई।

स्रोत विवरण: openai.com ↗

यह क्यों मायने रखता है?

रिपोर्ट एक असामान्य रूप से ठोस दृष्टिकोण प्रस्तुत करती है कि कैसे एक अग्रणी एआई प्रयोगशाला अधिक सक्षम एआई विकसित करने के काम में एआई सिस्टम को शामिल कर रही है। यदि प्रवृत्ति सामान्य हो जाती है, तो कोडिंग एजेंट शोधकर्ताओं के समय को नियमित कार्यान्वयन और बुनियादी ढांचे की समस्या निवारण से दूर उन कार्यों की ओर स्थानांतरित कर सकते हैं जिन्हें स्वचालित करना कठिन रहता है, संभावित रूप से मॉडल-विकास चक्र के कुछ हिस्सों को छोटा कर देता है। लेकिन साक्ष्य कंपनी द्वारा तैयार किया गया है, प्रारंभिक है और वैज्ञानिक गुणवत्ता या मॉडल क्षमता में स्वतंत्र रूप से सत्यापित लाभ के बजाय चयनित परिचालन मेट्रिक्स पर केंद्रित है।

रिपोर्ट मायने रखती है क्योंकि एआई सिस्टम का उपयोग उस प्रक्रिया पर किया जा रहा है जो केवल नियमित कार्यालय के काम में सहायता करने के बजाय भविष्य के एआई सिस्टम का निर्माण करती है। OpenAI के आंकड़े बताते हैं कि एजेंट क्षमता आंतरिक अनुसंधान कार्यों का एक सार्थक हिस्सा बन रही है, समवर्ती निष्पादन और उच्च कार्य जटिलता के साथ शोधकर्ता अपना समय आवंटित करने के तरीके को बदल रहे हैं।

व्यावहारिक निहितार्थ मिश्रित है. एजेंट कोडिंग, इंफ्रास्ट्रक्चर डिबगिंग और प्रयोग सेटअप के कारण होने वाली देरी को कम कर सकते हैं, जिससे शोधकर्ताओं को अधिक परीक्षण चलाने की अनुमति मिलती है। साथ ही, तेजी से निष्पादन मूल्यांकन, निगरानी और सुरक्षा समीक्षा को और अधिक महत्वपूर्ण बना सकता है क्योंकि त्रुटियां अधिक तेजी से उत्पन्न और प्रसारित हो सकती हैं। OpenAI स्वयं कहता है कि विशिष्ट मेट्रिक्स में प्रगति आवश्यक रूप से समग्र अनुसंधान प्रगति की समान गति के बराबर नहीं होगी।

रिपोर्ट मानव नियंत्रण को भी एक केंद्रीय शर्त बनाती है। OpenAI का कहना है कि लोग अभी भी प्राथमिकताएं तय करते हैं, निर्णय लेते हैं कि किन विचारों और परिणामों को आगे बढ़ाया जाए, और निर्णय लेते हैं कि सिस्टम को स्केल करना है, रोकना है या तैनात करना है। यह स्वीकार करता है कि संरेखण और सुरक्षा प्रगति क्षमता प्रगति के साथ तालमेल नहीं रख सकती है और अधिक सक्षम प्रणालियों की निगरानी करना कठिन हो सकता है।

स्रोत में कोई स्वतंत्र अध्ययन, सार्वजनिक बेंचमार्क या बाहरी ऑडिट प्रदान नहीं किया गया है। इसलिए रिपोर्ट किए गए खर्च, रनटाइम, कार्य-सफलता और हस्तक्षेप के आंकड़ों को अपने स्वयं के संगठन के बारे में OpenAI के दावों के रूप में माना जाना चाहिए, न कि स्थापित साक्ष्य के रूप में कि एआई अनुसंधान को एक विशिष्ट मापी गई राशि से तेज किया गया है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

आगे क्या देखना है

मुख्य प्रश्न यह है कि क्या उच्च एजेंट का उपयोग अनुसंधान गुणवत्ता, सुरक्षा और मॉडल विकास गति में टिकाऊ, स्वतंत्र रूप से मापने योग्य सुधार में तब्दील होता है। कार्य की सफलता, बाहरी सत्यापन, त्रुटियों के बारे में साक्ष्य और छिपे हुए मानव श्रम की स्पष्ट परिभाषाओं के लिए देखें, और क्या शेष बाधाएं गणना, मूल्यांकन, संरेखण या निर्णय लेने की ओर बढ़ती हैं। OpenAI ने इन आंतरिक वर्कफ़्लोज़ या किसी संबंधित मूल्य तक सार्वजनिक पहुंच का दस्तावेजीकरण नहीं किया है, और रिपोर्ट यह नहीं दिखाती है कि एक सामान्य-उद्देश्य स्वचालित शोधकर्ता उपलब्ध है।

OpenAI का कहना है कि इसकी माप विधियां अभी भी विकसित हो रही हैं। भविष्य के खुलासे से यह स्पष्ट होना चाहिए कि कार्यों का नमूना कैसे लिया जाता है, सफलता का सत्यापन कैसे किया जाता है, अनिश्चित परिणामों को कैसे संभाला जाता है, और एजेंट-जनित कोड या प्रयोगों को उस कार्य से कैसे अलग किया जाता है जो अन्यथा मनुष्यों द्वारा किया जाता।

सबसे महत्वपूर्ण गुम साक्ष्य यह है कि क्या एजेंट-सहायता प्राप्त कार्य बेहतर अनुसंधान परिणाम उत्पन्न करता है, न कि केवल अधिक कोड, प्रयोग या टोकन। उपयोगी अनुवर्ती साक्ष्य में प्रतिलिपि प्रस्तुत करने योग्य उदाहरण, त्रुटि दर, पुनः कार्य, असफल प्रयोग, सुरक्षा निष्कर्ष और प्रत्येक चरण में आवश्यक मानव समीक्षा की मात्रा शामिल होगी।

रिपोर्ट में यह नहीं बताया गया है कि स्वचालित अनुसंधान इंटर्न एक सार्वजनिक रूप से सुलभ उत्पाद है। यह उपभोक्ता या उद्यम मूल्य, तैनाती आवश्यकताओं, पात्रता मानदंड या रिलीज की तारीख भी प्रदान नहीं करता है। इसलिए पहुंच और मूल्य निर्धारण अज्ञात है।

OpenAI का कहना है कि यह सुरक्षा और मालिकाना जानकारी की सुरक्षा करते हुए स्वचालित AI अनुसंधान की दिशा में प्रगति की रिपोर्ट करना जारी रखेगा। इसके भविष्य के खुलासे से पता चलेगा कि रिपोर्ट की गई त्वरण का कितना स्वतंत्र रूप से मूल्यांकन किया जा सकता है और अनुसंधान प्रतिबंध उपलब्ध गणना के वितरण को कैसे प्रभावित करते हैं।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई एजेंटएआई प्रशिक्षणएआई मॉडल की व्याख्याएआई का भविष्यआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?