क्या हुआ?
साउथ चाइना मॉर्निंग पोस्ट की रिपोर्ट है कि यूएस-चीन एआई प्रतियोगिता तेजी से पुनरावर्ती आत्म-सुधार पर केंद्रित है: अधिक सक्षम उत्तराधिकारियों के अनुसंधान, प्रशिक्षण और मूल्यांकन में मदद करने के लिए एआई का उपयोग करने वाली प्रणालियाँ। ऐसा प्रतीत होता है कि अमेरिकी कंपनियां एआई-सहायता प्राप्त अनुसंधान में शुरुआती बढ़त हासिल कर रही हैं, जबकि चीनी प्रयोगशालाएं संबंधित स्व-प्रशिक्षण और "आत्म-विकास" दृष्टिकोण विकसित कर रही हैं। रिपोर्ट में कहा गया है कि किसी भी पक्ष ने ओपन-एंडेड, पूरी तरह से स्वायत्त सुधार लूप का प्रदर्शन नहीं किया है।
साउथ चाइना मॉर्निंग पोस्ट की रिपोर्ट है कि प्रमुख अमेरिकी और चीनी एआई कंपनियां कोड लिखने, प्रयोगों को डिजाइन करने और मजबूत मॉडलों के लिए प्रशिक्षण तकनीक विकसित करने के लिए उन्नत मॉडल तैनात कर रही हैं। यह दीर्घकालिक उद्देश्य को पुनरावर्ती आत्म-सुधार के रूप में वर्णित करता है, जिसमें एआई सिस्टम स्वायत्त रूप से उत्तराधिकारी प्रणालियों को प्रशिक्षण और सुधारने में योगदान देता है। रिपोर्ट में कहा गया है कि OpenAI ने हाल ही में एक स्वचालित एआई शोधकर्ता की दिशा में काम का वर्णन किया है, साथ ही पूरी तरह से संरेखित पुनरावर्ती आत्म-सुधार को सुरक्षित रूप से कैसे प्राप्त किया जाए, इसके बारे में अनिश्चितता को भी स्वीकार किया है।
रिपोर्ट के मुताबिक, अमेरिकी कंपनियां फिलहाल एआई अनुसंधान को स्वतंत्र रूप से संचालित करने के लिए एआई का उपयोग करने में कई महीने आगे दिखाई दे रही हैं। यह Anthropic मॉडल के डिजाइन प्रयोगों, कोड लिखने और प्रशिक्षण के बाद की तकनीकों को विकसित करने पर Anthropic के रिपोर्ट किए गए काम का हवाला देता है, साथ ही Google DeepMind के Gemini 3.8 फ्लैश के विवरण को लंबे-क्षितिज सॉफ्टवेयर इंजीनियरिंग और स्वायत्त एजेंटों के लिए उपयुक्त बताता है। रिपोर्ट में यह भी कहा गया है कि OpenAI ने एक स्वचालित अनुसंधान प्रशिक्षु की सूचना दी जो कुछ प्रयोग चलाने में सक्षम है जिसमें एक कुशल शोधकर्ता को कई दिन लगेंगे। इन दावों के लिए साउथ चाइना मॉर्निंग पोस्ट और इसके द्वारा उद्धृत कंपनियों या शोधकर्ताओं को जिम्मेदार ठहराया गया है; यहां उनकी स्वतंत्र रूप से पुष्टि नहीं की गई है।
रिपोर्ट में कहा गया है कि चीनी प्रयोगशालाएँ "आत्म-विकास" और "पूर्ण आत्म-प्रशिक्षण" जैसे शब्दों के तहत संबंधित लक्ष्यों का पीछा कर रही हैं। Z.ai के संस्थापक टैंग जी ने कथित तौर पर GLM-6.0 के लिए एक रोडमैप का वर्णन किया है जिसमें AI पूर्व-प्रशिक्षण से लेकर प्रशिक्षण के बाद तक प्रशिक्षण पाइपलाइन का प्रबंधन करेगा। रिपोर्ट में MiniMax और DeepSeek से जुड़े काम पर भी चर्चा की गई है, जबकि विशेषज्ञ की आलोचना पर ध्यान दिया गया है कि स्वायत्त एजेंटों और स्व-प्रशिक्षण क्षमताओं में अभी तक वास्तविक पुनरावर्ती सुधार नहीं हुआ है। एक मुख्य अनसुलझा मुद्दा यह है कि क्या एक प्रणाली यह तय कर सकती है कि कोई परिवर्तन वास्तव में एक अलग मानव प्राधिकरण पर भरोसा किए बिना सुधार है या नहीं।
यह क्यों मायने रखता है?
यदि एआई सिस्टम अपने उत्तराधिकारियों के निर्माण के लिए उपयोग की जाने वाली विधियों में विश्वसनीय रूप से सुधार कर सकते हैं, तो प्रगति में तेजी आ सकती है और निरीक्षण अधिक कठिन हो सकता है। रिपोर्ट सॉफ्टवेयर विकास, प्रयोग डिजाइन और प्रशिक्षण दक्षता में संभावित लाभों का वर्णन करती है, लेकिन यह भी चेतावनी देती है कि त्रुटिपूर्ण मॉडल बाद की पीढ़ियों में त्रुटियों या गलत संरेखण को पारित कर सकते हैं। व्यावहारिक महत्व अनिश्चित बना हुआ है क्योंकि वर्तमान प्रणालियाँ अभी भी मानवीय निर्णय, गणना बुनियादी ढांचे और बाहरी मूल्यांकन पर निर्भर हैं।
पुनरावर्ती आत्म-सुधार एक फीडबैक लूप बना सकता है जिसमें एआई अधिक सक्षम मॉडल तैयार करने में मदद करता है, संभावित रूप से विकास चक्र को छोटा करता है और गणना, अनुसंधान बुनियादी ढांचे और मूल्यांकन के रणनीतिक महत्व को बढ़ाता है। रिपोर्ट में कहा गया है कि अमेरिकी विश्लेषकों को गणना करने में अमेरिकी पहुंच में फायदा दिख रहा है, जबकि चीनी शोधकर्ताओं को अधिक सीमित हार्डवेयर से प्रदर्शन निकालने में प्रभावी बताया गया है।
सुरक्षा संबंधी चिंताएँ केंद्रीय हैं क्योंकि त्रुटिपूर्ण पूर्ववर्तियों के साथ भविष्य की प्रणालियों को प्रशिक्षित करने से त्रुटियाँ या गलत संरेखण हो सकता है। रिपोर्ट में त्वरण, सैंडबॉक्स पलायन और संभावित राष्ट्रीय-सुरक्षा परिणामों के बारे में दोनों देशों के शोधकर्ताओं की चेतावनियों का हवाला दिया गया है। हालाँकि, यह भी रिपोर्ट करता है कि बुनियादी वास्तुशिल्प सफलताएँ और परिवर्तन फायदेमंद हैं या नहीं, इसके बारे में निर्णय अभी भी मानव विशेषज्ञता पर निर्भर करते हैं। भविष्य में किसी भी पुनरावर्ती सुधार का पैमाना, गति और विश्वसनीयता अज्ञात बनी हुई है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
स्वतंत्र रूप से सत्यापन योग्य प्रदर्शनों पर नज़र रखें कि एक एआई प्रणाली एक अलग मानव-परिभाषित सत्यापनकर्ता के बिना सुधारों का प्रस्ताव, कार्यान्वयन और मूल्यांकन कर सकती है। यह भी देखें कि क्या कंपनियां सुरक्षा मूल्यांकन, तैनाती सीमाएं और सबूत प्रकाशित करती हैं कि स्व-सुधार प्रणालियां गलतियों को बढ़ाती नहीं हैं या सुरक्षा उपायों को नजरअंदाज नहीं करती हैं। कोई पहुंच शर्तें, मूल्य निर्धारण या सामान्य उपलब्धता का दस्तावेजीकरण नहीं किया गया है क्योंकि रिपोर्ट सार्वजनिक उत्पाद लॉन्च के बजाय अनुसंधान और विकास से संबंधित है।
सबसे महत्वपूर्ण साक्ष्य एक प्रतिलिपि प्रस्तुत करने योग्य प्रणाली होगी जो स्वतंत्र रूप से उपयोगी परिवर्तनों की पहचान करती है, उन्हें लागू करती है, परिणामों का मूल्यांकन करती है और अपनी स्वयं की मूल्यांकन प्रक्रिया में सुधार करती है। साउथ चाइना मॉर्निंग पोस्ट की रिपोर्ट है कि इस ओपन-एंडेड क्षमता के लिए सार्वजनिक सबूत कम हैं, इसलिए "आत्म-विकास" के दावों को स्वायत्त पुनरावर्ती आत्म-सुधार के प्रमाण के रूप में नहीं माना जाना चाहिए।
रिपोर्ट में चर्चा की गई प्रणालियों के लिए सार्वजनिक रिलीज, उपभोक्ता पहुंच, मूल्य निर्धारण या तैनाती कार्यक्रम का दस्तावेजीकरण नहीं किया गया है। यह कंपनियों के प्रदर्शन दावों को स्वतंत्र रूप से मान्य नहीं करता है। भविष्य की रिपोर्टिंग में यह स्थापित होना चाहिए कि ये प्रणालियाँ मानवीय हस्तक्षेप के बिना कौन से कार्य पूरा कर सकती हैं, कौन से सुरक्षा उपाय उन्हें बाधित करते हैं, परिणाम कैसे मापे जाते हैं और क्या उत्पादन प्रणालियों में परिवर्तन पहुंचने से पहले विफलताओं का पता लगाया जाता है।