क्या हुआ?
मार्कटेकपोस्ट की रिपोर्ट है कि कॉग्निशन ने SWE-2 जारी किया है, जो Moonshot AI के Kimi K3 से प्रशिक्षित एक कोडिंग मॉडल है। यह मॉडल शुरुआत में केवल डेविन के डेस्कटॉप और सीएलआई उत्पादों के माध्यम से उपलब्ध है। कथित तौर पर डेविन वेब और फ़्यूज़न एक्सेस शुरू हो रहे हैं। मार्कटेकपोस्ट का कहना है कि कॉग्निशन बेंचमार्क और लागत परिणामों की रिपोर्ट करता है, लेकिन उन तुलनाओं की स्वतंत्र रूप से पुष्टि नहीं की गई है।
मार्कटेकपोस्ट की रिपोर्ट है कि डेविन की कंपनी कॉग्निशन ने अपने अब तक के सबसे सक्षम कोडिंग मॉडल के रूप में SWE-2 जारी किया है। आउटलेट के अनुसार, कॉग्निशन ने सुदृढीकरण सीखने का उपयोग करते हुए Moonshot AI के Kimi K3 को पोस्ट-प्रशिक्षित किया, जिसे 2.8-ट्रिलियन-पैरामीटर ओपन मॉडल के रूप में वर्णित किया गया है। मार्कटेकपोस्ट का कहना है कि कॉग्निशन ने फ्रंटियरकोड 1.1 मेन पर 50.0% स्कोर की सूचना दी है, जो 64% कम लागत पर फैबल 5.1 के एक प्रतिशत अंक के भीतर है। ये परिणाम कंपनी द्वारा रिपोर्ट किए गए हैं; स्रोत स्वतंत्र सत्यापन प्रदान नहीं करता है.
मॉडल को ओपन-वेट रिलीज़ या स्टैंडअलोन एपीआई के रूप में पेश नहीं किया गया है। मार्कटेकपोस्ट का कहना है कि SWE-2 केवल डेविन के अंदर चलता है, रिपोर्टिंग के समय डेस्कटॉप और सीएलआई एक्सेस उपलब्ध है और डेविन वेब और फ्यूजन चालू है। स्रोत कीमत, पात्रता आवश्यकताओं, भौगोलिक सीमा या सामान्य उपलब्धता तिथि का दस्तावेजीकरण नहीं करता है।
एक केंद्रीय परिवर्तन चयन योग्य तर्क प्रयास है। मार्कटेकपोस्ट की रिपोर्ट है कि कॉग्निशन ने एक ही सुदृढीकरण-सीखने की दौड़ में तीन प्रयास स्तरों को प्रशिक्षित किया और प्रत्येक स्तर को एक अलग लागत दंड सौंपा। आउटलेट SWE-1.7 पर दावा किए गए सुधारों का भी वर्णन करता है, जिसमें प्रारंभिक संपादन करने से पहले कम मोड़ और फ्रंटियरकोड पर कम रिपोर्ट की गई लागत शामिल है। कॉग्निशन का कहना है कि मॉडल ने परीक्षण कवरेज, उपकरण-उपयोग संसाधनशीलता और सत्यापन व्यवहार में सुधार किया है, लेकिन ये व्यवहार संबंधी दावे स्रोत द्वारा स्वतंत्र रूप से स्थापित नहीं हैं।
स्रोत विवरण: marktechpost.com ↗
यह क्यों मायने रखता है?
SWE-2 एक सार्थक उत्पाद परिवर्तन का प्रतिनिधित्व करता है क्योंकि यह डेविन उपयोगकर्ताओं को कई तर्क-प्रयास विकल्प देता है और कथित तौर पर लागत और अनावश्यक अन्वेषण को कम करते हुए कोडिंग प्रदर्शन में सुधार करता है। हालाँकि, इसकी व्यावहारिक पहुंच सीमित है: उपयोगकर्ता मॉडल को अपने स्वयं के बुनियादी ढांचे पर तैनात नहीं कर सकते हैं या इसे स्टैंडअलोन एपीआई के माध्यम से कॉल नहीं कर सकते हैं, और मूल्य निर्धारण स्रोत में प्रलेखित नहीं है।
रिपोर्ट की गई रिलीज़ मायने रखती है क्योंकि यह कोडिंग-एजेंट उत्पाद में तर्क प्रयास पर मॉडल-स्तरीय नियंत्रण को स्थानांतरित करती है। यदि रिपोर्ट की गई लागत और प्रदर्शन अंतर कॉग्निशन के मूल्यांकन से बाहर हैं, तो डेवलपर्स एक निश्चित सेटिंग का उपयोग करने के बजाय कार्य कठिनाई के अनुसार तेज़ या अधिक जानबूझकर व्यवहार चुन सकते हैं।
एक्सेस मॉडल रिलीज़ के तत्काल महत्व को भी सीमित करता है। जिन संगठनों को स्व-होस्टिंग, प्रत्यक्ष एपीआई एकीकरण, या मॉडल भार पर नियंत्रण की आवश्यकता होती है, वे उपलब्ध जानकारी के आधार पर उन शर्तों पर SWE-2 का उपयोग नहीं कर सकते हैं। स्रोत यह नहीं बताता कि भविष्य में एपीआई या व्यापक परिनियोजन विकल्प की योजना बनाई गई है या नहीं।
मूल्यांकन संदर्भ महत्वपूर्ण है. मार्कटेकपोस्ट का कहना है कि फ्रंटियरकोड कॉग्निशन का अपना बेंचमार्क है और तुलना में प्रतिद्वंद्वी स्कोर कॉग्निशन के मूल्यांकन से आया है। स्रोत टर्मिनल-बेंच 4 पर एक बड़ी कमजोरी को भी नोट करता है, जहां SWE-2 कथित तौर पर अन्य तुलनात्मक प्रणालियों से लगभग 30 अंक पीछे है। यह रिलीज़ को परिणामी बनाता है लेकिन समान रूप से मजबूत कोडिंग प्रदर्शन का प्रमाण नहीं है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
कोडिंग बेंचमार्क, स्पष्ट उपलब्धता और मूल्य निर्धारण की जानकारी पर SWE-2 के स्वतंत्र परीक्षण और उपयोगकर्ताओं से इस बारे में साक्ष्य देखें कि क्या इसकी प्रयास सेटिंग्स वास्तविक सॉफ़्टवेयर परियोजनाओं में विश्वसनीय लागत-प्रदर्शन ट्रेडऑफ़ उत्पन्न करती हैं।
स्वतंत्र बेंचमार्क परिणामों को यह स्पष्ट करना चाहिए कि क्या SWE-2 के बताए गए लाभ कोडिंग वातावरण, रिपॉजिटरी, भाषाओं और मूल्यांकन हार्नेस में बने रहते हैं। विशेष रूप से ध्यान टर्मिनल-बेंच 4 और उन परीक्षणों पर जाना चाहिए जो अकेले कार्य पूरा करने के बजाय पूर्ण, सही परिवर्तनों को मापते हैं।
उपयोगकर्ताओं को यह पुष्टि करने वाले दस्तावेज़ों पर नज़र रखनी चाहिए कि डेविन वेब और फ़्यूज़न को SWE-2 कब प्राप्त होता है, प्रत्येक उत्पाद में कौन से प्रयास स्तर उपलब्ध हैं, और उपयोग का बिल कैसे दिया जाता है। मार्कटेकपोस्ट मूल्य निर्धारण या विस्तृत पहुंच नीति प्रदान नहीं करता है।
आगे तकनीकी प्रकटीकरण से सुदृढीकरण-सीखने के तरीकों, सत्यापनकर्ता गुणवत्ता, परिमाणीकरण विकल्पों और दावा किए गए सुरक्षा परिणामों का आकलन करने में मदद मिल सकती है। मार्कटेकपोस्ट की रिपोर्ट है कि कॉग्निशन ने विश्वसनीयता मूल्यांकन फिर से चलाया, लेकिन स्रोत यह स्थापित नहीं करता है कि वे परीक्षण उत्पादन कोडिंग उपयोग के कितने प्रतिनिधि हैं या स्वतंत्र रूप से अपने निष्कर्षों को पुन: पेश करते हैं।