क्या हुआ?
25 अगस्त को arXiv को प्रस्तुत एक प्रीप्रिंट, पदानुक्रमित एलएलएम एजेंटों के लिए "स्व-वृद्धि" का प्रस्ताव करता है: एक एजेंट किसी कार्य को हल करने की संभावना का अनुमान लगाता है जबकि वह अभी भी तर्क कर रहा है और जब अपेक्षित लाभ लागत को उचित ठहराता है तो एक मजबूत मॉडल को नियंत्रण सौंप देता है। पेपर इसकी तुलना जेनरेशन से पहले रूटिंग और प्रतिक्रिया पूरी होने के बाद सत्यापन से करता है।
पेपर पदानुक्रमित एलएलएम एजेंटों में एक विशिष्ट समस्या की जांच करता है: न केवल यह तय करना कि किस मॉडल को कार्य संभालना चाहिए, बल्कि यह भी तय करना चाहिए कि एक कमजोर मॉडल को कब रुकना चाहिए और मदद के लिए एक मजबूत मॉडल से पूछना चाहिए। इसकी प्रस्तावित व्यवस्था पीढ़ी के दौरान संचालित होती है। एक एजेंट अपनी सफलता की अंतिम संभावना का एक ऑनलाइन अनुमान बनाता है और जब वह अनुमान लागत-संवेदनशील सीमा से नीचे आता है तो उत्तर पूरा करने से पहले उसे आगे बढ़ा सकता है। यह स्रोत द्वारा वर्णित केंद्रीय तकनीकी योगदान है।
लेखक इस निर्णय को बायेसियन इष्टतम-रोकने वाली समस्या के रूप में तैयार करते हैं। क्षमता का अनुमान एक सीखा हुआ पश्च भाग है जिसके पर्याप्त आँकड़े अकेले कच्चे आउटपुट एन्ट्रापी के बजाय लेबल किए गए प्रक्षेपवक्र से आते हैं। पेपर बंद रूप में एक अदूरदर्शी वृद्धि सीमा प्राप्त करता है और इष्टतम नीति को चिह्नित करने के लिए गतिशील प्रोग्रामिंग का उपयोग करता है। यह इस बात का प्रमाण देता है कि यह नीति कच्चे सिग्नल पर आकार की धारणा थोपे बिना एक समय-भिन्न सीमा वाली नीति है।
स्रोत कई सैद्धांतिक परिणामों की रिपोर्ट करता है। इसमें कहा गया है कि ओरेकल विश्वास सिग्नल की चेर्नॉफ-सूचना दर पर तेजी से अलग हो जाता है, कि पछतावा पश्च अंशांकन द्वारा नियंत्रित होता है, और एन लेबल वाले अंशांकन प्रक्षेपवक्र के साथ प्रशिक्षित प्लग-इन नीति में 1/sqrt (n) की दर से कम होने का पछतावा होता है। कथित तौर पर एक नियंत्रित सिमुलेशन अध्ययन उस दर सहित सिद्धांत की भविष्यवाणियों की पुष्टि करता है। पेपर में 257 एमबीपीपी कोडिंग कार्यों पर Qwen2.5-Coder 1.5B-to-7B कैस्केड का उपयोग करके एक वास्तविक-मॉडल सत्यापन भी शामिल है। उस सत्यापन ने तीन पूर्व-पंजीकृत भविष्यवाणियों में से दो की पुष्टि की: एस्केलेशन फ्रंटियर ने समान लागत पर पोस्ट-हॉक रूटिंग से बेहतर प्रदर्शन किया, और पीढ़ी के दौरान संचयी क्षमता का विश्वास अधिक भेदभावपूर्ण हो गया। स्रोत तीसरी भविष्यवाणी की पहचान नहीं करता है या संक्षेप में यह नहीं बताता है कि इसकी पुष्टि क्यों नहीं की गई।
यह क्यों मायने रखता है?
यदि दृष्टिकोण सामान्य हो जाता है, तो यह एजेंट सिस्टम को क्षमता, विलंबता और मॉडल-उपयोग लागत को संतुलित करने का अधिक समयबद्ध तरीका प्रदान कर सकता है। साक्ष्य अभी भी प्रारंभिक है: पेपर के वास्तविक-मॉडल परीक्षण में 257 एमबीपीपी कार्यों पर क्वेन2.5-कोडर 1.5बी-टू-7बी कैस्केड का उपयोग किया गया और तीन पूर्व-पंजीकृत भविष्यवाणियों में से दो की पुष्टि की गई।
व्यावहारिक मुद्दा एआई एजेंट के अंदर संसाधन आवंटन है। एक प्रणाली जो हमेशा एक मजबूत मॉडल का उपयोग करती है वह क्षमता में सुधार कर सकती है लेकिन अधिक अनुमान संसाधनों का उपभोग करती है। एक प्रणाली जो कमजोर मॉडल को पूरा होने तक प्रतिबद्ध करती है वह समय बर्बाद कर सकती है या टालने योग्य विफलता उत्पन्न कर सकती है। स्व-वृद्धि निर्णय को तर्क प्रक्रिया के अंदर रखने का प्रयास करती है, जिससे सिस्टम को रुकने का मौका मिलता है जब उसके स्वयं के साक्ष्य बताते हैं कि जारी रखने से लाभ मिलने की संभावना नहीं है।
अंशांकन पर पेपर का जोर महत्वपूर्ण है क्योंकि वृद्धि क्षमता अनुमान की गुणवत्ता पर निर्भर करती है। एक आत्मविश्वास संकेत जो खराब रूप से कैलिब्रेट किया गया है, एक एजेंट को बहुत बार बढ़ने, लागत में वृद्धि, या बहुत कम ही, कमजोर उत्तरों को पारित करने की अनुमति दे सकता है। रिपोर्ट की गई अफसोस की गारंटी भाषा मॉडल की सार्वभौमिक रूप से विश्वसनीय संपत्ति के रूप में वृद्धि को प्रस्तुत करने के बजाय प्रदर्शन को उस अंशांकन से जोड़ती है।
वास्तविक-मॉडल सत्यापन में समान-लागत तुलना संभावित रूप से उपयोगी है क्योंकि यह असीमित अतिरिक्त मॉडल कॉल के साथ सिस्टम की तुलना करने के बजाय एक ठोस तैनाती ट्रेडऑफ़ को लक्षित करती है। हालाँकि, रिपोर्ट किया गया मूल्यांकन संकीर्ण है। इसमें एक मॉडल परिवार, स्रोत में वर्णित एक छोटे से मध्यम कैस्केड कॉन्फ़िगरेशन और 257 एमबीपीपी कार्य शामिल हैं। सार पूर्ण सफलता दर, सटीक लागत लेखांकन, लाभ का आकार या गैर-कोडिंग कार्यों से साक्ष्य प्रदान नहीं करता है। इसलिए यह विधि में रुचि का समर्थन करता है, न कि यह निष्कर्ष कि पदानुक्रमित एजेंट आमतौर पर जानते हैं कि मदद कब लेनी है।
परिणाम गतिशील गणना की ओर एजेंट डिज़ाइन में व्यापक बदलाव के लिए भी उपयुक्त है: सिस्टम को यह तय करने की आवश्यकता हो सकती है कि प्रत्येक कार्य पर कितना तर्क, सत्यापन या मॉडल क्षमता खर्च की जाए। यह पेपर उस निर्णय के एक संस्करण के लिए एक औपचारिक रूपरेखा का योगदान देता है। इसका सार्वजनिक मूल्य इस बात पर निर्भर करेगा कि क्या ढांचे को भरोसेमंद निगरानी के साथ लागू किया जा सकता है और क्या अतिरिक्त अंशांकन डेटा, निर्णय ओवरहेड और हैंडऑफ़ जटिलता बेहतर परिणामों से उचित है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
आगे क्या देखना है
मुख्य प्रश्न यह है कि क्या सीखी गई क्षमता का अनुमान पेपर की नियंत्रित सेटिंग से परे मॉडल, कार्यों और वातावरण में कैलिब्रेट किया जाता है। स्वतंत्र प्रतिकृति को बड़े और अधिक विविध कार्यभार, अपुष्ट भविष्यवाणी, वृद्धि त्रुटियों और पीढ़ी के दौरान नियंत्रण स्थानांतरित करने की व्यावहारिक लागत का परीक्षण करना चाहिए।
प्रतिकृति को यह स्थापित करना चाहिए कि पोस्ट-हॉक रूटिंग पर रिपोर्ट किया गया लाभ एमबीपीपी के बाहर और क्वेन2.5-कोडर 1.5बी-टू-7बी कैस्केड से परे बना हुआ है या नहीं। उपयोगी परीक्षण कार्य की कठिनाई, मॉडल जोड़े, डोमेन और वृद्धि की सापेक्ष कीमत या विलंबता में भिन्न होंगे। स्रोत स्वयं उन परीक्षणों की रिपोर्ट नहीं करता है, इसलिए उनकी अनुपस्थिति विफलता के सबूत के बजाय एक सार्थक अज्ञात है।
अपुष्ट पूर्वपंजीकृत भविष्यवाणी विशेष ध्यान देने योग्य है। सार कहता है कि तीन में से दो भविष्यवाणियों की पुष्टि की गई थी लेकिन शेष भविष्यवाणी का नाम या परिणाम का वर्णन नहीं किया गया है। पाठकों को पूरा पेपर, जारी कोड और डेटा, या अनुवर्ती कार्य देखना चाहिए जो स्पष्ट करता है कि क्या परीक्षण किया गया था, भविष्यवाणी क्यों विफल रही, और क्या विफलता सिद्धांत, संकेत या कार्यान्वयन में किसी सीमा की ओर इशारा करती है।
भविष्य के मूल्यांकन में केवल औसत कार्य सफलता ही नहीं, बल्कि गलत अंशांकन के हानिकारक रूपों को भी मापा जाना चाहिए। एक एजेंट आसान कार्यों को अनावश्यक रूप से आगे बढ़ा सकता है, कठिन कार्यों को आगे बढ़ाने में विफल हो सकता है, या मजबूत मॉडल की मदद के लिए बहुत देर से नियंत्रण स्थानांतरित कर सकता है। स्रोत एक अफसोस ढाँचा स्थापित करता है, लेकिन संक्षेप में, इन परिचालन त्रुटि प्रकारों की मात्रा निर्धारित नहीं करता है या यह नहीं दिखाता है कि वितरण बदलाव के तहत विधि कैसे व्यवहार करती है।
पेपर काम से जुड़े कोड और डेटा को सूचीबद्ध करता है, जिससे स्वतंत्र जांच संभव हो सकती है, लेकिन स्रोत लिंक प्रदान नहीं करता है या रिलीज़ सामग्री का वर्णन नहीं करता है। सत्यापन में अंशांकन प्रक्रिया, लेबल किए गए प्रक्षेप पथ, लागत मॉडल, पूर्व पंजीकरण, सिमुलेशन सेटअप और 257-कार्य सत्यापन के आसपास सांख्यिकीय अनिश्चितता की जांच करनी चाहिए। तब तक, सबसे मजबूत समर्थित निष्कर्ष यह है कि प्रीप्रिंट आशाजनक लेकिन सीमित अनुभवजन्य साक्ष्य के साथ मध्य पीढ़ी की वृद्धि के लिए एक औपचारिक, परीक्षण योग्य दृष्टिकोण प्रदान करता है।