क्या हुआ?
शोधकर्ताओं ने गणना-वातानुकूलित क्रेडिट ट्रांसपोर्ट की शुरुआत की, जो प्रतिक्रिया के दौरान भाषा मॉडल द्वारा की गई गणना के अनुसार व्यक्तिगत टोकन को सुदृढीकरण-शिक्षण क्रेडिट आवंटित करने की एक विधि है। उनका कार्यान्वयन, CompPO, प्रति-टोकन प्रतिधारण गेट बनाने के लिए ध्यान एकाग्रता का उपयोग करता है और इसे एक आलोचक के साथ जोड़ता है जो अभिनेता की छिपी हुई स्थिति और रूटिंग जानकारी का पुन: उपयोग करता है।
21 अगस्त को arXiv को प्रस्तुत एक प्रीप्रिंट बड़े भाषा मॉडल के लिए सुदृढीकरण सीखने के दौरान क्रेडिट आवंटित करने का एक नया तरीका प्रस्तावित करता है। पेपर क्रेडिट असाइनमेंट को तीन भागों में अलग करता है: एक रोलआउट सफल हुआ या नहीं, इसके बारे में साक्ष्य, एक परिवहन ऑपरेटर जो उस साक्ष्य को टोकन-स्तर के लाभों में परिवर्तित करता है, और अद्यतन ज्यामिति जो उन लाभों को नीति परिवर्तनों में बदल देती है। लेखकों का तर्क है कि हाल के काम ने पहले और तीसरे भाग में सुधार किया है, जबकि आमतौर पर इस्तेमाल किए जाने वाले परिवहन नियम मॉडल वास्तुकला से काफी हद तक स्वतंत्र हैं।
प्रस्तावित ढांचा, जिसे गणना-वातानुकूलित क्रेडिट ट्रांसपोर्ट कहा जाता है, रोलआउट के माध्यम से डाउनस्ट्रीम मूल्य को कैसे पहुंचाया जाता है, इसे पैरामीटर करने के लिए व्यवहार नीति की आंतरिक गणना से एक अलग आंकड़े का उपयोग करता है। ठोस एल्गोरिथ्म, CompPO, प्रत्येक टोकन के लिए मूल ध्यान एकाग्रता को एक सीमित प्रतिधारण गेट में परिवर्तित करता है। उस गेट का उपयोग वन-स्टेप बूटस्ट्रैपिंग और कॉम्प-जीएई नामक पथ-निर्भर सामान्यीकृत-लाभ ट्रेस दोनों के लिए किया जाता है। लेखकों का कहना है कि एक स्थिर गेट एक मानक आधार रेखा के लिए एक लिंक प्रदान करते हुए, निश्चित-गुणांक सामान्यीकृत लाभ अनुमान की विधि को कम कर देता है।
CompPO में ट्रांसपोर्ट-अलाइन्ड क्रिटिक या TAC भी शामिल है। समान पैमाने का दूसरा ट्रांसफार्मर जोड़ने के बजाय, टीएसी अभिनेता की छिपी हुई स्थिति और रूटिंग जानकारी का पुन: उपयोग करता है। पेपर में कहा गया है कि कार्य पुरस्कार और क्लिप किए गए पीपीओ नीति उद्देश्य अपरिवर्तित रहेंगे; दावा किया गया परिवर्तन यह है कि क्रेडिट का परिवहन कैसे किया जाता है और आलोचक उस परिवहन के साथ कैसे जुड़ा होता है। पांच Qwen3-4B बीजों का उपयोग करने वाले प्रयोगों में, लेखक 61.4% अंतिम आयोजित सटीकता की रिपोर्ट करते हैं, 60.8% से 62.0% के 95% आत्मविश्वास अंतराल के साथ, ट्यून किए गए GRPO के लिए 53.8% की तुलना में, 52.9% से 54.7% के अंतराल के साथ।
पेपर के पृथक्करण परिणाम घटकों के संयोजन को परिणाम बताते हैं। कॉम्प-जीएई को एक मानक आलोचक के साथ जोड़ा गया 55.2% तक पहुंच गया, जबकि टीएसी को एक निश्चित गेट के साथ जोड़ा गया 56.4% तक पहुंच गया; न ही पूरी प्रणाली से मेल खाता है। लेखक 1.9 से 2.9 अंक के 95% विश्वास अंतराल के साथ 2.4 अंक के अंतःक्रिया प्रभाव की रिपोर्ट करते हैं। प्रक्षेपवक्र-विशिष्ट संरेखण का समर्थन करने के लिए फेरबदल और स्थिति नियंत्रण की सूचना दी गई थी। तुलनात्मक सेटअप के लिए 12 में से 3 की तुलना में CompPO 12 पीपीओ-ग्रिड रन में से 10 में स्थिर था। जमे हुए मूल्यांकन पर, लेखक क्रमशः Qwen3-4B और Llama-3.1-8B-इंस्ट्रक्ट पर 4.3 और 3.9 लालची पास@1 मैक्रो पॉइंट के GRPO पर सुधार की रिपोर्ट करते हैं।
यह क्यों मायने रखता है?
परिणाम बड़े भाषा मॉडल के लिए सुदृढीकरण सीखने में एक व्यावहारिक बाधा को संबोधित करता है: यह तय करना कि लंबी प्रतिक्रिया के कौन से हिस्से अंतिम परिणाम के लिए श्रेय या दोष के पात्र हैं। लेखक ट्यून किए गए जीआरपीओ की तुलना में सुधार की रिपोर्ट करते हैं, लेकिन सबूत प्रीप्रिंट और प्रयोगों के सीमित सेट से आते हैं, इसलिए विधि की व्यापकता और परिचालन लागत अनिश्चित बनी हुई है।
भाषा मॉडल के लिए सुदृढीकरण सीखने को अंतिम पुरस्कार को कई व्यक्तिगत टोकन और मध्यवर्ती निर्णयों से जोड़ना चाहिए। एक प्रतिक्रिया में उपयोगी और अनुपयोगी चरण हो सकते हैं, लेकिन एक विधि जो संपूर्ण प्रतिक्रिया में समान परिणाम आँकड़े प्रसारित करती है वह कमजोर मार्गदर्शन प्रदान कर सकती है। पेपर का मुख्य दावा यह है कि मॉडल की अपनी गणना यह तय करने के लिए अधिक विशिष्ट संकेत प्रदान कर सकती है कि क्रेडिट एक टोकन से दूसरे टोकन तक कितनी मजबूती से बना रहना चाहिए।
यदि रिपोर्ट किया गया प्रभाव व्यापक सेटिंग्स में रहता है, तो वास्तुकला-जागरूक क्रेडिट ट्रांसपोर्ट एक अलग इनाम परिभाषा या नीति उद्देश्य की आवश्यकता के बिना सुदृढीकरण-शिक्षण अपडेट को अधिक लक्षित बना सकता है। यह मायने रखता है क्योंकि क्रेडिट असाइनमेंट में बदलाव को संभावित रूप से मौजूदा पीपीओ-शैली प्रशिक्षण पाइपलाइनों में शामिल किया जा सकता है। जीआरपीओ के साथ रिपोर्ट की गई तुलना वर्तमान एलएलएम सुदृढीकरण-सीखने के अभ्यास के लिए विशेष रूप से प्रासंगिक है क्योंकि यह प्रस्तावित पद्धति को नए मॉडल परिवार या उपयोगकर्ता-सामना वाले उत्पाद के बजाय प्रशिक्षण संकेत में बदलाव के रूप में तैयार करती है।
रिपोर्ट किए गए उच्छेदन उपयोगी हैं क्योंकि उनका सुझाव है कि परिणाम को केवल ध्यान-व्युत्पन्न द्वार या पुन: उपयोग किए गए आलोचक द्वारा समझाया नहीं जा सकता है। पूर्ण विधि ने आपूर्ति किए गए परिणामों में दोनों आंशिक वेरिएंट की तुलना में बेहतर प्रदर्शन किया, और लेखकों का कहना है कि फेरबदल और स्थिति नियंत्रण इस विचार का समर्थन करते हैं कि प्रक्षेपवक्र-विशिष्ट संरेखण मायने रखता है। स्थिरता तुलना एक संभावित व्यावहारिक लाभ की ओर भी इशारा करती है: कम अस्थिर रन व्यर्थ प्रशिक्षण प्रयासों को कम कर सकते हैं, हालांकि स्रोत गणना या लागत माप प्रदान नहीं करता है।
साक्ष्य को अभी भी प्रारंभिक शोध परिणाम के रूप में पढ़ा जाना चाहिए। स्रोत एक arXiv प्रीप्रिंट है, सहकर्मी-समीक्षित प्रकाशन नहीं है, और सार अंतर्निहित कार्यों, डेटासेट आकार, आधारभूत कार्यान्वयन विवरण, प्रशिक्षण बजट, या रिपोर्ट किए गए आत्मविश्वास अंतराल से परे सांख्यिकीय प्रक्रियाओं का वर्णन नहीं करता है। यह यह भी स्थापित नहीं करता है कि लाभ अतिरिक्त मेमोरी, विलंबता, इंजीनियरिंग जटिलता, या ध्यान पैटर्न के प्रति संवेदनशीलता के साथ आते हैं या नहीं। इसलिए विधि का सार्वजनिक प्रभाव इस बात पर निर्भर करता है कि क्या स्वतंत्र शोधकर्ता परिणामों को पुन: पेश कर सकते हैं और क्या दृष्टिकोण बड़े मॉडल और विभिन्न सुदृढीकरण-सीखने के उद्देश्यों में स्थानांतरित होता है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
महत्वपूर्ण अगले परीक्षण स्वतंत्र प्रतिकृति, व्यापक मॉडल और कार्य कवरेज, और तुलनाएं हैं जिनमें प्रशिक्षण लागत, मेमोरी उपयोग और रनटाइम शामिल हैं। स्रोत यह स्थापित नहीं करता है कि क्या CompPO रिपोर्ट किए गए Qwen3-4B और Llama-3.1-8B-निर्देश मूल्यांकन से परे विश्वसनीय रूप से काम करता है या क्या इसका ध्यान-आधारित संकेत विभिन्न मॉडल आर्किटेक्चर में उपयोगी रहता है।
पहली प्राथमिकता पाँच Qwen3-4B बीजों और रिपोर्ट किए गए जमे हुए मूल्यांकनों से परे प्रतिकृति है। स्वतंत्र समूहों को अधिक मॉडल आकार, प्रशिक्षण कार्यों, इनाम संरचनाओं और भाषा-मॉडल आर्किटेक्चर पर विधि का परीक्षण करना चाहिए। स्रोत का नाम Qwen3-4B और Llama-3.1-8B-Instruct है, लेकिन यह नहीं बताता है कि क्या विधि का मूल्यांकन मॉडलों की एक विस्तृत श्रृंखला में किया गया था या क्या ध्यान संकेत अलग-अलग रूटिंग या ध्यान डिज़ाइन वाले आर्किटेक्चर में समान व्यवहार करता है।
शोधकर्ताओं को पूर्ण प्रशिक्षण ट्रेडऑफ़ को भी मापना चाहिए। पेपर में कहा गया है कि टीएसी दूसरे समान पैमाने के ट्रांसफार्मर के बिना अभिनेता की छिपी हुई स्थिति और रूटिंग जानकारी का पुन: उपयोग करता है, लेकिन स्रोत मेमोरी खपत, दीवार-घड़ी प्रशिक्षण समय, हार्डवेयर आवश्यकताओं या कुल गणना की मात्रा निर्धारित नहीं करता है। वे माप यह निर्धारित करेंगे कि रिपोर्ट की गई सटीकता और स्थिरता लाभ उन संगठनों के लिए व्यावहारिक हैं जो पहले से ही महंगी सुदृढीकरण-शिक्षण पाइपलाइन चला रहे हैं।
आगे के काम में यह जांचना चाहिए कि ध्यान-व्युत्पन्न अवधारण द्वार कितना मजबूत है। रिपोर्ट किए गए फेरबदल और स्थिति नियंत्रण प्रयोगों के भीतर प्रक्षेपवक्र-विशिष्ट संरेखण का समर्थन करते हैं, लेकिन स्रोत यह नहीं दिखाता है कि गेट लंबे संदर्भों, असामान्य तर्क निशान, विरल या शोर पुरस्कार, या संकेत और नमूने में परिवर्तन पर कैसे प्रतिक्रिया करता है। यह भी अज्ञात है कि क्या ध्यान एकाग्रता कम्प्यूटेशनल महत्व के लिए एक विश्वसनीय प्रॉक्सी है या परीक्षण किए गए विशेष मॉडल और कार्यों के लिए केवल एक उपयोगी संकेत है।
अंत में, प्रीप्रिंट के रूप में विधि की स्थिति मायने रखती है। स्रोत स्वतंत्र सत्यापन, उत्पादन परिनियोजन, कोड उपलब्धता, या सहकर्मी-समीक्षा परिणामों की रिपोर्ट नहीं करता है। वे चूक निष्कर्षों को अमान्य नहीं करती हैं, लेकिन वे प्रतिलिपि प्रस्तुत करने योग्यता और सामान्यीकरण के बारे में महत्वपूर्ण प्रश्नों को अनुत्तरित छोड़ देती हैं। एक मजबूत मामले के लिए जारी कार्यान्वयन विवरण, मिलान-लागत आधार रेखाएं, अतिरिक्त आर्किटेक्चर के परिणाम और इस बात के साक्ष्य की आवश्यकता होगी कि सुधार लेखकों के मूल्यांकन सेटअप के बाहर जारी रहते हैं।