समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

वास्तुकला-जागरूक क्रेडिट असाइनमेंट भाषा मॉडल के लिए सुदृढीकरण सीखने में सुधार करता है

एक arXiv प्रीप्रिंट कॉम्पपीओ पेश करता है, जो एक सुदृढीकरण-सीखने की विधि है जो टोकन में प्रशिक्षण क्रेडिट आवंटित करने के लिए भाषा मॉडल के स्वयं के ध्यान पैटर्न का उपयोग करती है। लेखक Qwen3-4B और Llama-3.1-8B-Instruct पर प्रयोगों में ट्यून किए गए GRPO की तुलना में उच्च आयोजित सटीकता और अधिक स्थिरता की रिपोर्ट करते हैं।

6 min readRead the primary source
Source-page capture accompanying Architecture-aware credit assignment improves reinforcement learning for language models
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.21501
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

सुदृढीकरण सीखना
इनाम संकेतों द्वारा प्रशिक्षण जहां एक एजेंट ऐसे कार्य सीखता है जो दीर्घकालिक रिटर्न को अधिकतम करते हैं।
बड़े भाषा मॉडल (एलएलएम)
पाठ उत्पन्न करने और उसका विश्लेषण करने के लिए विशाल पाठ निगम पर प्रशिक्षित एक भाषा मॉडल।
मेमोरी (एजेंट मेमोरी)
संग्रहीत संदर्भ एक एआई एजेंट निरंतरता में सुधार के लिए चरणों या सत्रों में उपयोग करता है।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

शोधकर्ताओं ने गणना-वातानुकूलित क्रेडिट ट्रांसपोर्ट की शुरुआत की, जो प्रतिक्रिया के दौरान भाषा मॉडल द्वारा की गई गणना के अनुसार व्यक्तिगत टोकन को सुदृढीकरण-शिक्षण क्रेडिट आवंटित करने की एक विधि है। उनका कार्यान्वयन, CompPO, प्रति-टोकन प्रतिधारण गेट बनाने के लिए ध्यान एकाग्रता का उपयोग करता है और इसे एक आलोचक के साथ जोड़ता है जो अभिनेता की छिपी हुई स्थिति और रूटिंग जानकारी का पुन: उपयोग करता है।

21 अगस्त को arXiv को प्रस्तुत एक प्रीप्रिंट बड़े भाषा मॉडल के लिए सुदृढीकरण सीखने के दौरान क्रेडिट आवंटित करने का एक नया तरीका प्रस्तावित करता है। पेपर क्रेडिट असाइनमेंट को तीन भागों में अलग करता है: एक रोलआउट सफल हुआ या नहीं, इसके बारे में साक्ष्य, एक परिवहन ऑपरेटर जो उस साक्ष्य को टोकन-स्तर के लाभों में परिवर्तित करता है, और अद्यतन ज्यामिति जो उन लाभों को नीति परिवर्तनों में बदल देती है। लेखकों का तर्क है कि हाल के काम ने पहले और तीसरे भाग में सुधार किया है, जबकि आमतौर पर इस्तेमाल किए जाने वाले परिवहन नियम मॉडल वास्तुकला से काफी हद तक स्वतंत्र हैं।

प्रस्तावित ढांचा, जिसे गणना-वातानुकूलित क्रेडिट ट्रांसपोर्ट कहा जाता है, रोलआउट के माध्यम से डाउनस्ट्रीम मूल्य को कैसे पहुंचाया जाता है, इसे पैरामीटर करने के लिए व्यवहार नीति की आंतरिक गणना से एक अलग आंकड़े का उपयोग करता है। ठोस एल्गोरिथ्म, CompPO, प्रत्येक टोकन के लिए मूल ध्यान एकाग्रता को एक सीमित प्रतिधारण गेट में परिवर्तित करता है। उस गेट का उपयोग वन-स्टेप बूटस्ट्रैपिंग और कॉम्प-जीएई नामक पथ-निर्भर सामान्यीकृत-लाभ ट्रेस दोनों के लिए किया जाता है। लेखकों का कहना है कि एक स्थिर गेट एक मानक आधार रेखा के लिए एक लिंक प्रदान करते हुए, निश्चित-गुणांक सामान्यीकृत लाभ अनुमान की विधि को कम कर देता है।

CompPO में ट्रांसपोर्ट-अलाइन्ड क्रिटिक या TAC भी शामिल है। समान पैमाने का दूसरा ट्रांसफार्मर जोड़ने के बजाय, टीएसी अभिनेता की छिपी हुई स्थिति और रूटिंग जानकारी का पुन: उपयोग करता है। पेपर में कहा गया है कि कार्य पुरस्कार और क्लिप किए गए पीपीओ नीति उद्देश्य अपरिवर्तित रहेंगे; दावा किया गया परिवर्तन यह है कि क्रेडिट का परिवहन कैसे किया जाता है और आलोचक उस परिवहन के साथ कैसे जुड़ा होता है। पांच Qwen3-4B बीजों का उपयोग करने वाले प्रयोगों में, लेखक 61.4% अंतिम आयोजित सटीकता की रिपोर्ट करते हैं, 60.8% से 62.0% के 95% आत्मविश्वास अंतराल के साथ, ट्यून किए गए GRPO के लिए 53.8% की तुलना में, 52.9% से 54.7% के अंतराल के साथ।

पेपर के पृथक्करण परिणाम घटकों के संयोजन को परिणाम बताते हैं। कॉम्प-जीएई को एक मानक आलोचक के साथ जोड़ा गया 55.2% तक पहुंच गया, जबकि टीएसी को एक निश्चित गेट के साथ जोड़ा गया 56.4% तक पहुंच गया; न ही पूरी प्रणाली से मेल खाता है। लेखक 1.9 से 2.9 अंक के 95% विश्वास अंतराल के साथ 2.4 अंक के अंतःक्रिया प्रभाव की रिपोर्ट करते हैं। प्रक्षेपवक्र-विशिष्ट संरेखण का समर्थन करने के लिए फेरबदल और स्थिति नियंत्रण की सूचना दी गई थी। तुलनात्मक सेटअप के लिए 12 में से 3 की तुलना में CompPO 12 पीपीओ-ग्रिड रन में से 10 में स्थिर था। जमे हुए मूल्यांकन पर, लेखक क्रमशः Qwen3-4B और Llama-3.1-8B-इंस्ट्रक्ट पर 4.3 और 3.9 लालची पास@1 मैक्रो पॉइंट के GRPO पर सुधार की रिपोर्ट करते हैं।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

परिणाम बड़े भाषा मॉडल के लिए सुदृढीकरण सीखने में एक व्यावहारिक बाधा को संबोधित करता है: यह तय करना कि लंबी प्रतिक्रिया के कौन से हिस्से अंतिम परिणाम के लिए श्रेय या दोष के पात्र हैं। लेखक ट्यून किए गए जीआरपीओ की तुलना में सुधार की रिपोर्ट करते हैं, लेकिन सबूत प्रीप्रिंट और प्रयोगों के सीमित सेट से आते हैं, इसलिए विधि की व्यापकता और परिचालन लागत अनिश्चित बनी हुई है।

भाषा मॉडल के लिए सुदृढीकरण सीखने को अंतिम पुरस्कार को कई व्यक्तिगत टोकन और मध्यवर्ती निर्णयों से जोड़ना चाहिए। एक प्रतिक्रिया में उपयोगी और अनुपयोगी चरण हो सकते हैं, लेकिन एक विधि जो संपूर्ण प्रतिक्रिया में समान परिणाम आँकड़े प्रसारित करती है वह कमजोर मार्गदर्शन प्रदान कर सकती है। पेपर का मुख्य दावा यह है कि मॉडल की अपनी गणना यह तय करने के लिए अधिक विशिष्ट संकेत प्रदान कर सकती है कि क्रेडिट एक टोकन से दूसरे टोकन तक कितनी मजबूती से बना रहना चाहिए।

यदि रिपोर्ट किया गया प्रभाव व्यापक सेटिंग्स में रहता है, तो वास्तुकला-जागरूक क्रेडिट ट्रांसपोर्ट एक अलग इनाम परिभाषा या नीति उद्देश्य की आवश्यकता के बिना सुदृढीकरण-शिक्षण अपडेट को अधिक लक्षित बना सकता है। यह मायने रखता है क्योंकि क्रेडिट असाइनमेंट में बदलाव को संभावित रूप से मौजूदा पीपीओ-शैली प्रशिक्षण पाइपलाइनों में शामिल किया जा सकता है। जीआरपीओ के साथ रिपोर्ट की गई तुलना वर्तमान एलएलएम सुदृढीकरण-सीखने के अभ्यास के लिए विशेष रूप से प्रासंगिक है क्योंकि यह प्रस्तावित पद्धति को नए मॉडल परिवार या उपयोगकर्ता-सामना वाले उत्पाद के बजाय प्रशिक्षण संकेत में बदलाव के रूप में तैयार करती है।

रिपोर्ट किए गए उच्छेदन उपयोगी हैं क्योंकि उनका सुझाव है कि परिणाम को केवल ध्यान-व्युत्पन्न द्वार या पुन: उपयोग किए गए आलोचक द्वारा समझाया नहीं जा सकता है। पूर्ण विधि ने आपूर्ति किए गए परिणामों में दोनों आंशिक वेरिएंट की तुलना में बेहतर प्रदर्शन किया, और लेखकों का कहना है कि फेरबदल और स्थिति नियंत्रण इस विचार का समर्थन करते हैं कि प्रक्षेपवक्र-विशिष्ट संरेखण मायने रखता है। स्थिरता तुलना एक संभावित व्यावहारिक लाभ की ओर भी इशारा करती है: कम अस्थिर रन व्यर्थ प्रशिक्षण प्रयासों को कम कर सकते हैं, हालांकि स्रोत गणना या लागत माप प्रदान नहीं करता है।

साक्ष्य को अभी भी प्रारंभिक शोध परिणाम के रूप में पढ़ा जाना चाहिए। स्रोत एक arXiv प्रीप्रिंट है, सहकर्मी-समीक्षित प्रकाशन नहीं है, और सार अंतर्निहित कार्यों, डेटासेट आकार, आधारभूत कार्यान्वयन विवरण, प्रशिक्षण बजट, या रिपोर्ट किए गए आत्मविश्वास अंतराल से परे सांख्यिकीय प्रक्रियाओं का वर्णन नहीं करता है। यह यह भी स्थापित नहीं करता है कि लाभ अतिरिक्त मेमोरी, विलंबता, इंजीनियरिंग जटिलता, या ध्यान पैटर्न के प्रति संवेदनशीलता के साथ आते हैं या नहीं। इसलिए विधि का सार्वजनिक प्रभाव इस बात पर निर्भर करता है कि क्या स्वतंत्र शोधकर्ता परिणामों को पुन: पेश कर सकते हैं और क्या दृष्टिकोण बड़े मॉडल और विभिन्न सुदृढीकरण-सीखने के उद्देश्यों में स्थानांतरित होता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

महत्वपूर्ण अगले परीक्षण स्वतंत्र प्रतिकृति, व्यापक मॉडल और कार्य कवरेज, और तुलनाएं हैं जिनमें प्रशिक्षण लागत, मेमोरी उपयोग और रनटाइम शामिल हैं। स्रोत यह स्थापित नहीं करता है कि क्या CompPO रिपोर्ट किए गए Qwen3-4B और Llama-3.1-8B-निर्देश मूल्यांकन से परे विश्वसनीय रूप से काम करता है या क्या इसका ध्यान-आधारित संकेत विभिन्न मॉडल आर्किटेक्चर में उपयोगी रहता है।

पहली प्राथमिकता पाँच Qwen3-4B बीजों और रिपोर्ट किए गए जमे हुए मूल्यांकनों से परे प्रतिकृति है। स्वतंत्र समूहों को अधिक मॉडल आकार, प्रशिक्षण कार्यों, इनाम संरचनाओं और भाषा-मॉडल आर्किटेक्चर पर विधि का परीक्षण करना चाहिए। स्रोत का नाम Qwen3-4B और Llama-3.1-8B-Instruct है, लेकिन यह नहीं बताता है कि क्या विधि का मूल्यांकन मॉडलों की एक विस्तृत श्रृंखला में किया गया था या क्या ध्यान संकेत अलग-अलग रूटिंग या ध्यान डिज़ाइन वाले आर्किटेक्चर में समान व्यवहार करता है।

शोधकर्ताओं को पूर्ण प्रशिक्षण ट्रेडऑफ़ को भी मापना चाहिए। पेपर में कहा गया है कि टीएसी दूसरे समान पैमाने के ट्रांसफार्मर के बिना अभिनेता की छिपी हुई स्थिति और रूटिंग जानकारी का पुन: उपयोग करता है, लेकिन स्रोत मेमोरी खपत, दीवार-घड़ी प्रशिक्षण समय, हार्डवेयर आवश्यकताओं या कुल गणना की मात्रा निर्धारित नहीं करता है। वे माप यह निर्धारित करेंगे कि रिपोर्ट की गई सटीकता और स्थिरता लाभ उन संगठनों के लिए व्यावहारिक हैं जो पहले से ही महंगी सुदृढीकरण-शिक्षण पाइपलाइन चला रहे हैं।

आगे के काम में यह जांचना चाहिए कि ध्यान-व्युत्पन्न अवधारण द्वार कितना मजबूत है। रिपोर्ट किए गए फेरबदल और स्थिति नियंत्रण प्रयोगों के भीतर प्रक्षेपवक्र-विशिष्ट संरेखण का समर्थन करते हैं, लेकिन स्रोत यह नहीं दिखाता है कि गेट लंबे संदर्भों, असामान्य तर्क निशान, विरल या शोर पुरस्कार, या संकेत और नमूने में परिवर्तन पर कैसे प्रतिक्रिया करता है। यह भी अज्ञात है कि क्या ध्यान एकाग्रता कम्प्यूटेशनल महत्व के लिए एक विश्वसनीय प्रॉक्सी है या परीक्षण किए गए विशेष मॉडल और कार्यों के लिए केवल एक उपयोगी संकेत है।

अंत में, प्रीप्रिंट के रूप में विधि की स्थिति मायने रखती है। स्रोत स्वतंत्र सत्यापन, उत्पादन परिनियोजन, कोड उपलब्धता, या सहकर्मी-समीक्षा परिणामों की रिपोर्ट नहीं करता है। वे चूक निष्कर्षों को अमान्य नहीं करती हैं, लेकिन वे प्रतिलिपि प्रस्तुत करने योग्यता और सामान्यीकरण के बारे में महत्वपूर्ण प्रश्नों को अनुत्तरित छोड़ देती हैं। एक मजबूत मामले के लिए जारी कार्यान्वयन विवरण, मिलान-लागत आधार रेखाएं, अतिरिक्त आर्किटेक्चर के परिणाम और इस बात के साक्ष्य की आवश्यकता होगी कि सुधार लेखकों के मूल्यांकन सेटअप के बाहर जारी रहते हैं।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याएआई प्रशिक्षणट्रांसफार्मरएआई का भविष्यआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?