आरएलएचएफ में समूहीकृत पुरस्कार सामान्यीकरण
समूहीकृत इनाम सामान्यीकरण एक ही संकेत पर प्रतिक्रियाओं के एक बैच के भीतर एक मॉडल के पुरस्कारों को मानकीकृत करता है, जो शोर स्कोर को एक स्थिर प्रशिक्षण संकेत में बदल देता है।
सिंहावलोकन
यह जीआरपीओ के पीछे की मुख्य चाल है, एल्गोरिदम जो कई आधुनिक तर्क मॉडलों को शक्ति प्रदान करता है।
गहरा गोता
मानव प्रतिक्रिया (आरएलएचएफ) से सुदृढीकरण सीखने में, एक मॉडल प्रतिक्रियाएं उत्पन्न करता है और एक इनाम मॉडल उन्हें स्कोर करता है, लेकिन कच्चे पुरस्कार शोर होते हैं और संकेतों में बेतहाशा भिन्न होते हैं। समूहीकृत इनाम सामान्यीकरण एक ही संकेत पर कई प्रतिक्रियाओं के समूह का नमूना लेकर इसे ठीक करता है, फिर समूह के माध्य को घटाकर और समूह के मानक विचलन से विभाजित करके प्रत्येक इनाम को सामान्य करता है। यह z-स्कोर लाभ बन जाता है। यह दृष्टिकोण डीपसीक द्वारा प्रस्तुत ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (जीआरपीओ) का केंद्र है, जिसने डीपसीक-आर1 के तर्क को प्रसिद्ध रूप से संचालित किया। महत्वपूर्ण रूप से, जीआरपीओ पीपीओ द्वारा उपयोग किए जाने वाले अलग-अलग मूल्य नेटवर्क (आलोचक) को समाप्त कर देता है, क्योंकि समूह औसत आधार रेखा के रूप में कार्य करता है। यह ग्रेडिएंट सिग्नल को अच्छी तरह से स्केल रखते हुए प्रशिक्षण को सरल, सस्ता और अधिक मेमोरी-कुशल बनाता है।
तकनीकी अंतर्दृष्टि
पुरस्कार r_1...r_G वाले आउटपुट के समूह के लिए, लाभ A_i = (r_i - माध्य(r)) / std(r) है। अपने समूह के औसत से बेहतर प्रतिक्रियाओं को सकारात्मक लाभ मिलता है और उन्हें बल मिलता है; औसत से भी बदतर लोगों को नीचे धकेल दिया जाता है। क्योंकि तुलना एक त्वरित, पूर्ण इनाम पैमाने और प्रति-संकेत कठिनाई के भीतर सापेक्ष होती है, जिससे भिन्नता कम हो जाती है। जीआरपीओ मॉडल को बहुत दूर जाने से रोकने के लिए पीपीओ के कटे हुए उद्देश्य और केएल दंड को एक संदर्भ नीति के विरुद्ध रखता है।
सामरिक प्रभाव
स्पष्ट निर्णय
यह आपको स्पष्ट तकनीकी दावों को मार्केटिंग भाषा से अलग करने में मदद करता है।
लागत और बजट
आप पैसा या समय खर्च करने से पहले बेहतर कार्यान्वयन संबंधी प्रश्न पूछ सकते हैं।
टीम और वर्कफ़्लो
साझा समझ वाली टीमें बेहतर उत्पाद, नीति और सीखने के निर्णय लेती हैं।
आरएलएचएफ में समूहीकृत पुरस्कार सामान्यीकरण का भविष्य
समूहीकृत सामान्यीकरण तर्क-मॉडल उछाल को बढ़ावा दे रहा है, जहां मॉडल किसी विद्वान आलोचक के बिना सही गणित के उत्तर जैसे सत्यापन योग्य पुरस्कारों से सीखते हैं। अनुसंधान इसे परिष्कृत कर रहा है: मानक विचलन द्वारा विभाजित किया जाए या नहीं, इस पर बहस, शून्य लाभ उत्पन्न करने वाले सभी-सही या सभी-गलत समूहों को संभालना, और समूह के आकार को बढ़ाना। समूहीकृत, आलोचना-मुक्त तरीकों को एजेंटिक टूल के उपयोग और कोड जनरेशन तक फैलाने की अपेक्षा करें, जहां स्वचालित सत्यापनकर्ता सस्ते, प्रचुर मात्रा में इनाम सिग्नल प्रदान करते हैं।
वास्तविक विश्व कार्यान्वयन
प्रति समस्या 16 समाधानों का नमूना लेकर और समूह की औसत शुद्धता से ऊपर वालों को पुरस्कृत करके गणित-तर्क मॉडल का प्रशिक्षण।
प्रत्येक उपयोगकर्ता के संकेत पर कई उम्मीदवारों के उत्तरों में इनाम-मॉडल स्कोर को सामान्य करके चैटबॉट की उपयोगिता को ठीक करना।
एक कोडिंग सहायक में सुधार करना जहां प्रत्येक नमूना समाधान को इस आधार पर स्कोर किया जाता है कि क्या यह इकाई परीक्षण पास करता है, फिर समूह के भीतर सामान्यीकृत किया जाता है।
पीपीओ क्रिटिक नेटवर्क को हटाकर और इसके बजाय समूह माध्य को आधार रेखा के रूप में उपयोग करके आरएलएचएफ पाइपलाइन में जीपीयू मेमोरी को कम करना।
जोखिम और रेलिंग
अलग-अलग टीमें एक ही शब्द का अलग-अलग इस्तेमाल कर सकती हैं, इसलिए दायरे को पहले ही परिभाषित कर लें।
बेंचमार्क मजबूत दिख सकते हैं जबकि वास्तविक दुनिया का प्रदर्शन असमान है।
डेटा गुणवत्ता और मूल्यांकन योजनाओं की अनदेखी अक्सर नाजुक परिणाम पैदा करती है।
कार्यान्वयन रोडमैप
आपको जिस परिणाम की आवश्यकता है उसकी सरल भाषा में परिभाषा से शुरुआत करें।
परीक्षण से पहले एक सफलता मीट्रिक और एक विफलता स्थिति चुनें।
प्रतिनिधि डेटा के साथ एक छोटा पायलट चलाएँ, न कि एक परिष्कृत डेमो सेट।
दस्तावेज़ जहां आरएलएचएफ में समूहीकृत पुरस्कार सामान्यीकरण मदद करता है और जहां सरल तरीके बेहतर हैं।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped Reward Normalization in RLHF quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
वरीयता अनुकूलन में लंबाई सामान्यीकरण
अक्सर पूछे जाने वाले प्रश्नों
आरएलएचएफ में समूहीकृत पुरस्कार सामान्यीकरण क्या है?
समूहीकृत इनाम सामान्यीकरण एक ही संकेत पर प्रतिक्रियाओं के एक बैच के भीतर एक मॉडल के पुरस्कारों को मानकीकृत करता है, जो शोर स्कोर को एक स्थिर प्रशिक्षण संकेत में बदल देता है। यह जीआरपीओ के पीछे की मुख्य चाल है, एल्गोरिदम जो कई आधुनिक तर्क मॉडलों को शक्ति प्रदान करता है।
समूहीकृत इनाम सामान्यीकरण में, प्रत्येक प्रतिक्रिया के इनाम की तुलना किससे की जाती है?
प्रत्येक पुरस्कार को एक ही संकेत पर प्रतिक्रियाओं के समूह के माध्य और मानक विचलन का उपयोग करके z-स्कोर में परिवर्तित किया जाता है।
कौन सा एल्गोरिदम समूहीकृत इनाम सामान्यीकरण से सबसे अधिक जुड़ा हुआ है?
GRPO, DeepSeek द्वारा प्रस्तुत किया गया और DeepSeek-R1 में उपयोग किया गया, एक समूह के भीतर पुरस्कारों को सामान्य बनाने के लिए बनाया गया है।
जीआरपीओ मानक पीपीओ के किस घटक को विशेष रूप से समाप्त करता है?
आधार रेखा के रूप में समूह औसत का उपयोग करके, जीआरपीओ स्मृति और गणना को बचाते हुए, विद्वान आलोचक को हटा देता है।
उस प्रतिक्रिया का क्या होता है जिसका इनाम उसके समूह के औसत से कम है?
समूह माध्य को घटाने से औसत से नीचे की प्रतिक्रियाओं का नकारात्मक लाभ होता है, जिससे नीति उनसे दूर हो जाती है।
समूह के भीतर सामान्यीकरण प्रशिक्षण भिन्नता को कम क्यों करता है?
चूँकि तुलनाएँ प्रत्येक संकेत के भीतर सापेक्ष होती हैं, निरपेक्ष पैमाने और त्वरित कठिनाई में अंतर दूर हो जाता है।