बुनियादी गाइड

आरएलएचएफ में समूहीकृत पुरस्कार सामान्यीकरण

समूहीकृत इनाम सामान्यीकरण एक ही संकेत पर प्रतिक्रियाओं के एक बैच के भीतर एक मॉडल के पुरस्कारों को मानकीकृत करता है, जो शोर स्कोर को एक स्थिर प्रशिक्षण संकेत में बदल देता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

यह जीआरपीओ के पीछे की मुख्य चाल है, एल्गोरिदम जो कई आधुनिक तर्क मॉडलों को शक्ति प्रदान करता है।

गहरा गोता

मानव प्रतिक्रिया (आरएलएचएफ) से सुदृढीकरण सीखने में, एक मॉडल प्रतिक्रियाएं उत्पन्न करता है और एक इनाम मॉडल उन्हें स्कोर करता है, लेकिन कच्चे पुरस्कार शोर होते हैं और संकेतों में बेतहाशा भिन्न होते हैं। समूहीकृत इनाम सामान्यीकरण एक ही संकेत पर कई प्रतिक्रियाओं के समूह का नमूना लेकर इसे ठीक करता है, फिर समूह के माध्य को घटाकर और समूह के मानक विचलन से विभाजित करके प्रत्येक इनाम को सामान्य करता है। यह z-स्कोर लाभ बन जाता है। यह दृष्टिकोण डीपसीक द्वारा प्रस्तुत ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (जीआरपीओ) का केंद्र है, जिसने डीपसीक-आर1 के तर्क को प्रसिद्ध रूप से संचालित किया। महत्वपूर्ण रूप से, जीआरपीओ पीपीओ द्वारा उपयोग किए जाने वाले अलग-अलग मूल्य नेटवर्क (आलोचक) को समाप्त कर देता है, क्योंकि समूह औसत आधार रेखा के रूप में कार्य करता है। यह ग्रेडिएंट सिग्नल को अच्छी तरह से स्केल रखते हुए प्रशिक्षण को सरल, सस्ता और अधिक मेमोरी-कुशल बनाता है।

तकनीकी अंतर्दृष्टि

पुरस्कार r_1...r_G वाले आउटपुट के समूह के लिए, लाभ A_i = (r_i - माध्य(r)) / std(r) है। अपने समूह के औसत से बेहतर प्रतिक्रियाओं को सकारात्मक लाभ मिलता है और उन्हें बल मिलता है; औसत से भी बदतर लोगों को नीचे धकेल दिया जाता है। क्योंकि तुलना एक त्वरित, पूर्ण इनाम पैमाने और प्रति-संकेत कठिनाई के भीतर सापेक्ष होती है, जिससे भिन्नता कम हो जाती है। जीआरपीओ मॉडल को बहुत दूर जाने से रोकने के लिए पीपीओ के कटे हुए उद्देश्य और केएल दंड को एक संदर्भ नीति के विरुद्ध रखता है।

सामरिक प्रभाव

स्पष्ट निर्णय

यह आपको स्पष्ट तकनीकी दावों को मार्केटिंग भाषा से अलग करने में मदद करता है।

लागत और बजट

आप पैसा या समय खर्च करने से पहले बेहतर कार्यान्वयन संबंधी प्रश्न पूछ सकते हैं।

टीम और वर्कफ़्लो

साझा समझ वाली टीमें बेहतर उत्पाद, नीति और सीखने के निर्णय लेती हैं।

आरएलएचएफ में समूहीकृत पुरस्कार सामान्यीकरण का भविष्य

समूहीकृत सामान्यीकरण तर्क-मॉडल उछाल को बढ़ावा दे रहा है, जहां मॉडल किसी विद्वान आलोचक के बिना सही गणित के उत्तर जैसे सत्यापन योग्य पुरस्कारों से सीखते हैं। अनुसंधान इसे परिष्कृत कर रहा है: मानक विचलन द्वारा विभाजित किया जाए या नहीं, इस पर बहस, शून्य लाभ उत्पन्न करने वाले सभी-सही या सभी-गलत समूहों को संभालना, और समूह के आकार को बढ़ाना। समूहीकृत, आलोचना-मुक्त तरीकों को एजेंटिक टूल के उपयोग और कोड जनरेशन तक फैलाने की अपेक्षा करें, जहां स्वचालित सत्यापनकर्ता सस्ते, प्रचुर मात्रा में इनाम सिग्नल प्रदान करते हैं।

वास्तविक विश्व कार्यान्वयन

प्रति समस्या 16 समाधानों का नमूना लेकर और समूह की औसत शुद्धता से ऊपर वालों को पुरस्कृत करके गणित-तर्क मॉडल का प्रशिक्षण।

प्रत्येक उपयोगकर्ता के संकेत पर कई उम्मीदवारों के उत्तरों में इनाम-मॉडल स्कोर को सामान्य करके चैटबॉट की उपयोगिता को ठीक करना।

एक कोडिंग सहायक में सुधार करना जहां प्रत्येक नमूना समाधान को इस आधार पर स्कोर किया जाता है कि क्या यह इकाई परीक्षण पास करता है, फिर समूह के भीतर सामान्यीकृत किया जाता है।

पीपीओ क्रिटिक नेटवर्क को हटाकर और इसके बजाय समूह माध्य को आधार रेखा के रूप में उपयोग करके आरएलएचएफ पाइपलाइन में जीपीयू मेमोरी को कम करना।

जोखिम और रेलिंग

अलग-अलग टीमें एक ही शब्द का अलग-अलग इस्तेमाल कर सकती हैं, इसलिए दायरे को पहले ही परिभाषित कर लें।

बेंचमार्क मजबूत दिख सकते हैं जबकि वास्तविक दुनिया का प्रदर्शन असमान है।

डेटा गुणवत्ता और मूल्यांकन योजनाओं की अनदेखी अक्सर नाजुक परिणाम पैदा करती है।

कार्यान्वयन रोडमैप

1

आपको जिस परिणाम की आवश्यकता है उसकी सरल भाषा में परिभाषा से शुरुआत करें।

2

परीक्षण से पहले एक सफलता मीट्रिक और एक विफलता स्थिति चुनें।

3

प्रतिनिधि डेटा के साथ एक छोटा पायलट चलाएँ, न कि एक परिष्कृत डेमो सेट।

4

दस्तावेज़ जहां आरएलएचएफ में समूहीकृत पुरस्कार सामान्यीकरण मदद करता है और जहां सरल तरीके बेहतर हैं।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped Reward Normalization in RLHF quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

वरीयता अनुकूलन में लंबाई सामान्यीकरण

अक्सर पूछे जाने वाले प्रश्नों

आरएलएचएफ में समूहीकृत पुरस्कार सामान्यीकरण क्या है?

समूहीकृत इनाम सामान्यीकरण एक ही संकेत पर प्रतिक्रियाओं के एक बैच के भीतर एक मॉडल के पुरस्कारों को मानकीकृत करता है, जो शोर स्कोर को एक स्थिर प्रशिक्षण संकेत में बदल देता है। यह जीआरपीओ के पीछे की मुख्य चाल है, एल्गोरिदम जो कई आधुनिक तर्क मॉडलों को शक्ति प्रदान करता है।

समूहीकृत इनाम सामान्यीकरण में, प्रत्येक प्रतिक्रिया के इनाम की तुलना किससे की जाती है?

प्रत्येक पुरस्कार को एक ही संकेत पर प्रतिक्रियाओं के समूह के माध्य और मानक विचलन का उपयोग करके z-स्कोर में परिवर्तित किया जाता है।

कौन सा एल्गोरिदम समूहीकृत इनाम सामान्यीकरण से सबसे अधिक जुड़ा हुआ है?

GRPO, DeepSeek द्वारा प्रस्तुत किया गया और DeepSeek-R1 में उपयोग किया गया, एक समूह के भीतर पुरस्कारों को सामान्य बनाने के लिए बनाया गया है।

जीआरपीओ मानक पीपीओ के किस घटक को विशेष रूप से समाप्त करता है?

आधार रेखा के रूप में समूह औसत का उपयोग करके, जीआरपीओ स्मृति और गणना को बचाते हुए, विद्वान आलोचक को हटा देता है।

उस प्रतिक्रिया का क्या होता है जिसका इनाम उसके समूह के औसत से कम है?

समूह माध्य को घटाने से औसत से नीचे की प्रतिक्रियाओं का नकारात्मक लाभ होता है, जिससे नीति उनसे दूर हो जाती है।

समूह के भीतर सामान्यीकरण प्रशिक्षण भिन्नता को कम क्यों करता है?

चूँकि तुलनाएँ प्रत्येक संकेत के भीतर सापेक्ष होती हैं, निरपेक्ष पैमाने और त्वरित कठिनाई में अंतर दूर हो जाता है।