तकनीकी गाइड

समूह सापेक्ष नीति अनुकूलन

समूह सापेक्ष नीति अनुकूलन (जीआरपीओ) भाषा मॉडल को ठीक करने के लिए एक सुदृढीकरण-सीखने की विधि है जो पीपीओ द्वारा उपयोग किए जाने वाले अलग-अलग मूल्य नेटवर्क को समाप्त करते हुए, एक ही संकेत के लिए भाई-बहन के उत्तरों के समूह के खिलाफ प्रत्येक उत्तर का मूल्यांकन करता है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

It became famous as the core training trick behind DeepSeek's reasoning models.

गहरा गोता

जीआरपीओ नीति-क्रमिक सुदृढीकरण सीखने का एक प्रकार है जिसे बड़े भाषा मॉडल के आरएल फाइन-ट्यूनिंग को सस्ता और अधिक स्थिर बनाने के लिए डिज़ाइन किया गया है। प्रत्येक टोकन कितना अच्छा है, इसका अनुमान लगाने के लिए मानक पीपीओ को एक विद्वान 'आलोचक' (मूल्य मॉडल) की आवश्यकता होती है, जो लगभग नीति जितना ही बड़ा हो। जीआरपीओ उस आलोचक को पूरी तरह से हटा देता है। प्रत्येक संकेत के लिए यह पूर्णताओं के एक समूह का नमूना लेता है (मान लीजिए 8-64), उन सभी को एक इनाम संकेत के साथ स्कोर करता है, और फिर समूह के माध्य और मानक विचलन के विरुद्ध उसके इनाम को मानकीकृत करके प्रत्येक पूर्णता के लाभ की गणना करता है। औसत से ऊपर वाले उत्तरों पर ज़ोर दिया जाता है और औसत से नीचे वाले उत्तरों को दबा दिया जाता है। केएल-डाइवर्जेंस शब्द मॉडल को संदर्भ नीति के करीब रखता है। डीपसीक द्वारा प्रस्तुत, यह डीपसीकमैथ और डीपसीक-आर1 रीज़निंग मॉडल को संचालित करता है।

तकनीकी अंतर्दृष्टि

मुख्य विचार पीपीओ की सीखी गई मूल्य आधार रेखा को मोंटे कार्लो समूह आधार रेखा से बदलना है। पुरस्कार r_i वाले आउटपुट के समूह के लिए, प्रत्येक लाभ A_i = (r_i - माध्य(r)) / std(r) है। वह सामान्यीकृत स्कोर क्लिप किए गए संभाव्यता अनुपात को गुणा करता है, बिल्कुल पीपीओ की तरह, और एक जमे हुए संदर्भ मॉडल के खिलाफ केएल जुर्माना बहाव पर अंकुश लगाता है। क्योंकि कोई भी आलोचक प्रशिक्षित नहीं है, स्मृति और गणना लगभग आधी हो जाती है, और प्रति-संकेत सामान्यीकरण स्वाभाविक रूप से स्केल किए गए, कम-विचरण वाले लाभ देता है।

सामरिक प्रभाव

लागत और बजट

वास्तुकला संबंधी निर्णय वर्षों तक प्रदर्शन और परिचालन लागत को संचालित करते हैं।

स्पष्ट निर्णय

तकनीकी शिक्षा टीमों को सही स्टैक चुनने में मदद करती है, न कि केवल नवीनतम स्टैक चुनने में।

गुणवत्ता नियंत्रण

बेहतर इंजीनियरिंग विकल्प उत्पादन में विश्वसनीयता की घटनाओं को कम करते हैं।

समूह सापेक्ष नीति अनुकूलन का भविष्य

जीआरपीओ तेजी से खुले तर्क मॉडल के प्रशिक्षण के लिए एक डिफ़ॉल्ट नुस्खा बन गया है, और प्रयोगशालाएं इसके कमजोर बिंदुओं पर पुनरावृत्ति कर रही हैं। शोधकर्ता लंबाई और कठिनाई पूर्वाग्रहों (जैसे कि डॉ. जीआरपीओ), अनुक्रम-स्तर सामान्यीकरण के बजाय टोकन-स्तर, और केएल शब्द को हटाने या दोबारा आकार देने के समाधान की खोज कर रहे हैं। सत्यापन योग्य पुरस्कारों (गणित, कोड, उपकरण का उपयोग), विरल संकेतों की बेहतर हैंडलिंग और एजेंटिक, बहु-चरणीय कार्यों के लिए हल्के आलोचकों के साथ समूह आधार रेखाओं को संयोजित करने वाले हाइब्रिड के साथ सख्त एकीकरण की अपेक्षा करें।

वास्तविक विश्व कार्यान्वयन

गणित की समस्याओं पर नियम-आधारित शुद्धता पुरस्कारों का उपयोग करके लंबी श्रृंखला-विचार तर्क उत्पन्न करने के लिए डीपसीक-आर1 और डीपसीकमैथ को प्रशिक्षण देना

कोड-जेनरेशन मॉडल को फाइन-ट्यूनिंग करना जहां प्रत्येक नमूना समाधान को इस आधार पर स्कोर किया जाता है कि क्या यह इकाई परीक्षण पास करता है, और विजेताओं को चुनने के लिए समूह को सामान्यीकृत किया जाता है

एक अलग मूल्य नेटवर्क के लिए भुगतान किए बिना चैट मॉडल को संरेखित करने के लिए जीआरपीओ का उपयोग करते हुए ओपन-सोर्स आरएलएचएफ पाइपलाइन (उदाहरण के लिए, टीआरएल और वर्ल लाइब्रेरी में)

प्रति संकेत कई प्रतिक्रियाओं का नमूना लेकर निर्देश-पालन या सुरक्षा व्यवहार में सुधार करना और उन लोगों को पुरस्कृत करना जो उनके साथियों की तुलना में सबसे अधिक पुरस्कार मॉडल दर हैं।

जोखिम और रेलिंग

एक बेंचमार्क को अनुकूलित करने से व्यापक सिस्टम कमजोरियों को छुपाया जा सकता है।

बुनियादी ढांचे और रखरखाव की लागत को अक्सर कम करके आंका जाता है।

जैसे-जैसे सिस्टम अधिक जटिल होते जाएंगे सुरक्षा और अवलोकन संबंधी अंतराल बढ़ सकते हैं।

कार्यान्वयन रोडमैप

1

कार्यान्वयन से पहले विलंबता, गुणवत्ता और लागत लक्ष्य परिभाषित करें।

2

यथार्थवादी लोड और डेटा स्थितियों के तहत बेंचमार्क।

3

त्रुटियों, बहाव और उपयोगकर्ता प्रभाव के लिए उपकरण निगरानी।

4

स्केलिंग से पहले रोलबैक और घटना प्रतिक्रिया पथ तैयार करें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अक्सर पूछे जाने वाले प्रश्नों

What is Group Relative Policy Optimization?

समूह सापेक्ष नीति अनुकूलन (जीआरपीओ) भाषा मॉडल को ठीक करने के लिए एक सुदृढीकरण-सीखने की विधि है जो पीपीओ द्वारा उपयोग किए जाने वाले अलग-अलग मूल्य नेटवर्क को समाप्त करते हुए, एक ही संकेत के लिए भाई-बहन के उत्तरों के समूह के खिलाफ प्रत्येक उत्तर का मूल्यांकन करता है। यह डीपसीक के तर्क मॉडल के पीछे मुख्य प्रशिक्षण चाल के रूप में प्रसिद्ध हो गया।

जीआरपीओ पीपीओ के किस प्रमुख घटक को समाप्त करता है?

जीआरपीओ का हस्ताक्षर परिवर्तन पीपीओ के सीखे गए मूल्य/आलोचक मॉडल को गिरा रहा है, जो आम तौर पर पॉलिसी के समान आकार का होता है, जिससे पर्याप्त मेमोरी और गणना की बचत होती है।

जीआरपीओ किसी दिए गए पूर्णता के लिए लाभ की गणना कैसे करता है?

प्रत्येक पूर्णता का लाभ (इनाम - समूह माध्य)/समूह मानक विचलन है, इसलिए समान संकेत के उत्तरों का समूह आधार रेखा के रूप में कार्य करता है।

किन मॉडलों ने GRPO को प्रसिद्ध बनाया?

GRPO को DeepSeek द्वारा पेश किया गया और लोकप्रिय बनाया गया, विशेष रूप से DeepSeekMath में और DeepSeek-R1 रीज़निंग मॉडल के पीछे RL इंजन के रूप में।

जीआरपीओ में केएल-डाइवर्जेंस शब्द क्या भूमिका निभाता है?

एक संदर्भ (आमतौर पर प्री-आरएल) मॉडल के खिलाफ केएल जुर्माना प्रशिक्षण को नियमित करता है ताकि नीति खराब हुए बिना या ख़राब आउटपुट में बहे बिना सुधार हो।

गणित या कोड पर तर्क मॉडल के प्रशिक्षण के लिए जीआरपीओ विशेष रूप से आकर्षक क्यों है?

कई समाधानों का नमूना लेना और उन्हें स्वचालित शुद्धता जांच के साथ स्कोर करना, जीआरपीओ के समूह-सामान्यीकृत लाभों के साथ स्पष्ट रूप से जुड़ जाता है, किसी आलोचक की आवश्यकता नहीं होती है।