समीपस्थ नीति अनुकूलन
समीपस्थ नीति अनुकूलन (पीपीओ) सुदृढीकरण सीखने का एल्गोरिदम है जो मानव प्रतिक्रिया से भाषा मॉडल को ठीक करने से जुड़ा हुआ है।
सिंहावलोकन
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
गहरा गोता
PPO को 2017 में OpenAI द्वारा पेश किया गया था और यह InstructGPT और ChatGPT जैसे सिस्टम के लिए RLHF के पीछे का सहयोगी बन गया। पॉलिसी-ग्रेडिएंट आरएल में मुख्य चुनौती यह है कि एक भी बहुत बड़ा अपडेट प्रदर्शन को ध्वस्त कर सकता है। पीपीओ इसे 'क्लिप्ड सरोगेट उद्देश्य' के साथ संबोधित करता है: यह मापता है कि पुरानी नीति की तुलना में किसी कार्रवाई की कितनी अधिक (या कम) संभावना है, उस अनुपात को लाभ से गुणा करता है (कार्रवाई अपेक्षा से कितनी बेहतर थी), और अनुपात को 0.8 से 1.2 जैसी छोटी सीमा में क्लिप करता है। यह निर्धारित करता है कि नीति प्रति अपडेट कितनी दूर तक जा सकती है, सीखने को स्थिर रखते हुए स्थिर सुधार की अनुमति दे सकती है। भाषा-मॉडल आरएलएचएफ में, 'कार्रवाई' एक टोकन या प्रतिक्रिया उत्पन्न कर रही है, इनाम एक इनाम मॉडल से आता है, और केएल-विचलन दंड मॉडल को उसके मूल व्यवहार से बहुत दूर जाने से रोकता है।
तकनीकी अंतर्दृष्टि
पीपीओ एक क्लिप किए गए उद्देश्य को अधिकतम करता है: न्यूनतम (अनुपात * लाभ, क्लिप (अनुपात, 1-ईपीएस, 1+ईपीएस) * लाभ), जहां अनुपात नई-पुरानी कार्रवाई संभावना है। लाभ का अनुमान आमतौर पर सामान्यीकृत लाभ अनुमान और एक सीखे हुए मूल्य (आलोचक) नेटवर्क के साथ लगाया जाता है। आरएलएचएफ में, कुल इनाम संदर्भ नीति के खिलाफ प्रति-टोकन केएल दंड के साथ इनाम-मॉडल स्कोर को जोड़ता है, मूल मॉडल के करीब रहने के खिलाफ इनाम लाभ को संतुलित करता है।
सामरिक प्रभाव
गति और पैमाना
भाषा वर्कफ़्लो निरंतरता से समझौता किए बिना तेज़ी से आगे बढ़ सकता है।
पहुंच और पहुंच
यह सभी भाषाओं और संचार शैलियों तक पहुंच का विस्तार करता है।
स्पष्ट निर्णय
टीमें निर्णय लेने में अधिक समय व्यतीत कर सकती हैं जबकि स्वचालन पुनरावृत्ति को संभालता है।
समीपस्थ नीति अनुकूलन का भविष्य
पीपीओ मजबूत बना हुआ है, लेकिन कुख्यात है: इसे एक अलग मूल्य नेटवर्क, सावधानीपूर्वक हाइपरपैरामीटर ट्यूनिंग और बहुत सारी गणना की आवश्यकता है। डीपीओ (बिल्कुल भी आरएल नहीं) और जीआरपीओ सहित सरल विकल्प जोर पकड़ रहे हैं, जो नमूना प्रतिक्रियाओं के समूहों से लाभ का अनुमान लगाकर मूल्य नेटवर्क को गिरा देता है और हाल के तर्क मॉडल को संचालित करता है। पीपीओ वहां बना रहेगा जहां ऑन-पॉलिसी अन्वेषण वास्तव में मदद करता है, लेकिन क्षेत्र सक्रिय रूप से सस्ते तरीकों के लिए अपनी कुछ जटिलताओं का व्यापार कर रहा है।
वास्तविक विश्व कार्यान्वयन
RLHF के माध्यम से निर्देशों और मानवीय प्राथमिकताओं का पालन करने के लिए InstructGPT और ChatGPT को फाइन-ट्यूनिंग करें
प्रशिक्षण गेम-प्लेइंग और रोबोटिक्स नियंत्रण एजेंट, भाषा मॉडल से पहले पीपीओ का मूल डोमेन
केएल बाधा के तहत इनाम-मॉडल स्कोर को अधिकतम करके विषाक्तता को कम करना या सहायकता में सुधार करना
टूल-उपयोग या मल्टी-स्टेप एजेंट व्यवहार को अनुकूलित करना जहां किसी मॉडल को कार्यों को सही ढंग से पूरा करने के लिए पुरस्कृत किया जाता है
जोखिम और रेलिंग
मतिभ्रम वाले तथ्य चुपचाप रिपोर्ट में प्रवेश कर सकते हैं, प्रवाह का समर्थन कर सकते हैं, या अनुसंधान आउटपुट का समर्थन कर सकते हैं।
त्वरित संवेदनशीलता समान अनुरोधों में असंगत परिणाम पैदा कर सकती है।
यदि पहुंच नियंत्रण कमजोर हैं तो संवेदनशील पाठ डेटा उजागर हो सकता है।
कार्यान्वयन रोडमैप
रोलआउट से पहले आउटपुट स्वरूप, टोन और गुणवत्ता मानकों को परिभाषित करें।
जब भी सटीकता मायने रखती है तो विश्वसनीय स्रोतों के साथ जमीनी प्रतिक्रियाएँ।
उच्च जोखिम वाले आउटपुट के लिए एक मानव समीक्षा चेकपॉइंट रखें।
विफलता पैटर्न को ट्रैक करें और संकेतों या वर्कफ़्लो को नियमित रूप से पुनः प्रशिक्षित करें।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
समूह सापेक्ष नीति अनुकूलन
अक्सर पूछे जाने वाले प्रश्नों
What is Proximal Policy Optimization?
समीपस्थ नीति अनुकूलन (पीपीओ) सुदृढीकरण सीखने का एल्गोरिदम है जो मानव प्रतिक्रिया से भाषा मॉडल को ठीक करने से जुड़ा हुआ है। यह उस अस्थिरता से बचने के लिए सावधानीपूर्वक, छोटे कदमों से एक नीति में सुधार करता है जो भोली-भाली नीति ढाल विधियों को प्रभावित करती है।
पीपीओ की 'क्लिपिंग' मुख्य रूप से किस समस्या का समाधान करती है?
संभाव्यता अनुपात को क्लिप करने से किसी भी एक अद्यतन को नीति को बहुत दूर ले जाने से रोका जा सकता है, जो नीति-क्रमिक तरीकों में अस्थिरता का मुख्य स्रोत है।
पीपीओ के साथ भाषा-मॉडल आरएलएचएफ में, इनाम संकेत आमतौर पर कहां से आता है?
एक इनाम मॉडल उत्पन्न प्रतिक्रियाओं के लिए स्केलर इनाम प्रदान करता है, क्योंकि आरएल के दौरान मनुष्यों को हर आउटपुट स्कोर करना असंभव होगा।
पीपीओ-आधारित आरएलएचएफ में केएल-डाइवर्जेंस जुर्माना क्या करता है?
मूल (संदर्भ) नीति के विरुद्ध प्रति टोकन केएल जुर्माना मॉडल को इनाम का पीछा करते समय अपने व्यवहार को बहुत अधिक बदलने से हतोत्साहित करता है।
पीपीओ में वैल्यू (आलोचक) नेटवर्क की क्या भूमिका है?
पीपीओ एक अभिनेता-आलोचक पद्धति है; मूल्य नेटवर्क अपेक्षित इनाम का अनुमान लगाता है, लाभ अनुमान (अक्सर जीएई के माध्यम से) को सक्षम करता है जो भिन्नता को कम करता है।
पीपीओ में 'लाभ' क्या दर्शाता है?
लाभ यह मापता है कि चुनी गई कार्रवाई मूल्य अनुमान के सापेक्ष कितनी बेहतर (या बदतर) थी, यह नीति को बताता है कि किन कार्यों को सुदृढ़ करना है।