የፕሮክሲማል ፖሊሲ ማመቻቸት
Proximal Policy Optimization (PPO) የማጠናከሪያ ትምህርት ስልተ-ቀመር ነው በጣም ከጥሩ ማስተካከያ የቋንቋ ሞዴሎች ከሰዎች አስተያየት።
አጠቃላይ እይታ
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
ጥልቅ ዳይቭ
PPO በOpenAI አስተዋውቋል በ2017 እና እንደ InstructGPT እና ChatGPT ላሉ ስርዓቶች ከRLHF ጀርባ የስራ ፈረስ ሆነ። በፖሊሲ-ግራዲየንት RL ውስጥ ያለው ዋናው ፈተና አንድ ከመጠን በላይ ትልቅ ማሻሻያ አፈፃፀሙን ሊያበላሽ ይችላል። PPO ይህንን 'የተቀነጠቀ ተተኪ ዓላማ' ጋር ያብራራል፡ አንድ ድርጊት ምን ያህል (ወይም ያነሰ) ሊሆን እንደሚችል ከቀድሞው ፖሊሲ ጋር እንደሚቃረን ይለካል፣ ያንን ጥምርታ በጥቅሙ ያባዛል (እርምጃው ከተጠበቀው በምን ያህል የተሻለ ነበር) እና ሬሾውን ከ 0.8 እስከ 1.2 ካለው ትንሽ ክልል ጋር ይቆርጠዋል። ይህ ፖሊሲው በእያንዳንዱ ማሻሻያ ምን ያህል ርቀት እንደሚራመድ ያሳያል፣ ይህም የተረጋጋ መሻሻልን በመፍቀድ መማርን ይቀጥላል። በቋንቋ-ሞዴል RLHF፣ 'እርምጃው' ምልክት ወይም ምላሽ እያስገኘ ነው፣ ሽልማቱ ከሽልማት ሞዴል ይመጣል፣ እና የKL-divergence ቅጣት ሞዴሉን ከመጀመሪያው ባህሪው በጣም ርቆ እንዳይሄድ ያደርገዋል።
ቴክኒካዊ ግንዛቤ
PPO የተቀነጨበ ዓላማን ያሳድጋል፡- ደቂቃ(ሬሾ * ጥቅም፣ ቅንጥብ(ሬሾ፣ 1-eps፣ 1+eps) * ጥቅም)፣ ሬሾው ከአዲሱ በላይ የቆየ የተግባር እድል ነው። ጥቅማ ጥቅሞች ብዙውን ጊዜ የሚገመተው በጠቅላላ ጥቅም ግምት እና በተማረ እሴት (ሃያሲ) አውታረ መረብ ነው። በ RLHF ውስጥ፣ አጠቃላይ ሽልማቱ የሽልማት-ሞዴሉን ነጥብ ከአንድ የ KL ቅጣት ጋር በማጣመር ከዋናው ሞዴል ጋር በመቅረብ የሽልማት ትርፍን በማመጣጠን።
ስልታዊ ተጽእኖ
ፍጥነት እና ልኬት
የቋንቋ የስራ ፍሰቶች ወጥነትን ሳያጠፉ በፍጥነት ሊንቀሳቀሱ ይችላሉ።
መድረስ እና መድረስ
በቋንቋዎች እና በመግባቢያ ዘይቤዎች ተደራሽነትን ያሰፋዋል።
ግልጽ ውሳኔዎች
አውቶሜሽን ድግግሞሹን ሲቆጣጠር ቡድኖች በፍርድ ላይ ብዙ ጊዜ ሊያጠፉ ይችላሉ።
የወደፊቱ የፕሮክሲማል ፖሊሲ ማመቻቸት
ፒፒኦ ጠንካራ ሆኖ ይቆያል ነገር ግን በታማኝነት የሚታወቅ ነው፡ የተለየ የእሴት ኔትወርክ፣ ጥንቃቄ የተሞላበት የሃይፐርፓራሜትር ማስተካከያ እና ብዙ ስሌት ያስፈልገዋል። ከናሙና ከተነሱ ምላሾች ቡድኖች ጥቅማጥቅሞችን በመገመት የእሴት ኔትወርኩን የሚጥለው እና የቅርብ ጊዜ የማመዛዘን ሞዴሎችን የፈጠረውን DPO (በፍፁም RL የለም) እና GRPOን ጨምሮ ቀለል ያሉ አማራጮች መሬት እያገኙ ነው። በፖሊሲ ላይ የሚደረግ ጥናት በእውነት በሚረዳበት ቦታ PPO ይቀጥላል፣ ነገር ግን መስኩ አንዳንድ ውስብስብነቱን በርካሽ ዘዴዎች እየነገደ ነው።
የእውነተኛ-ዓለም አተገባበር
በRLHF በኩል መመሪያዎችን እና የሰዎች ምርጫዎችን ለመከተል ጥሩ ማስተካከያ መመሪያGPT እና ChatGPT
የጨዋታ አጨዋወት እና የሮቦቲክስ ቁጥጥር ወኪሎችን፣ ከቋንቋ ሞዴሎች በፊት የPPO ኦሪጅናል ጎራ ስልጠና
በKL ገደብ ውስጥ የሽልማት-ሞዴል ነጥብን በመጨመር መርዛማነትን መቀነስ ወይም አጋዥነትን ማሻሻል
አንድ ሞዴል ተግባሮችን በትክክል ለመጨረስ የሚሸልመበት የመሣሪያ አጠቃቀም ወይም ባለብዙ ደረጃ ወኪል ባህሪን ማሳደግ
አደጋዎች እና የጥበቃ መንገዶች
የተሳሳቱ እውነታዎች በጸጥታ ወደ ሪፖርቶች፣ የድጋፍ ፍሰቶች ወይም የምርምር ውጤቶችን ማስገባት ይችላሉ።
ፈጣን ትብነት በተመሳሳይ ጥያቄዎች ላይ የማይጣጣሙ ውጤቶችን ሊፈጥር ይችላል።
የመዳረሻ መቆጣጠሪያዎች ደካማ ከሆኑ ሚስጥራዊነት ያለው የጽሑፍ ውሂብ ሊጋለጥ ይችላል።
የትግበራ ፍኖተ ካርታ
ከመልቀቅዎ በፊት የውጤት ቅርጸትን፣ ድምጽን እና የጥራት ደረጃዎችን ይግለጹ።
ትክክለኛነት አስፈላጊ በሚሆንበት ጊዜ ሁሉ ከታመኑ ምንጮች ጋር ምላሾች።
ከፍተኛ ውጤት ለማግኘት የሰው የግምገማ ነጥብ አቆይ።
የውድቀት ንድፎችን ይከታተሉ እና ጥያቄዎችን ወይም የስራ ፍሰቶችን በመደበኛነት ያሠለጥኑ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
የቡድን አንጻራዊ ፖሊሲ ማመቻቸት
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is Proximal Policy Optimization?
Proximal Policy Optimization (PPO) የማጠናከሪያ ትምህርት ስልተ-ቀመር ነው በጣም ከጥሩ ማስተካከያ የቋንቋ ሞዴሎች ከሰዎች አስተያየት። የዋህ የፖሊሲ ቀስቃሽ ዘዴዎችን የሚጎዳ አለመረጋጋትን ለማስወገድ በጥንቃቄ እና በትንሽ እርምጃዎች ፖሊሲን ያሻሽላል።
የPPO 'ክሊፕ' በዋነኝነት የሚያቀርበው የትኛውን ችግር ነው?
የፕሮባቢሊቲ ሬሾን መቁረጥ ማንኛውም ነጠላ ማሻሻያ ፖሊሲውን ከልክ በላይ እንዳያንቀሳቅሰው ይከለክላል፣ ይህም በመመሪያ-ግራዲየንት ዘዴዎች ውስጥ ዋነኛው የመረጋጋት ምንጭ ነው።
በቋንቋ-ሞዴል RLHF ከ PPO ጋር፣ የሽልማት ምልክቱ ብዙውን ጊዜ የሚመጣው ከየት ነው?
ሰዎች በ RL ጊዜ እያንዳንዱን ውጤት ማስመዝገብ የማይቻል ስለሆነ የሽልማት ሞዴል ለተፈጠሩ ምላሾች ከፍተኛ ሽልማት ይሰጣል።
የKL-divergence ቅጣት በ PPO ላይ በተመሰረተ RLHF ውስጥ ምን ያደርጋል?
ከዋናው (ማጣቀሻ) ፖሊሲ ጋር የሚጻረር የያንዳንዱ ማስመሰያ የKL ቅጣት ሞዴሉ ሽልማቱን በሚያሳድድበት ጊዜ ባህሪውን በከፍተኛ ሁኔታ እንዳይቀይር ያበረታታል።
በፒ.ፒ.ኦ ውስጥ የእሴት (ሃያሲ) አውታር ሚና ምንድነው?
PPO የተዋናይ-ተቺ ዘዴ ነው; የእሴት አውታረመረብ የሚጠበቀውን ሽልማት ይገምታል፣ ይህም ልዩነትን የሚቀንሱ የጥቅም ግምቶችን (ብዙውን ጊዜ በጂኤኢ በኩል) ያስችላል።
በPPO ውስጥ 'ጥቅሙ' ምንን ይወክላል?
ጥቅሙ የሚለካው የተመረጠው እርምጃ ምን ያህል የተሻለ (ወይም የከፋ) ከዋጋ ግምቱ አንጻራዊ ነው፣ ይህም እርምጃዎችን ማጠናከር እንዳለበት ለፖሊሲው ይነግረዋል።