تحسين السياسة القريبة
إن تحسين السياسة القريبة (PPO) هو خوارزمية التعلم المعزز الأكثر ارتباطًا بنماذج اللغة الدقيقة من التعليقات البشرية.
نظرة عامة
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
الغوص العميق
تم تقديم PPO بواسطة OpenAI في عام 2017 وأصبح العمود الفقري وراء RLHF لأنظمة مثل InstructGPT وChatGPT. يتمثل التحدي الأساسي في RL الخاص بتدرج السياسة في أن تحديثًا واحدًا كبيرًا جدًا يمكن أن يؤدي إلى انهيار الأداء. يعالج PPO هذا الأمر من خلال "هدف بديل مقصوص": فهو يقيس مدى احتمالية حدوث إجراء ما مقابل السياسة القديمة، ويضرب هذه النسبة في الميزة (مدى تحسن الإجراء عما كان متوقعًا)، ويقطع النسبة إلى نطاق صغير مثل 0.8 إلى 1.2. ويحدد هذا المدى الذي يمكن أن تتحرك به السياسة لكل تحديث، مما يحافظ على استقرار التعلم مع السماح بالتحسين المستمر. في نموذج اللغة RLHF، يقوم "الإجراء" بإنشاء رمز مميز أو استجابة، وتأتي المكافأة من نموذج المكافأة، وعقوبة تباعد KL تمنع النموذج من الانجراف بعيدًا عن سلوكه الأصلي.
البصيرة الفنية
يعمل PPO على زيادة الهدف المقطوع إلى الحد الأقصى: الحد الأدنى (النسبة * الميزة، المقطع (النسبة، 1-eps، 1+eps) * الميزة)، حيث تكون النسبة هي احتمال الإجراء الجديد على القديم. عادة ما يتم تقدير المزايا باستخدام تقدير المزايا المعمم وشبكة القيمة المستفادة (النقدية). في RLHF، يجمع إجمالي المكافأة بين نقاط نموذج المكافأة وعقوبة KL لكل رمز مقابل السياسة المرجعية، مما يؤدي إلى موازنة مكاسب المكافأة مقابل البقاء بالقرب من النموذج الأصلي.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل تحسين السياسة القريبة
يظل PPO قويًا ولكنه معروف بأنه تافه: فهو يحتاج إلى شبكة قيمة منفصلة، وضبط دقيق للمعلمات الفائقة، والكثير من العمليات الحسابية. تكتسب البدائل الأبسط المزيد من الأرض، بما في ذلك DPO (بدون RL على الإطلاق) وGRPO، الذي يسقط شبكة القيمة من خلال تقدير المزايا من مجموعات من الاستجابات التي تم أخذ عينات منها، كما دعم نماذج الاستدلال الحديثة. ستستمر عمليات PPO حيث يساعد الاستكشاف في السياسة حقًا، لكن هذا المجال يتاجر بنشاط ببعض تعقيداته من أجل طرق أرخص.
التنفيذ في العالم الحقيقي
الضبط الدقيق لـ InstructGPT وChatGPT لاتباع التعليمات والتفضيلات البشرية عبر RLHF
تدريب وكلاء اللعب والتحكم في الروبوتات، المجال الأصلي لـ PPO قبل نماذج اللغة
تقليل السمية أو تحسين المساعدة من خلال تعظيم درجة نموذج المكافأة تحت قيود KL
تحسين استخدام الأداة أو سلوك الوكيل متعدد الخطوات حيث تتم مكافأة النموذج لإكمال المهام بشكل صحيح
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
تحسين السياسة النسبية للمجموعة
الأسئلة المتداولة
What is Proximal Policy Optimization?
إن تحسين السياسة القريبة (PPO) هو خوارزمية التعلم المعزز الأكثر ارتباطًا بنماذج اللغة الدقيقة من التعليقات البشرية. فهو يعمل على تحسين السياسة من خلال خطوات صغيرة ودقيقة لتجنب عدم الاستقرار الذي ابتليت به أساليب التدرج الساذجة في السياسة.
ما هي المشكلة التي يعالجها "قص" PPO بشكل أساسي؟
يؤدي قص نسبة الاحتمال إلى منع أي تحديث منفرد من تحريك السياسة إلى أبعد من اللازم، وهو المصدر الرئيسي لعدم الاستقرار في أساليب تدرج السياسة.
في نموذج اللغة RLHF مع PPO، من أين تأتي إشارة المكافأة عادةً؟
يوفر نموذج المكافأة المكافأة العددية للاستجابات المولدة، حيث أن جعل البشر يسجلون كل مخرجات خلال RL سيكون غير ممكن.
ماذا تفعل عقوبة تباعد KL في RLHF القائم على PPO؟
إن عقوبة KL لكل رمز مميز ضد السياسة (المرجعية) الأصلية لا تشجع النموذج على تغيير سلوكه بشكل كبير جدًا أثناء مطاردة المكافأة.
ما هو دور شبكة القيمة (الناقدة) في PPO؟
PPO هي طريقة الممثل الناقد. تقدر شبكة القيمة المكافأة المتوقعة، مما يتيح تقديرات المزايا (غالبًا عبر GAE) التي تقلل التباين.
ماذا تمثل "الميزة" في PPO؟
تقيس الميزة إلى أي مدى كان الإجراء المختار أفضل (أو أسوأ) مقارنة بتقدير القيمة، مما يخبر السياسة عن الإجراءات التي يجب تعزيزها.