الدليل الفني

تعزيز التعلم من ردود الفعل البشرية

RLHF هي التقنية التي تحول نموذج اللغة الخام إلى مساعد مهذب ومفيد من خلال تدريبه على التفضيلات البشرية.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because it aligns model behavior with what people actually want, not just what is statistically likely.

الغوص العميق

يتنبأ نموذج اللغة المُدرب مسبقًا بالنص المعقول، ولكن المعقول ليس هو نفسه النص المفيد أو الصادق أو الآمن. يقوم RLHF بإصلاح هذه المشكلة على مراحل. أولاً، يقوم الضبط الدقيق الخاضع للإشراف بتعليم النموذج اتباع التعليمات باستخدام إجابات الأمثلة المكتوبة بواسطة الإنسان. بعد ذلك، يقارن البشر أزواجًا من الاستجابات النموذجية لنفس الموجه ويختارون الأفضل؛ تقوم هذه المقارنات بتدريب نموذج مكافأة منفصل يسجل أي استجابة. أخيرًا، تم تحسين نموذج اللغة من خلال التعلم المعزز لإنتاج استجابات بمعدلات نموذج المكافأة عالية. تمنعه ​​العقوبة من الانجراف بعيدًا عن النموذج الأصلي، لذا يظل بطلاقة ولا يستغل المراوغات في نموذج المكافأة. كان RLHF أساسيًا في جعل المساعدين من طراز ChatGPT قابلين للاستخدام.

البصيرة الفنية

عادة ما يتم تدريب نموذج المكافأة على أزواج التفضيلات مع خسارة أسلوب برادلي-تيري، وتعلم إعطاء الإجابة المفضلة للإنسان درجة عددية أعلى. يتم بعد ذلك تحديث السياسة باستخدام PPO (تحسين السياسة القريبة)، مما يزيد من المكافأة بينما تمنع عقوبة تباعد KL ضد النموذج المرجعي الإفراط في التحسين و"اختراق المكافأة". نظرًا لأن PPO غير متقن، فإن الأساليب الأحدث مثل DPO (تحسين التفضيلات المباشرة) تتخطى نموذج المكافأة الصريحة وحلقة التعزيز، مما يؤدي إلى تحسين السياسة مباشرة من أزواج التفضيلات.

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل التعلم المعزز من ردود الفعل البشرية

يتم تبسيط RLHF وأتمتته جزئيًا. يحل DPO وطرق التفضيل المباشر ذات الصلة محل خط أنابيب PPO الثقيل للعديد من الفرق، ويستخدم RLAIF ردود الفعل الناتجة عن الذكاء الاصطناعي (كما هو الحال في الذكاء الاصطناعي الدستوري) لخفض تكاليف وضع العلامات. تتناول الأبحاث قرصنة المكافأة، وتحيز المعلقين، وصعوبة الحكم على الإجابات الطويلة أو الاستجابات المتخصصة، باستخدام تقنيات مثل الإشراف على العملية والمناقشة. توقع أن يؤدي التوافق إلى مزج ردود الفعل البشرية والذكاء الاصطناعي، وإشارات مكافأة أكثر ثراءً تتجاوز مجرد إبهام واحد، وتدقيق متزايد لمن يقدم التفضيلات والقيم التي يشفرونها.

التنفيذ في العالم الحقيقي

ضبط مساعد الدردشة بحيث يرفض الطلبات الضارة ويقدم إجابات مفيدة ومنظمة بشكل جيد بدلاً من مجرد نص معقول.

ترتيب أزواج الملخصات حسب تفضيل الإنسان لتدريب نموذج يكتب ملخصات يجدها الأشخاص مفيدة بالفعل.

تقليل المخرجات السامة أو المتحيزة من خلال مكافأة الاستجابات التي يحكم عليها المقيِّمون البشريون بأنها محترمة وآمنة.

استخدام DPO في مجموعة بيانات للإجابات المفضلة مقابل الإجابات المرفوضة لمحاذاة نموذج مفتوح المصدر دون تشغيل حلقة PPO كاملة.

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reinforcement Learning From Human Feedback quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الأسئلة المتداولة

What is Reinforcement Learning From Human Feedback?

RLHF هي التقنية التي تحول نموذج اللغة الخام إلى مساعد مهذب ومفيد من خلال تدريبه على التفضيلات البشرية. إنه مهم لأنه يربط السلوك النموذجي بما يريده الناس بالفعل، وليس فقط ما هو محتمل إحصائيًا.

ما هو الغرض الرئيسي من RLHF لنموذج اللغة؟

يوجه RLHF نموذجًا نحو الاستجابات التي يفضلها البشر، مما يجعله أكثر فائدة وصدقًا وأمانًا وليس مجرد معقول.

ما الذي يتعلمه نموذج المكافأة في RLHF فعليًا؟

يتم تدريب نموذج المكافأة على مقارنات التفضيلات البشرية لتسجيل الاستجابات، وتوفير الإشارة التي تعمل السياسة على تحسينها.

لماذا يتم تطبيق عقوبة تباعد KL على النموذج الأصلي المستخدم أثناء خطوة RL؟

تحافظ عقوبة KL على السياسة المُحسّنة بالقرب من النموذج المرجعي، مما يحمي من اختراق المكافآت وفقدان الطلاقة.

كيف يتم جمع بيانات التفضيل عادةً لنموذج المكافأة؟

يختار المفسرون الاستجابة المفضلة في المقارنات الزوجية، والتي تدرب نموذج المكافأة من خلال الخسارة على طريقة برادلي تيري.

ما هي الميزة التي يقدمها DPO (التحسين المباشر للتفضيلات) مقارنة بخط أنابيب RLHF الكلاسيكي؟

يستمد DPO الهدف مباشرة من التفضيلات، متجنبًا نموذج المكافأة المنفصل وخطوة التعلم المعززة.