رفض أخذ العينات صقل
يؤدي الضبط الدقيق لأخذ عينات الرفض (RFT) إلى إنشاء العديد من إجابات المرشحين، ويحتفظ فقط بالإجابات التي حصلت على أفضل الدرجات، ويعيد تدريب النموذج على هؤلاء الفائزين.
نظرة عامة
It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.
الغوص العميق
يُعد الضبط الدقيق لأخذ عينات الرفض، والذي يطلق عليه أحيانًا الضبط الأفضل من بين N، مكونًا رئيسيًا في كيفية محاذاة نماذج مثل Llama 2 وLlama 3 من Meta. الوصفة بسيطة: لكل مطالبة، قم بعينة عدة استجابات (على سبيل المثال، 4 إلى 64) من النموذج الحالي، وسجل كل منها باستخدام نموذج مكافأة أو مدقق تلقائي، ثم تجاهل ("ارفض") جميع المخرجات باستثناء المخرجات ذات التصنيف الأعلى. تصبح العينات عالية الجودة الباقية مجموعة بيانات دقيقة جديدة خاضعة للإشراف، ويتم تدريب النموذج عليها مع فقدان الرمز المميز التالي. يؤدي تكرار هذه الحلقة بشكل متكرر إلى دفع النموذج نحو توليد إجابات أفضل من تلقاء نفسه. نظرًا لأن النموذج يتعلم من مخرجاته التي تمت تصفيتها، فإن RFT يتجنب عدم الاستقرار وضبط الصداع الخاص بتدرج السياسة RL مع الاستمرار في الاستفادة من إشارة المكافأة.
البصيرة الفنية
يستغل RFT حقيقة أن أخذ العينات عدة مرات والحفاظ على الاستجابة القصوى للمكافأة يقترب من الانتقاء من توزيع أكثر وضوحًا وأعلى جودة. إن التدريب على هؤلاء الفائزين من خلال الإنتروبيا القياسية يؤدي إلى تقطير أفضل سلوك من بين N إلى مخرجات العينة الفردية للنموذج. بالنسبة للمجالات التي يمكن التحقق منها مثل الرياضيات أو التعليمات البرمجية، يمكن أن تكون "المكافأة" ببساطة ما إذا كانت الإجابة النهائية أو اختبار الوحدة قد نجح، مما يلغي الحاجة إلى نموذج مكافأة مكتسب بالكامل.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل الضبط الدقيق لأخذ عينات الرفض
يعد RFT أمرًا أساسيًا في مرحلة ما بعد التدريب الحديثة، وغالبًا ما يستخدم قبل أو بجانب أساليب RL مثل PPO وDPO. وتزداد جاذبيتها مع الاستدلال الرخيص وأدوات التحقق التلقائية القوية: مع تحسن النماذج في التوليد الذاتي والتحقق الذاتي، تدعم عينات الرفض المتكررة البيانات الاصطناعية وحلقات التحسين الذاتي. توقع تكاملًا أكثر إحكامًا مع نماذج الاستدلال التي تنتج سلاسل فكرية يمكن التحقق منها، ودراسة مستمرة لكيفية تجنب اختراق المكافآت وانهيار التنوع عند التدريب المتكرر على مخرجات النموذج نفسه.
التنفيذ في العالم الحقيقي
محاذاة نماذج نمط اللاما عن طريق أخذ عينات من الإجابات المتعددة لكل موجه، والحفاظ على أعلى درجات نموذج المكافأة، ثم SFT على تلك الإجابات
تحسين حل الرياضيات من خلال إنشاء العديد من الحلول والاحتفاظ فقط بتلك التي تصل إلى الإجابة الصحيحة والقابلة للتحقق
إنشاء التعليمات البرمجية حيث يتم الاحتفاظ بالمرشحين فقط في حالة اجتيازهم اختبارات الوحدة، ثم يتم استخدامها كبيانات تدريب
بناء مجموعات بيانات تعليمات تركيبية عن طريق تصفية أفضل الاستجابات الذاتية للنموذج لجولة التدريب التالية
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rejection Sampling Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
QLoRA وضبط دقيق 4 بت
الأسئلة المتداولة
What is Rejection Sampling Fine-Tuning?
يؤدي الضبط الدقيق لأخذ عينات الرفض (RFT) إلى إنشاء العديد من إجابات المرشحين، ويحتفظ فقط بالإجابات التي حصلت على أفضل الدرجات، ويعيد تدريب النموذج على هؤلاء الفائزين. إنه أمر مهم لأنه يقدم الكثير من فوائد RLHF باستخدام التعلم المباشر الخاضع للإشراف بدلاً من التعلم المعزز المعقد.
ما هي الفكرة الأساسية للضبط الدقيق لأخذ عينات الرفض؟
يقوم RFT باختبار استجابات متعددة، وتصفية الاستجابات ذات أعلى الدرجات، وضبط النموذج على هؤلاء الفائزين.
في المجالات التي يمكن التحقق منها مثل الرياضيات أو التعليمات البرمجية، ما الذي يمكن أن يكون بمثابة المكافأة؟
بالنسبة للمهام القابلة للتحقق، يمكن لـ RFT استخدام الصحة الدقيقة أو اجتياز اختبارات الوحدة، وتجنب نموذج المكافأة المكتسب.
ما هي العائلة النموذجية التي اشتهرت باستخدام عينات الرفض أثناء المحاذاة؟
Meta تم وصف استخدام عينات الرفض كجزء من وصفة ما بعد التدريب لنماذج Llama 2 وLlama 3.
لماذا قد تفضل الفرق RFT على RL ذات التدرج السياسي مثل PPO؟
يتم إعادة تدريب RFT مع فقدان الرمز المميز التالي القياسي على العينات التي تمت تصفيتها، متجنبًا صعوبة الضبط وعدم استقرار أساليب تدرج السياسة.
ماذا يفعل التدريب على عينات الحد الأقصى للمكافأة بشكل فعال؟
ومن خلال التعلم من الاستجابات التي تمت تصفيتها، يستوعب النموذج سلوكًا عالي الجودة في جيل واحد.