تكرار DPO وضبط التفضيلات عبر الإنترنت
يقوم DPO التكراري بمحاذاة نموذج اللغة بشكل متكرر مع تفضيلات الإنسان أو الذكاء الاصطناعي من خلال إنشاء استجابات جديدة وتصنيفها وضبط تلك الأزواج الجديدة في كل جولة.
نظرة عامة
It matters because static, one-shot preference data goes stale, while iterating keeps the training signal on-policy and the model improving.
الغوص العميق
يتخطى تحسين التفضيل المباشر (DPO) تدريب نموذج مكافأة منفصل: بالنظر إلى أزواج من الاستجابات المفضلة والمرفوضة، فإنه يضبط السياسة مباشرة لزيادة احتمالية الإجابة المختارة مقارنة بالإجابة المرفوضة، وذلك باستخدام خسارة بسيطة على نمط التصنيف مستمدة من هدف RLHF. المشكلة هي أن Vanilla DPO يتدرب على مجموعة بيانات ثابتة، وغالبًا ما تكون خارجة عن السياسة، لذلك يمكن للنموذج أن يتناسب مع المقارنات القديمة. يقوم DPO التكراري (عبر الإنترنت) بإغلاق الحلقة: يقوم النموذج الحالي باختبار الاستجابات الجديدة، وتسميات القاضي (البشر أو نموذج الذكاء الاصطناعي القوي/المكافأة) أيهما أفضل، ويمكنك تشغيل جولة DPO أخرى على هذه البيانات الجديدة. يؤدي تكرار ذلك عدة مرات إلى الحصول على هدف متحرك يتتبع السلوك الفعلي للنموذج، وغالبًا ما يطابق أو يتفوق على RLHF القائم على PPO بتعقيد أقل بكثير.
البصيرة الفنية
تستخدم خسارة DPO نموذجًا مرجعيًا (عادةً نقطة تفتيش SFT) وبيتا شبيهة بدرجة الحرارة للتحكم في الانحراف، مما يؤدي بشكل فعال إلى تشفير مكافأة ضمنية تساوي نسبة السجل بين احتمالات السياسة والاحتمالات المرجعية. الاتصال بالإنترنت مهم لأن بيانات التفضيلات المأخوذة من السياسة الحالية تظل قيد التوزيع، مما يقلل من تحول التوزيع الذي يصيب DPO غير المتصل بالإنترنت. يقوم كل تكرار بإعادة إنشاء الإكمالات، وإعادة تسمية التفضيلات، وتحديث النموذج المرجعي بشكل اختياري، بحيث يعكس التدرج دائمًا نقاط الضعف الحالية.
التأثير الاستراتيجي
قرارات أوضح
يساعدك على فصل المطالبات الفنية الواضحة عن لغة التسويق.
التكلفة والميزانية
يمكنك طرح أسئلة تنفيذ أفضل قبل إنفاق المال أو الوقت.
الفريق وسير العمل
تتخذ الفرق ذات الفهم المشترك قرارات أفضل بشأن المنتجات والسياسات والتعلم.
مستقبل DPO التكراري وضبط التفضيلات عبر الإنترنت
توقع أن يصبح ضبط التفضيلات آليًا ومستمرًا بشكل متزايد، مع قيام حكام الذكاء الاصطناعي ونماذج المكافآت بتوفير التسميات على نطاق واسع بحيث تعمل حلقات التكرار بتكلفة زهيدة. تعمل المتغيرات مثل KTO وIPO وDPO الذي يتم التحكم فيه بالطول أو المكافأة الذاتية على تحسين الخسارة للحد من الإسهاب ومكافأة القرصنة. الاتجاه الأوسع هو التكامل الأكثر إحكامًا بين التوليد والحكم والتحديث في خطوط الأنابيب التي تعمل باستمرار على مواءمة النماذج الحدودية مع وضع علامات بشرية أقل في كل خطوة.
التنفيذ في العالم الحقيقي
محاذاة مساعد الدردشة على مدار جولات متعددة، وفي كل مرة يتم أخذ عينات من الردود الجديدة وإعادة ترتيبها لتحسين المساعدة
إعدادات المكافأة الذاتية حيث يقوم النموذج بإنشاء أزواج الاستجابة الخاصة به والحكم عليها من أجل تمهيد بيانات التفضيلات الأفضل
تقليل إسهاب الإجابة عن طريق إضافة DPO يتم التحكم في طوله في التكرارات اللاحقة بمجرد إنشاء الجودة الأولية
التكيف مع المجال، مثل الضبط التكراري لنموذج الترميز على أزواج الحلول التي تم إنشاؤها حديثًا والتي يتم الحكم عليها من خلال نتائج الاختبار
المخاطر والدرابزين
قد تستخدم الفرق المختلفة نفس المصطلح بشكل مختلف، لذا حدد النطاق مبكرًا.
يمكن أن تبدو المعايير قوية بينما يكون الأداء في العالم الحقيقي غير متساوٍ.
غالبًا ما يؤدي تجاهل جودة البيانات وخطط التقييم إلى نتائج هشة.
خارطة طريق التنفيذ
ابدأ بتعريف لغة واضحة للنتيجة التي تحتاجها.
اختر مقياس نجاح واحد وحالة فشل واحدة قبل الاختبار.
قم بتشغيل برنامج تجريبي صغير يحتوي على بيانات تمثيلية، وليس مجموعة تجريبية مصقولة.
قم بالتوثيق حيث يساعد DPO التكراري وضبط التفضيلات عبر الإنترنت وأين تكون الطرق الأبسط أفضل.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Iterative DPO and Online Preference Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
تطبيع الطول في تحسين التفضيلات
الأسئلة المتداولة
What is Iterative DPO and Online Preference Tuning?
يقوم DPO التكراري بمحاذاة نموذج اللغة بشكل متكرر مع تفضيلات الإنسان أو الذكاء الاصطناعي من خلال إنشاء استجابات جديدة وتصنيفها وضبط تلك الأزواج الجديدة في كل جولة. وهذا مهم لأن بيانات التفضيلات الثابتة التي يتم الحصول عليها لمرة واحدة تصبح قديمة، في حين أن التكرار يحافظ على إشارة التدريب في السياسة ويتحسن النموذج.
ما الذي يتجنبه DPO الذي يتطلبه RLHF (PPO) التقليدي؟
يقوم DPO بتحسين السياسة مباشرة من أزواج التفضيلات، مما يلغي نموذج المكافأة المنفصل وحلقة RL التي يستخدمها RLHF المستند إلى PPO.
لماذا غالبًا ما يكون DPO التكراري (عبر الإنترنت) أفضل من تشغيل DPO مرة واحدة على مجموعة بيانات ثابتة؟
يؤدي تجديد الاستجابات وإعادة تصنيفها في كل جولة إلى الحفاظ على توافق البيانات مع السياسة الحالية، مما يقلل من تحول التوزيع والتناسب الزائد مع المقارنات القديمة.
ما هو الدور الذي يلعبه النموذج المرجعي في خسارة DPO؟
يقوم DPO بمقارنة احتمالات السجل السياسي والمرجعي؛ وتعمل هذه النسبة كمكافأة ضمنية وتحد من مدى انحراف السياسة.
في تكرار واحد لـ DPO عبر الإنترنت، ما هو التسلسل النموذجي؟
تولد كل حلقة إكمالات جديدة من النموذج الحالي، ويصنفها أحد القضاة، ويطبق تحديث DPO على الأزواج الجديدة.
ما الذي تتحكم فيه معلمة بيتا الفائقة في DPO؟
تعمل النسخة التجريبية كدرجة حرارة على المكافأة الضمنية، حيث تقايض البقاء على مقربة من المرجع مقابل ملاءمة التفضيلات.