دليل اللغة AI

تحسين التفضيل المباشر

يعد تحسين التفضيل المباشر (DPO) وسيلة لمواءمة نماذج اللغة مع التفضيلات البشرية دون تدريب نموذج مكافأة منفصل أو تشغيل التعلم المعزز.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It collapses a complex multi-stage pipeline into a single, stable training loss.

الغوص العميق

يعيد DPO، الذي قدمه رافايلوف وزملاؤه في جامعة ستانفورد في عام 2023، التفكير في كيفية تعليم النموذج الذي يفضله الناس. يقوم النهج التقليدي (RLHF) بتدريب نموذج المكافأة على المقارنات البشرية، ثم يستخدم التعلم المعزز لتعظيم تلك المكافأة. الرؤية الرئيسية لـ DPO هي رياضية: السياسة المثلى في إطار هدف RLHF هذا لها علاقة مغلقة بالمكافأة، بحيث يمكنك إعادة ترتيب المعادلات وتحسين نموذج اللغة مباشرة على أزواج التفضيلات. أنت تعطيه استجابة سريعة، واستجابة "مختارة" (مفضلة)، واستجابة "مرفوضة"، وخسارة بسيطة في نمط التصنيف تدفع النموذج إلى جعل الإجابة المختارة أكثر احتمالا نسبيا. لا يوجد نموذج للمكافأة، ولا حلقة لأخذ العينات، ولا يوجد اختراق للمكافأة. إنه أبسط بكثير وأكثر استقرارًا في التشغيل.

البصيرة الفنية

يستخدم DPO خسارة الإنتروبيا الثنائية على أزواج التفضيل. فهو يزيد من نسبة احتمالية السجل للاستجابة المختارة مقارنة بالإجابة المرفوضة، ويتم قياس كل منها مقابل نموذج مرجعي مجمد (عادةً ما تكون نقطة البداية المضبوطة تحت الإشراف). تتحكم بيتا لمعلمة درجة الحرارة في المدى الذي قد تنحرف به السياسة عن هذا المرجع، مما يفرض ضمنيًا قيد KL الذي يطبقه RLHF بشكل صريح. المكافأة لا تتحقق أبدا. إنه ضمني في احتمالات السجل الخاصة بالسياسة.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل تحسين التفضيل المباشر

أصبحت DPO طريقة محاذاة افتراضية لأنها رخيصة الثمن وقابلة للتكرار، وقد أنتجت مجموعة من المتغيرات: يعمل IPO على إصلاح التراكب على التفضيلات شبه الحتمية، ويتعلم KTO من الملصقات الفردية الجيدة أو السيئة بدلاً من الأزواج، ويقوم ORPO بطي تعلم التفضيلات إلى ضبط دقيق بدون نموذج مرجعي. توقع استمرار العمل على الجمع بين DPO والبيانات المتعلقة بالسياسة وتقليل انحياز الطول/الجودة، وتضييق الفجوة المتبقية مع RLHF الكامل عبر الإنترنت.

التنفيذ في العالم الحقيقي

ضبط نماذج الدردشة ذات الوزن المفتوح مثل Zephyr والعديد من مشتقات Llama وMistral، والتي تمت مواءمتها مع DPO في مجموعات البيانات المفضلة

تقليل النتائج الضارة أو غير المفيدة باستخدام أزواج حيث يتم "اختيار" الإجابة الآمنة والمفيدة على الإجابة الإشكالية

تعليم مساعد الترميز لتفضيل الحلول الصحيحة والموثقة جيدًا على الحلول التي تجرها الدواب باستخدام مقارنات مصنفة من قبل المطورين

ضبط أسلوب التلخيص بحيث تفضل النماذج الملخصات المختصرة والصادقة على الملخصات المطولة أو المهلوسة

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Direct Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

تحسين تفضيلات نسبة الأرجحية

الأسئلة المتداولة

What is Direct Preference Optimization?

يعد تحسين التفضيل المباشر (DPO) وسيلة لمواءمة نماذج اللغة مع التفضيلات البشرية دون تدريب نموذج مكافأة منفصل أو تشغيل التعلم المعزز. إنه ينهار خط أنابيب معقد متعدد المراحل في خسارة تدريب واحدة ومستقرة.

ما الذي يزيله DPO مقارنة بـ RLHF التقليدي؟

الميزة الرئيسية لـ DPO هي إزالة نموذج المكافأة الصريح وحلقة أخذ العينات RL، وتحسين السياسة مباشرة على أزواج التفضيلات بدلاً من ذلك.

ما هي البيانات التي يتكون منها مثال تدريبي واحد لـ DPO؟

يتدرب DPO على أزواج التفضيلات: استجابة سريعة بالإضافة إلى استجابة واحدة مفضلة ("مختارة") وأخرى غير مفضلة ("مرفوضة").

ما هو الدور الذي يلعبه النموذج المرجعي في DPO؟

يقوم المرجع المجمد (نموذج SFT عادةً) بتثبيت الخسارة؛ تتحكم معلمة بيتا في المدى الذي يمكن أن تتحرك منه السياسة المدربة.

في DPO، أين يتم تمثيل "المكافأة"؟

يوضح اشتقاق DPO أن المكافأة ضمنية في نسبة احتمالية السجل بين السياسة والمرجع، لذلك لا توجد حاجة إلى نموذج مكافأة صريح.

ما الذي تتحكم به معلمة بيتا (درجة الحرارة) في DPO؟

تحكم النسخة التجريبية قيد KL الضمني: النسخة التجريبية الأعلى تبقي السياسة أقرب إلى المرجع، بينما تسمح النسخة التجريبية المنخفضة بمزيد من الانحراف.