تحسين تفضيلات نسبة الأرجحية
يعد تحسين تفضيلات نسبة الأرجحية (ORPO) طريقة ضبط دقيقة لتعليم نموذج اللغة السلوك الجيد والتفضيلات البشرية في تمريرة تدريب واحدة.
نظرة عامة
It matters because it skips the usual separate reward model and reference model, making alignment cheaper and simpler.
الغوص العميق
تجمع ORPO، التي قدمتها Hong وLee وThorne في عام 2024، بين الضبط الدقيق ومحاذاة التفضيلات الخاضعة للإشراف في خطوة واحدة. تقوم معظم خطوط أنابيب المحاذاة أولاً بإجراء SFT على الأمثلة الجيدة، ثم تقوم بتشغيل طريقة ثانية مثل RLHF أو DPO التي تتطلب نسخة مجمدة من النموذج (مرجع) بالإضافة إلى أزواج التفضيلات المخزنة. يقوم ORPO بإزالة النموذج المرجعي بالكامل. تضيف خسارتها عقوبة جزائية إلى هدف الرمز المميز التالي القياسي: فهي تزيد من الاحتمالات التي يعينها النموذج للاستجابة المختارة (المفضلة) بينما تقلل من احتمالات الاستجابة المرفوضة. نظرًا لأنه يستخدم نسبة الأرجحية بدلاً من فجوة احتمالية السجل القوية، فإن العقوبة لطيفة، لذلك يتعلم النموذج تفضيل الإجابات الجيدة دون نسيان التوليد بطلاقة بشكل كارثي.
البصيرة الفنية
خسارة ORPO هي خسارة الإنتروبيا المتقاطعة SFT بالإضافة إلى السجل السيني المرجح لنسبة احتمالات السجل بين الاستجابات المختارة والمرفوضة. الاحتمالات تساوي p/(1-p)، لذا فإن النسبة تقارن مدى احتمالية عثور النموذج على الإجابة الجيدة مقابل الإجابة السيئة. يؤدي استخدام الاحتمالات بدلاً من الاحتمالية الأولية إلى الحفاظ على التباين معتدلاً، مما يمنع الإفراط في قمع الرموز المميزة المرفوضة التي يمكن أن تؤدي إلى تدهور النموذج غير المرجعي.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل تحسين تفضيلات نسبة الأرجحية
تكتسب ORPO قوة جذب لأنها تقلل الذاكرة والحوسبة عن طريق إسقاط النموذج المرجعي، وهو أمر جذاب للفرق التي تعمل على الضبط الدقيق على أجهزة محدودة. توقع ظهوره كثيرًا في الوصفات مفتوحة المصدر وكخيار افتراضي في المكتبات مثل Hugging Face TRL. من المرجح أن يقوم العمل المستقبلي بضبط وزن لامدا تلقائيًا، ومزج ORPO مع أهداف أخرى خالية من المراجع، وتوسيع نطاقه ليشمل نماذج متعددة الوسائط وكبيرة جدًا حيث يكون الاحتفاظ بنسختين في الذاكرة مكلفًا.
التنفيذ في العالم الحقيقي
ضبط نموذج دردشة 7B مفتوح المصدر على أزواج التفضيلات دون تحميل نسخة مرجعية ثانية، مما يؤدي إلى خفض ذاكرة وحدة معالجة الرسومات إلى النصف
شركة ناشئة تعمل على مواءمة مساعد دعم العملاء لتفضيل الإجابات المهذبة والمتعلقة بالسياسة في دورة تدريبية واحدة بدلاً من SFT ثم DPO
يقوم الباحثون بمقارنة ORPO مع DPO في نفس مجموعة البيانات لإظهار محاذاة قابلة للمقارنة مع حساب أقل
تكييف النموذج الأساسي مع مجال متخصص (على سبيل المثال، الصياغة القانونية) حيث تتوفر أزواج الأمثلة الجيدة والسيئة ولكن ميزانية نموذج المكافأة ليست كذلك
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Odds Ratio Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
تحسين التفضيل المباشر
الأسئلة المتداولة
What is Odds Ratio Preference Optimization?
يعد تحسين تفضيلات نسبة الأرجحية (ORPO) طريقة ضبط دقيقة لتعليم نموذج اللغة السلوك الجيد والتفضيلات البشرية في تمريرة تدريب واحدة. إنه أمر مهم لأنه يتخطى نموذج المكافأة المنفصل المعتاد والنموذج المرجعي، مما يجعل المحاذاة أرخص وأبسط.
ما هي الميزة العملية الرئيسية لـ ORPO مقارنة بأساليب مثل DPO؟
يقوم ORPO بدمج تعلم التفضيلات في خسارة SFT ولا يحتاج إلى نسخة مرجعية مجمدة من النموذج، مما يوفر الذاكرة والحوسبة.
ما الذي تقارنه "نسبة الأرجحية" في ORPO؟
يستخدم ORPO نسبة الاحتمالات (p/(1-p)) التي يعينها النموذج للإجابة المفضلة مقابل الإجابة غير المفضلة.
ما هما المهمتان اللتان تقوم بهما ORPO في تمريرة تدريب واحدة؟
تجمع ORPO بين هدف الرمز المميز التالي SFT القياسي وعقوبة التفضيل في خسارة موحدة واحدة.
لماذا يستخدم ORPO الاحتمالات بدلاً من فرق احتمالية السجل الخام للعقوبة؟
تعتبر العقوبة القائمة على الاحتمالات أكثر اعتدالًا، مما يساعد النموذج غير المرجعي في الحفاظ على الجيل بطلاقة مع الاستمرار في تفضيل الإجابات الجيدة.
أفضل وصف لخسارة ORPO هو أي مجموعة؟
يضيف ORPO مصطلح نسبة الأرجحية اللوغاريتمية السيني على رأس خسارة الإنتروبيا الخاضعة للإشراف.