ما هو DPO (تحسين التفضيلات المباشرة)?
التعريف
طريقة تدريب تعمل على ضبط النماذج مباشرة على أزواج التفضيلات دون الحاجة إلى نموذج مكافأة منفصل.
المصطلحات ذات الصلة
تعرف على المزيد في أدلةنا المجانية
AI Inference OptimizationBidirectional Recurrent NetworksSecond-Order Optimization and Newton MethodsOdds Ratio Preference Optimization