Що є DPO (пряма оптимізація переваг)?
Визначення
Метод навчання, який точно налаштовує моделі безпосередньо на пари переваг без необхідності окремої моделі винагороди.
Споріднені терміни
Дізнайтеся більше в наших безкоштовних посібниках
AI Inference OptimizationBidirectional Recurrent NetworksSecond-Order Optimization and Newton MethodsOdds Ratio Preference Optimization