Qu'est-ce que DPO (Optimisation des Préférences Directes)?
Définition
Une méthode de formation qui affine les modèles directement sur les paires de préférences sans avoir besoin d'un modèle de récompense distinct.
Termes associés
Apprenez-en davantage dans nos guides gratuits
AI Inference OptimizationBidirectional Recurrent NetworksSecond-Order Optimization and Newton MethodsOdds Ratio Preference Optimization