Co jest DPO (bezpośrednia optymalizacja preferencji)?
Definicja
Metoda uczenia, która dostraja modele bezpośrednio na parach preferencji, bez konieczności stosowania osobnego modelu nagrody.
Powiązane terminy
Dowiedz się więcej z naszych bezpłatnych przewodników
AI Inference OptimizationBidirectional Recurrent NetworksSecond-Order Optimization and Newton MethodsOdds Ratio Preference Optimization