무엇입니까? DPO(직접 선호도 최적화)?
정의
별도의 보상 모델이 필요 없이 선호 쌍에 대해 직접 모델을 미세 조정하는 학습 방법입니다.
관련 용어
무료 가이드에서 자세히 알아보세요
AI Inference OptimizationBidirectional Recurrent NetworksSecond-Order Optimization and Newton MethodsOdds Ratio Preference Optimization
별도의 보상 모델이 필요 없이 선호 쌍에 대해 직접 모델을 미세 조정하는 학습 방법입니다.