Optimización de preferencias directas
La optimización de preferencias directas (DPO) es una forma de alinear los modelos de lenguaje con las preferencias humanas sin entrenar un modelo de recompensa separado ni ejecutar el aprendizaje por refuerzo.
Descripción general
It collapses a complex multi-stage pipeline into a single, stable training loss.
Buceo profundo
DPO, presentado por Rafailov y sus colegas en Stanford en 2023, replantea cómo enseñamos a un modelo lo que la gente prefiere. El enfoque tradicional (RLHF) entrena un modelo de recompensa a partir de comparaciones humanas y luego utiliza el aprendizaje por refuerzo para maximizar esa recompensa. La idea clave de DPO es matemática: la política óptima según ese objetivo de RLHF tiene una relación de forma cerrada con la recompensa, por lo que se pueden reorganizar las ecuaciones y optimizar el modelo de lenguaje directamente en pares de preferencias. Le da un mensaje, una respuesta 'elegida' (preferida) y una respuesta 'rechazada', y una simple pérdida de estilo de clasificación empuja al modelo a hacer que la respuesta elegida sea relativamente más probable. Sin modelo de recompensa, sin bucle de muestreo, sin piratería de recompensas. Es mucho más sencillo y estable de ejecutar.
Información técnica
DPO utiliza una pérdida binaria de entropía cruzada sobre pares de preferencias. Aumenta la relación de probabilidad logarítmica de la respuesta elegida en relación con la rechazada, cada una medida contra un modelo de referencia congelado (generalmente el punto de partida supervisado y ajustado). Un parámetro de temperatura beta controla hasta qué punto la política puede desviarse de esa referencia, imponiendo implícitamente la restricción de KL que RLHF aplica explícitamente. La recompensa nunca se materializa; está implícito en las propias probabilidades logarítmicas de la política.
Impacto Estratégico
Speed and scale
Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.
Access and reach
Amplía el acceso a través de idiomas y estilos de comunicación.
Decisiones más claras
Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.
El futuro de la optimización de preferencias directas
DPO se ha convertido en un método de alineación predeterminado porque es barato y reproducible, y generó una familia de variantes: IPO corrige el sobreajuste de preferencias casi deterministas, KTO aprende de etiquetas individuales buenas o malas en lugar de pares, y ORPO integra el aprendizaje de preferencias en un ajuste fino sin un modelo de referencia. Espere un trabajo continuo para combinar DPO con datos sobre políticas y desesgo de longitud/calidad, reduciendo la brecha restante con RLHF en línea completo.
Implementación en el mundo real
Ajuste de modelos de chat de peso abierto como Zephyr y muchos derivados de Llama y Mistral, que estaban alineados con DPO en conjuntos de datos de preferencias.
Reducir los resultados dañinos o inútiles utilizando pares en los que se "elige" la respuesta segura y útil en lugar de una problemática.
Enseñar a un asistente de codificación a preferir soluciones correctas y bien documentadas a las que tienen errores mediante comparaciones calificadas por desarrolladores.
Ajustar el estilo de resumen para que los modelos prefieran resúmenes concisos y fieles a los detallados o alucinados.
Riesgos y barandillas
Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.
La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.
Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.
Hoja de ruta de implementación
Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.
Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.
Mantenga un punto de control de revisión humana para los resultados de alto riesgo.
Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Direct Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Optimización de la preferencia del índice de probabilidades
Preguntas frecuentes
What is Direct Preference Optimization?
La optimización de preferencias directas (DPO) es una forma de alinear los modelos de lenguaje con las preferencias humanas sin entrenar un modelo de recompensa separado ni ejecutar el aprendizaje por refuerzo. Colapsa un complejo proceso de múltiples etapas en una única pérdida de entrenamiento estable.
¿Qué elimina el DPO en comparación con el RLHF tradicional?
La principal ventaja de DPO es eliminar el modelo de recompensa explícita y el ciclo de muestreo RL, optimizando la política directamente en pares de preferencias.
¿De qué datos consta un único ejemplo de formación de DPO?
DPO se entrena en pares de preferencias: un mensaje más una respuesta preferida ("elegida") y una no preferida ("rechazada").
¿Qué papel juega el modelo de referencia en el DPO?
Una referencia congelada (normalmente el modelo SFT) ancla la pérdida; el parámetro beta controla hasta qué punto la política entrenada puede alejarse de él.
En DPO, ¿dónde está representada la 'recompensa'?
La derivación de DPO muestra que la recompensa está implícita en la relación de probabilidad logarítmica entre la política y la referencia, por lo que no se necesita un modelo de recompensa explícito.
¿Qué controla el parámetro beta (temperatura) en DPO?
Beta gobierna la restricción implícita de KL: una beta más alta mantiene la política más cerca de la referencia, una beta más baja permite una mayor desviación.