GUÍA de IA en idiomas

Optimización de la preferencia del índice de probabilidades

La optimización de preferencias de índice de probabilidades (ORPO) es un método de ajuste que enseña a un modelo de lenguaje el buen comportamiento y las preferencias humanas en una sola pasada de entrenamiento.

2 minutos de lecturaÚltima actualización

Descripción general

It matters because it skips the usual separate reward model and reference model, making alignment cheaper and simpler.

Buceo profundo

ORPO, presentado por Hong, Lee y Thorne en 2024, combina el ajuste supervisado y la alineación de preferencias en un solo paso. La mayoría de los canales de alineación primero realizan SFT en buenos ejemplos y luego ejecutan un segundo método como RLHF o DPO que requiere una copia congelada del modelo (una referencia) más pares de preferencias almacenados. ORPO elimina por completo el modelo de referencia. Su pérdida añade un término de penalización al objetivo estándar del siguiente token: aumenta las probabilidades que el modelo asigna a la respuesta elegida (preferida) mientras reduce las probabilidades de la respuesta rechazada. Debido a que utiliza el odds ratio en lugar de una fuerte brecha de probabilidad logarítmica, la penalización es suave, por lo que el modelo aprende a favorecer las buenas respuestas sin olvidar catastróficamente la generación fluida.

Información técnica

La pérdida de ORPO es la pérdida de entropía cruzada de SFT más un log-sigmoide ponderado del log odds ratio entre las respuestas elegidas y rechazadas. Las probabilidades son iguales a p/(1-p), por lo que la relación compara la probabilidad de que el modelo encuentre la respuesta buena frente a la mala. El uso de probabilidades en lugar de probabilidad bruta mantiene el contraste suave, lo que evita la supresión excesiva de tokens rechazados que pueden degradar un modelo sin referencia.

Impacto Estratégico

Speed and scale

Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.

Access and reach

Amplía el acceso a través de idiomas y estilos de comunicación.

Decisiones más claras

Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.

El futuro de la optimización de las preferencias del índice de probabilidades

ORPO está ganando terreno porque reduce la memoria y la computación al eliminar el modelo de referencia, lo cual es atractivo para los equipos que realizan ajustes en hardware limitado. Espere que aparezca con más frecuencia en recetas de código abierto y como opción predeterminada en bibliotecas como Hugging Face TRL. Es probable que el trabajo futuro ajuste la ponderación lambda automáticamente, combine ORPO con otros objetivos sin referencia y lo extienda a modelos multimodales y muy grandes donde mantener dos copias en la memoria es costoso.

Implementación en el mundo real

Ajuste de un modelo de chat 7B de código abierto en pares de preferencias sin cargar una segunda copia de referencia, reduciendo a la mitad la memoria de la GPU

Una startup que alinea a un asistente de atención al cliente para que prefiera respuestas educadas y acordes con las políticas en una sola sesión de capacitación en lugar de SFT y luego DPO.

Investigadores que comparan ORPO con DPO en el mismo conjunto de datos para mostrar una alineación comparable con una computación más baja

Adaptar un modelo base a un dominio especializado (por ejemplo, redacción legal) donde se encuentran disponibles pares de ejemplos buenos y malos, pero no el presupuesto del modelo de recompensa.

Riesgos y barandillas

Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.

La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.

Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.

Hoja de ruta de implementación

1

Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.

2

Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.

3

Mantenga un punto de control de revisión humana para los resultados de alto riesgo.

4

Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Odds Ratio Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Optimización de preferencias directas

Preguntas frecuentes

What is Odds Ratio Preference Optimization?

La optimización de preferencias de índice de probabilidades (ORPO) es un método de ajuste que enseña a un modelo de lenguaje el buen comportamiento y las preferencias humanas en una sola pasada de entrenamiento. Es importante porque omite el modelo de recompensa y el modelo de referencia separados habituales, lo que hace que la alineación sea más barata y sencilla.

¿Cuál es la principal ventaja práctica de ORPO sobre métodos como DPO?

ORPO incorpora el aprendizaje de preferencias en la pérdida de SFT y no necesita una copia de referencia congelada del modelo, lo que ahorra memoria y cálculo.

¿Con qué se compara el 'odds ratio' en ORPO?

ORPO utiliza la relación de probabilidades (p/(1-p)) que el modelo asigna a la respuesta preferida versus la no preferida.

¿ORPO realiza qué dos tareas en un solo pase de entrenamiento?

ORPO combina el objetivo estándar del siguiente token de SFT con una penalización de preferencia en una pérdida unificada.

¿Por qué ORPO utiliza probabilidades en lugar de una diferencia de probabilidad logarítmica bruta para la penalización?

La penalización basada en probabilidades es más leve, lo que ayuda al modelo sin referencia a mantener una generación fluida sin dejar de preferir buenas respuestas.

¿Qué combinación se describe mejor la pérdida de ORPO?

ORPO agrega un término de odds-ratio log-sigmoide ponderado además de la pérdida de entropía cruzada supervisada.