GUÍA de IA en idiomas

Optimización de políticas próximas

La optimización de políticas próximas (PPO) es el algoritmo de aprendizaje por refuerzo más asociado con el ajuste de modelos de lenguaje a partir de comentarios humanos.

2 minutos de lecturaÚltima actualización

Descripción general

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

Buceo profundo

PPO fue introducido por OpenAI en 2017 y se convirtió en el caballo de batalla detrás de RLHF para sistemas como InstructGPT y ChatGPT. El principal desafío en la RL con gradiente de políticas es que una única actualización demasiado grande puede colapsar el rendimiento. PPO aborda esto con un 'objetivo sustituto recortado': mide cuánto más (o menos) probable se ha vuelto una acción en comparación con la política anterior, multiplica esa proporción por la ventaja (cuánto mejor fue la acción de lo esperado) y recorta la proporción a un rango pequeño como 0,8 a 1,2. Esto limita hasta dónde puede avanzar la política por actualización, manteniendo el aprendizaje estable y al mismo tiempo permitiendo una mejora constante. En el modelo de lenguaje RLHF, la 'acción' genera una señal o respuesta, la recompensa proviene de un modelo de recompensa y una penalización de divergencia KL evita que el modelo se aleje demasiado de su comportamiento original.

Información técnica

PPO maximiza un objetivo recortado: min(ratio * ventaja, clip(ratio, 1-eps, 1+eps) * ventaja), donde ratio es la probabilidad de acción nueva sobre antigua. Las ventajas generalmente se estiman con una estimación de ventajas generalizada y una red de valores aprendidos (críticos). En RLHF, la recompensa total combina la puntuación del modelo de recompensa con una penalización de KL por token contra la política de referencia, equilibrando la ganancia de recompensa con el mantenimiento cercano al modelo original.

Impacto Estratégico

Speed and scale

Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.

Access and reach

Amplía el acceso a través de idiomas y estilos de comunicación.

Decisiones más claras

Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.

El futuro de la optimización de políticas próximas

PPO sigue siendo fuerte, pero es notoriamente complicado: necesita una red de valor separada, un cuidadoso ajuste de hiperparámetros y mucha computación. Están ganando terreno alternativas más simples, incluidas DPO (sin RL en absoluto) y GRPO, que elimina la red de valor al estimar ventajas a partir de grupos de respuestas muestreadas y ha impulsado modelos de razonamiento recientes. La PPO persistirá allí donde la exploración de políticas realmente ayude, pero el campo está cambiando activamente parte de su complejidad por métodos más baratos.

Implementación en el mundo real

Ajuste de InstructGPT y ChatGPT para seguir instrucciones y preferencias humanas a través de RLHF

Formación de agentes de control de juegos y robótica, el dominio original de PPO antes de los modelos de lenguaje

Reducir la toxicidad o mejorar la utilidad maximizando la puntuación del modelo de recompensa bajo una restricción de KL

Optimizar el uso de herramientas o el comportamiento del agente de varios pasos donde un modelo es recompensado por completar las tareas correctamente

Riesgos y barandillas

Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.

La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.

Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.

Hoja de ruta de implementación

1

Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.

2

Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.

3

Mantenga un punto de control de revisión humana para los resultados de alto riesgo.

4

Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Optimización de políticas relativas al grupo

Preguntas frecuentes

What is Proximal Policy Optimization?

La optimización de políticas próximas (PPO) es el algoritmo de aprendizaje por refuerzo más asociado con el ajuste de modelos de lenguaje a partir de comentarios humanos. Mejora una política con pasos pequeños y cuidadosos para evitar la inestabilidad que afecta a los métodos ingenuos de gradiente de políticas.

¿Qué problema aborda principalmente el 'recorte' de PPO?

Recortar el índice de probabilidad evita que cualquier actualización haga avanzar demasiado la política, lo que es la principal fuente de inestabilidad en los métodos de gradiente de políticas.

En el modelo de lenguaje RLHF con PPO, ¿de dónde suele venir la señal de recompensa?

Un modelo de recompensa proporciona la recompensa escalar por las respuestas generadas, ya que sería inviable que los humanos calificaran cada resultado durante la RL.

¿Qué efecto tiene la penalización por divergencia de KL en el RLHF basado en PPO?

La penalización de KL por token contra la política original (de referencia) disuade al modelo de cambiar su comportamiento demasiado drásticamente mientras busca la recompensa.

¿Cuál es el papel de la red de valor (crítica) en PPO?

PPO es un método actor-crítico; la red de valor estima la recompensa esperada, lo que permite estimaciones de ventajas (a menudo a través de GAE) que reducen la variación.

¿Qué representa la 'ventaja' en PPO?

La ventaja mide cuánto mejor (o peor) fue una acción elegida en relación con el valor estimado, indicando a la política qué acciones reforzar.