Optimización de políticas próximas
La optimización de políticas próximas (PPO) es el algoritmo de aprendizaje por refuerzo más asociado con el ajuste de modelos de lenguaje a partir de comentarios humanos.
Descripción general
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Buceo profundo
PPO fue introducido por OpenAI en 2017 y se convirtió en el caballo de batalla detrás de RLHF para sistemas como InstructGPT y ChatGPT. El principal desafío en la RL con gradiente de políticas es que una única actualización demasiado grande puede colapsar el rendimiento. PPO aborda esto con un 'objetivo sustituto recortado': mide cuánto más (o menos) probable se ha vuelto una acción en comparación con la política anterior, multiplica esa proporción por la ventaja (cuánto mejor fue la acción de lo esperado) y recorta la proporción a un rango pequeño como 0,8 a 1,2. Esto limita hasta dónde puede avanzar la política por actualización, manteniendo el aprendizaje estable y al mismo tiempo permitiendo una mejora constante. En el modelo de lenguaje RLHF, la 'acción' genera una señal o respuesta, la recompensa proviene de un modelo de recompensa y una penalización de divergencia KL evita que el modelo se aleje demasiado de su comportamiento original.
Información técnica
PPO maximiza un objetivo recortado: min(ratio * ventaja, clip(ratio, 1-eps, 1+eps) * ventaja), donde ratio es la probabilidad de acción nueva sobre antigua. Las ventajas generalmente se estiman con una estimación de ventajas generalizada y una red de valores aprendidos (críticos). En RLHF, la recompensa total combina la puntuación del modelo de recompensa con una penalización de KL por token contra la política de referencia, equilibrando la ganancia de recompensa con el mantenimiento cercano al modelo original.
Impacto Estratégico
Speed and scale
Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.
Access and reach
Amplía el acceso a través de idiomas y estilos de comunicación.
Decisiones más claras
Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.
El futuro de la optimización de políticas próximas
PPO sigue siendo fuerte, pero es notoriamente complicado: necesita una red de valor separada, un cuidadoso ajuste de hiperparámetros y mucha computación. Están ganando terreno alternativas más simples, incluidas DPO (sin RL en absoluto) y GRPO, que elimina la red de valor al estimar ventajas a partir de grupos de respuestas muestreadas y ha impulsado modelos de razonamiento recientes. La PPO persistirá allí donde la exploración de políticas realmente ayude, pero el campo está cambiando activamente parte de su complejidad por métodos más baratos.
Implementación en el mundo real
Ajuste de InstructGPT y ChatGPT para seguir instrucciones y preferencias humanas a través de RLHF
Formación de agentes de control de juegos y robótica, el dominio original de PPO antes de los modelos de lenguaje
Reducir la toxicidad o mejorar la utilidad maximizando la puntuación del modelo de recompensa bajo una restricción de KL
Optimizar el uso de herramientas o el comportamiento del agente de varios pasos donde un modelo es recompensado por completar las tareas correctamente
Riesgos y barandillas
Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.
La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.
Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.
Hoja de ruta de implementación
Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.
Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.
Mantenga un punto de control de revisión humana para los resultados de alto riesgo.
Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Optimización de políticas relativas al grupo
Preguntas frecuentes
What is Proximal Policy Optimization?
La optimización de políticas próximas (PPO) es el algoritmo de aprendizaje por refuerzo más asociado con el ajuste de modelos de lenguaje a partir de comentarios humanos. Mejora una política con pasos pequeños y cuidadosos para evitar la inestabilidad que afecta a los métodos ingenuos de gradiente de políticas.
¿Qué problema aborda principalmente el 'recorte' de PPO?
Recortar el índice de probabilidad evita que cualquier actualización haga avanzar demasiado la política, lo que es la principal fuente de inestabilidad en los métodos de gradiente de políticas.
En el modelo de lenguaje RLHF con PPO, ¿de dónde suele venir la señal de recompensa?
Un modelo de recompensa proporciona la recompensa escalar por las respuestas generadas, ya que sería inviable que los humanos calificaran cada resultado durante la RL.
¿Qué efecto tiene la penalización por divergencia de KL en el RLHF basado en PPO?
La penalización de KL por token contra la política original (de referencia) disuade al modelo de cambiar su comportamiento demasiado drásticamente mientras busca la recompensa.
¿Cuál es el papel de la red de valor (crítica) en PPO?
PPO es un método actor-crítico; la red de valor estima la recompensa esperada, lo que permite estimaciones de ventajas (a menudo a través de GAE) que reducen la variación.
¿Qué representa la 'ventaja' en PPO?
La ventaja mide cuánto mejor (o peor) fue una acción elegida en relación con el valor estimado, indicando a la política qué acciones reforzar.