GUÍA Técnica

Optimización de políticas relativas al grupo

La optimización de políticas relativas al grupo (GRPO) es un método de aprendizaje por refuerzo para ajustar los modelos de lenguaje que juzga cada respuesta frente a un grupo de respuestas de hermanos al mismo mensaje, eliminando la red de valores separados utilizada por PPO.

  • 2 minutos de lectura
  • Última actualización
En esta pagina2 minutos de lectura
  1. Descripción general
  2. Buceo profundo
  3. Impacto Estratégico
  4. El futuro de la optimización de políticas relativas al grupo
  5. Implementación en el mundo real
  6. Riesgos y barandillas
  7. Hoja de ruta de implementación
  8. Sigue explorando
  9. Preguntas frecuentes

Descripción general

It became famous as the core training trick behind DeepSeek's reasoning models.

Buceo profundo

GRPO es una variante del aprendizaje por refuerzo de gradiente de políticas diseñada para hacer que el ajuste fino de RL de modelos de lenguaje grandes sea más barato y más estable. La PPO estándar necesita un 'crítico' aprendido (modelo de valor), aproximadamente tan grande como la política misma, para estimar qué tan bueno es cada token. GRPO elimina esa crítica por completo. Para cada indicación, toma una muestra de un grupo de compleciones (por ejemplo, 8 a 64), las califica todas con una señal de recompensa y luego calcula la ventaja de cada compleción estandarizando su recompensa con la media y la desviación estándar del grupo. Las respuestas superiores a la media se refuerzan y las inferiores se suprimen. Un término de divergencia KL mantiene el modelo cerca de una política de referencia. Introducido por DeepSeek, impulsó los modelos de razonamiento DeepSeekMath y DeepSeek-R1.

Impacto Estratégico

Costo y presupuesto

Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.

Decisiones más claras

La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.

control de calidad

Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.

El futuro de la optimización de políticas relativas al grupo

GRPO se ha convertido rápidamente en una receta predeterminada para entrenar modelos de razonamiento abierto y los laboratorios están iterando en sus puntos débiles. Los investigadores están explorando soluciones para los sesgos de longitud y dificultad (como el Dr. GRPO), la normalización a nivel de token en lugar de a nivel de secuencia, y eliminando o remodelando el término KL. Espere una integración más estrecha con recompensas verificables (matemáticas, código, uso de herramientas), un mejor manejo de señales dispersas e híbridos que combinan líneas de base grupales con críticas ligeras para tareas agentes de varios pasos.

Implementación en el mundo real

Entrenamiento de DeepSeek-R1 y DeepSeekMath para producir razonamientos de larga cadena de pensamiento utilizando recompensas de corrección basadas en reglas en problemas matemáticos

Ajustar los modelos de generación de código donde cada solución de muestra se califica según si pasa las pruebas unitarias y el grupo se normaliza para elegir a los ganadores.

Canalizaciones RLHF de código abierto (por ejemplo, en bibliotecas TRL y verl) que utilizan GRPO para alinear modelos de chat sin pagar por una red de valor separada

Mejorar el seguimiento de instrucciones o el comportamiento de seguridad al muestrear varias respuestas por mensaje y recompensar aquellas que un modelo de recompensa califica más alto en relación con sus pares.

Riesgos y barandillas

  • La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.

  • Los costos de infraestructura y mantenimiento a menudo se subestiman.

  • Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.

Hoja de ruta de implementación

  1. Defina objetivos de latencia, calidad y costos antes de la implementación.

  2. Comparación en condiciones realistas de carga y datos.

  3. Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.

  4. Prepare rutas de reversión y respuesta a incidentes antes de escalar.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

What is Group Relative Policy Optimization?

La optimización de políticas relativas al grupo (GRPO) es un método de aprendizaje por refuerzo para ajustar los modelos de lenguaje que juzga cada respuesta frente a un grupo de respuestas de hermanos al mismo mensaje, eliminando la red de valores separados utilizada por PPO. Se hizo famoso como el truco de entrenamiento central detrás de los modelos de razonamiento de DeepSeek.

¿Qué componente principal de PPO elimina GRPO?

El cambio característico de GRPO es eliminar el modelo crítico/valor aprendido de PPO, que normalmente tiene aproximadamente el mismo tamaño que la política, lo que ahorra una cantidad sustancial de memoria y computación.

¿Cómo calcula GRPO la ventaja para una finalización determinada?

La ventaja de cada finalización es (recompensa - media del grupo) / desviación estándar del grupo, por lo que el grupo de respuestas al mismo mensaje actúa como línea de base.

¿Qué modelos dieron fama a GRPO?

GRPO fue introducido y popularizado por DeepSeek, especialmente en DeepSeekMath y como motor RL detrás de los modelos de razonamiento DeepSeek-R1.

¿Qué papel juega el término de divergencia KL en GRPO?

Una penalización de KL contra un modelo de referencia (generalmente el anterior a RL) regulariza la capacitación para que la política mejore sin colapsar o derivar hacia resultados degenerados.

¿Por qué GRPO es especialmente atractivo para entrenar modelos de razonamiento en matemáticas o código?

Tomar muestras de muchas soluciones y calificarlas con comprobaciones automáticas de corrección se combina perfectamente con las ventajas normalizadas por grupo de GRPO, sin necesidad de críticas.