A continuaciónSiguiente guía
Optimización de políticas próximas
Idioma IA
GUÍA Técnica
La optimización de políticas relativas al grupo (GRPO) es un método de aprendizaje por refuerzo para ajustar los modelos de lenguaje que juzga cada respuesta frente a un grupo de respuestas de hermanos al mismo mensaje, eliminando la red de valores separados utilizada por PPO.
It became famous as the core training trick behind DeepSeek's reasoning models.
GRPO es una variante del aprendizaje por refuerzo de gradiente de políticas diseñada para hacer que el ajuste fino de RL de modelos de lenguaje grandes sea más barato y más estable. La PPO estándar necesita un 'crítico' aprendido (modelo de valor), aproximadamente tan grande como la política misma, para estimar qué tan bueno es cada token. GRPO elimina esa crítica por completo. Para cada indicación, toma una muestra de un grupo de compleciones (por ejemplo, 8 a 64), las califica todas con una señal de recompensa y luego calcula la ventaja de cada compleción estandarizando su recompensa con la media y la desviación estándar del grupo. Las respuestas superiores a la media se refuerzan y las inferiores se suprimen. Un término de divergencia KL mantiene el modelo cerca de una política de referencia. Introducido por DeepSeek, impulsó los modelos de razonamiento DeepSeekMath y DeepSeek-R1.
Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.
La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.
Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.
GRPO se ha convertido rápidamente en una receta predeterminada para entrenar modelos de razonamiento abierto y los laboratorios están iterando en sus puntos débiles. Los investigadores están explorando soluciones para los sesgos de longitud y dificultad (como el Dr. GRPO), la normalización a nivel de token en lugar de a nivel de secuencia, y eliminando o remodelando el término KL. Espere una integración más estrecha con recompensas verificables (matemáticas, código, uso de herramientas), un mejor manejo de señales dispersas e híbridos que combinan líneas de base grupales con críticas ligeras para tareas agentes de varios pasos.
Entrenamiento de DeepSeek-R1 y DeepSeekMath para producir razonamientos de larga cadena de pensamiento utilizando recompensas de corrección basadas en reglas en problemas matemáticos
Ajustar los modelos de generación de código donde cada solución de muestra se califica según si pasa las pruebas unitarias y el grupo se normaliza para elegir a los ganadores.
Canalizaciones RLHF de código abierto (por ejemplo, en bibliotecas TRL y verl) que utilizan GRPO para alinear modelos de chat sin pagar por una red de valor separada
Mejorar el seguimiento de instrucciones o el comportamiento de seguridad al muestrear varias respuestas por mensaje y recompensar aquellas que un modelo de recompensa califica más alto en relación con sus pares.
La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.
Los costos de infraestructura y mantenimiento a menudo se subestiman.
Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.
Defina objetivos de latencia, calidad y costos antes de la implementación.
Comparación en condiciones realistas de carga y datos.
Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.
Prepare rutas de reversión y respuesta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
La optimización de políticas relativas al grupo (GRPO) es un método de aprendizaje por refuerzo para ajustar los modelos de lenguaje que juzga cada respuesta frente a un grupo de respuestas de hermanos al mismo mensaje, eliminando la red de valores separados utilizada por PPO. Se hizo famoso como el truco de entrenamiento central detrás de los modelos de razonamiento de DeepSeek.
El cambio característico de GRPO es eliminar el modelo crítico/valor aprendido de PPO, que normalmente tiene aproximadamente el mismo tamaño que la política, lo que ahorra una cantidad sustancial de memoria y computación.
La ventaja de cada finalización es (recompensa - media del grupo) / desviación estándar del grupo, por lo que el grupo de respuestas al mismo mensaje actúa como línea de base.
GRPO fue introducido y popularizado por DeepSeek, especialmente en DeepSeekMath y como motor RL detrás de los modelos de razonamiento DeepSeek-R1.
Una penalización de KL contra un modelo de referencia (generalmente el anterior a RL) regulariza la capacitación para que la política mejore sin colapsar o derivar hacia resultados degenerados.
Tomar muestras de muchas soluciones y calificarlas con comprobaciones automáticas de corrección se combina perfectamente con las ventajas normalizadas por grupo de GRPO, sin necesidad de críticas.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Optimización de políticas próximas
Idioma IA