A seguirPróximo guia
Otimização de Política Proximal
IA de linguagem
GUIA Técnico
A Otimização de Política Relativa de Grupo (GRPO) é um método de aprendizagem por reforço para ajustar modelos de linguagem que avalia cada resposta em relação a um grupo de respostas irmãs ao mesmo prompt, eliminando a rede de valores separada usada pelo PPO.
It became famous as the core training trick behind DeepSeek's reasoning models.
GRPO é uma variante do aprendizado por reforço de gradiente de política projetado para tornar o ajuste fino de RL de grandes modelos de linguagem mais barato e mais estável. O PPO padrão precisa de um “crítico” aprendido (modelo de valor), aproximadamente tão grande quanto a própria política, para estimar a qualidade de cada token. GRPO remove totalmente esse crítico. Para cada solicitação, ele amostra um grupo de conclusões (digamos 8-64), pontua todas elas com um sinal de recompensa e, em seguida, calcula a vantagem de cada conclusão padronizando sua recompensa em relação à média e ao desvio padrão do grupo. As respostas acima da média são reforçadas e as abaixo da média são suprimidas. Um termo de divergência KL mantém o modelo próximo de uma política de referência. Introduzido pelo DeepSeek, ele alimentou os modelos de raciocínio DeepSeekMath e DeepSeek-R1.
As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.
A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.
Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.
O GRPO rapidamente se tornou uma receita padrão para o treinamento de modelos de raciocínio aberto, e os laboratórios estão iterando seus pontos fracos. Os pesquisadores estão explorando soluções para vieses de comprimento e dificuldade (como Dr. GRPO), normalização em nível de token em vez de nível de sequência e removendo ou remodelando o termo KL. Espere uma integração mais estreita com recompensas verificáveis (matemática, código, uso de ferramentas), melhor tratamento de sinais esparsos e híbridos que combinam linhas de base de grupo com críticas leves para tarefas de agente em várias etapas.
Treinando DeepSeek-R1 e DeepSeekMath para produzir raciocínio de longa cadeia de pensamento usando recompensas de correção baseadas em regras em problemas matemáticos
Modelos de geração de código de ajuste fino em que cada solução amostrada é pontuada pela aprovação em testes de unidade e o grupo é normalizado para escolher os vencedores
Pipelines RLHF de código aberto (por exemplo, em bibliotecas TRL e verl) usando GRPO para alinhar modelos de chat sem pagar por uma rede de valor separada
Melhorar o seguimento de instruções ou o comportamento de segurança através da amostragem de várias respostas por solicitação e recompensando aquelas que um modelo de recompensa classifica mais alto em relação aos seus pares
A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.
Os custos de infraestrutura e manutenção são frequentemente subestimados.
As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.
Defina metas de latência, qualidade e custo antes da implementação.
Benchmark sob condições realistas de carga e dados.
Monitoramento de instrumentos para erros, desvios e impacto no usuário.
Prepare caminhos de reversão e resposta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
A Otimização de Política Relativa de Grupo (GRPO) é um método de aprendizagem por reforço para ajustar modelos de linguagem que avalia cada resposta em relação a um grupo de respostas irmãs ao mesmo prompt, eliminando a rede de valores separada usada pelo PPO. Tornou-se famoso como o principal truque de treinamento por trás dos modelos de raciocínio do DeepSeek.
A mudança de assinatura do GRPO está eliminando o modelo de valor/crítico aprendido do PPO, que normalmente tem aproximadamente o mesmo tamanho da política, economizando memória e computação substanciais.
A vantagem de cada conclusão é (recompensa - média do grupo)/desvio padrão do grupo, portanto, o grupo de respostas ao mesmo prompt atua como linha de base.
GRPO foi introduzido e popularizado pelo DeepSeek, principalmente no DeepSeekMath e como o mecanismo RL por trás dos modelos de raciocínio DeepSeek-R1.
Uma penalidade KL contra um modelo de referência (geralmente o pré-RL) regulariza o treinamento para que a política melhore sem entrar em colapso ou derivar em resultados degenerados.
Amostragem de muitas soluções e pontuação delas com verificações automáticas de correção combinam perfeitamente com as vantagens normalizadas de grupo do GRPO, sem necessidade de crítica.
Continue aprendendo
Mais guias escolhidos para este tópico
A seguirPróximo guia
Otimização de Política Proximal
IA de linguagem