GUIA Técnico

Otimização de Política Relativa de Grupo

A Otimização de Política Relativa de Grupo (GRPO) é um método de aprendizagem por reforço para ajustar modelos de linguagem que avalia cada resposta em relação a um grupo de respostas irmãs ao mesmo prompt, eliminando a rede de valores separada usada pelo PPO.

  • 2 minutos de leitura
  • Última atualização
Nesta página2 minutos de leitura
  1. Visão geral
  2. Mergulho profundo
  3. Impacto Estratégico
  4. O futuro da otimização de políticas relativas de grupo
  5. Implementação no mundo real
  6. Riscos e guarda-corpos
  7. Roteiro de implementação
  8. Continue explorando
  9. Perguntas frequentes

Visão geral

It became famous as the core training trick behind DeepSeek's reasoning models.

Mergulho profundo

GRPO é uma variante do aprendizado por reforço de gradiente de política projetado para tornar o ajuste fino de RL de grandes modelos de linguagem mais barato e mais estável. O PPO padrão precisa de um “crítico” aprendido (modelo de valor), aproximadamente tão grande quanto a própria política, para estimar a qualidade de cada token. GRPO remove totalmente esse crítico. Para cada solicitação, ele amostra um grupo de conclusões (digamos 8-64), pontua todas elas com um sinal de recompensa e, em seguida, calcula a vantagem de cada conclusão padronizando sua recompensa em relação à média e ao desvio padrão do grupo. As respostas acima da média são reforçadas e as abaixo da média são suprimidas. Um termo de divergência KL mantém o modelo próximo de uma política de referência. Introduzido pelo DeepSeek, ele alimentou os modelos de raciocínio DeepSeekMath e DeepSeek-R1.

Impacto Estratégico

Custo e orçamento

As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.

Decisões mais claras

A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.

Controle de qualidade

Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.

O futuro da otimização de políticas relativas de grupo

O GRPO rapidamente se tornou uma receita padrão para o treinamento de modelos de raciocínio aberto, e os laboratórios estão iterando seus pontos fracos. Os pesquisadores estão explorando soluções para vieses de comprimento e dificuldade (como Dr. GRPO), normalização em nível de token em vez de nível de sequência e removendo ou remodelando o termo KL. Espere uma integração mais estreita com recompensas verificáveis ​​(matemática, código, uso de ferramentas), melhor tratamento de sinais esparsos e híbridos que combinam linhas de base de grupo com críticas leves para tarefas de agente em várias etapas.

Implementação no mundo real

Treinando DeepSeek-R1 e DeepSeekMath para produzir raciocínio de longa cadeia de pensamento usando recompensas de correção baseadas em regras em problemas matemáticos

Modelos de geração de código de ajuste fino em que cada solução amostrada é pontuada pela aprovação em testes de unidade e o grupo é normalizado para escolher os vencedores

Pipelines RLHF de código aberto (por exemplo, em bibliotecas TRL e verl) usando GRPO para alinhar modelos de chat sem pagar por uma rede de valor separada

Melhorar o seguimento de instruções ou o comportamento de segurança através da amostragem de várias respostas por solicitação e recompensando aquelas que um modelo de recompensa classifica mais alto em relação aos seus pares

Riscos e guarda-corpos

  • A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.

  • Os custos de infraestrutura e manutenção são frequentemente subestimados.

  • As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.

Roteiro de implementação

  1. Defina metas de latência, qualidade e custo antes da implementação.

  2. Benchmark sob condições realistas de carga e dados.

  3. Monitoramento de instrumentos para erros, desvios e impacto no usuário.

  4. Prepare caminhos de reversão e resposta a incidentes antes de escalar.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is Group Relative Policy Optimization?

A Otimização de Política Relativa de Grupo (GRPO) é um método de aprendizagem por reforço para ajustar modelos de linguagem que avalia cada resposta em relação a um grupo de respostas irmãs ao mesmo prompt, eliminando a rede de valores separada usada pelo PPO. Tornou-se famoso como o principal truque de treinamento por trás dos modelos de raciocínio do DeepSeek.

Qual componente principal do PPO o GRPO elimina?

A mudança de assinatura do GRPO está eliminando o modelo de valor/crítico aprendido do PPO, que normalmente tem aproximadamente o mesmo tamanho da política, economizando memória e computação substanciais.

Como o GRPO calcula a vantagem de uma determinada conclusão?

A vantagem de cada conclusão é (recompensa - média do grupo)/desvio padrão do grupo, portanto, o grupo de respostas ao mesmo prompt atua como linha de base.

Quais modelos tornaram o GRPO conhecido?

GRPO foi introduzido e popularizado pelo DeepSeek, principalmente no DeepSeekMath e como o mecanismo RL por trás dos modelos de raciocínio DeepSeek-R1.

Qual o papel do termo divergência KL no GRPO?

Uma penalidade KL contra um modelo de referência (geralmente o pré-RL) regulariza o treinamento para que a política melhore sem entrar em colapso ou derivar em resultados degenerados.

Por que o GRPO é especialmente atraente para treinar modelos de raciocínio em matemática ou código?

Amostragem de muitas soluções e pontuação delas com verificações automáticas de correção combinam perfeitamente com as vantagens normalizadas de grupo do GRPO, sem necessidade de crítica.