GUIA de fundamentos

Normalização de recompensa agrupada em RLHF

A normalização de recompensas agrupadas padroniza as recompensas de um modelo dentro de um lote de respostas ao mesmo prompt, transformando pontuações barulhentas em um sinal de treinamento estável.

2 minutos de leituraÚltima atualização

Visão geral

It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.

Mergulho profundo

Na aprendizagem por reforço a partir de feedback humano (RLHF), um modelo gera respostas e um modelo de recompensa as pontua, mas as recompensas brutas são barulhentas e variam muito entre os prompts. A normalização de recompensa agrupada corrige isso amostrando um grupo de várias respostas ao mesmo prompt e, em seguida, normalizando cada recompensa subtraindo a média do grupo e dividindo pelo desvio padrão do grupo. Essa pontuação z se torna a vantagem. A abordagem é central para a Otimização de Política Relativa de Grupo (GRPO), introduzida pelo DeepSeek, que impulsionou o raciocínio do DeepSeek-R1. Crucialmente, o GRPO elimina a rede de valor separada (crítica) usada pelo PPO, uma vez que a média do grupo serve como linha de base. Isso torna o treinamento mais simples, mais barato e mais eficiente em termos de memória, ao mesmo tempo que mantém o sinal de gradiente bem dimensionado.

Visão Técnica

Para um grupo de resultados com recompensas r_1...r_G, a vantagem é A_i = (r_i − média(r)) / std(r). Respostas melhores que a média do grupo obtêm vantagem positiva e são reforçadas; os piores que a média são empurrados para baixo. Como a comparação é relativa dentro de uma escala de recompensa imediata e absoluta, a dificuldade por solicitação é anulada, reduzindo a variação. O GRPO mantém o objetivo reduzido do PPO e a penalidade KL em relação a uma política de referência para evitar que o modelo se desloque muito.

Impacto Estratégico

Decisões mais claras

Ajuda a separar afirmações técnicas claras da linguagem de marketing.

Custo e orçamento

Você pode fazer perguntas melhores sobre implementação antes de gastar dinheiro ou tempo.

Equipe e fluxo de trabalho

Equipes com entendimento compartilhado tomam melhores decisões sobre produtos, políticas e aprendizado.

O futuro da normalização de recompensas agrupadas em RLHF

A normalização agrupada está alimentando o boom dos modelos de raciocínio, onde os modelos aprendem com recompensas verificáveis, como respostas matemáticas corretas, sem um crítico instruído. A investigação está a refiná-lo: debates sobre a possibilidade de dividir por desvio padrão, lidar com grupos totalmente corretos ou totalmente errados que produzem vantagem zero e dimensionar o tamanho do grupo. Espere que métodos agrupados e livres de críticas se espalhem para o uso de ferramentas de agente e geração de código, onde verificadores automáticos fornecem sinais de recompensa abundantes e baratos.

Implementação no mundo real

Treinar um modelo de raciocínio matemático amostrando 16 soluções por problema e recompensando aqueles que estiverem acima da média de acerto do grupo.

Ajustar a utilidade de um chatbot normalizando as pontuações do modelo de recompensa em várias respostas de candidatos a cada solicitação do usuário.

Melhorar um assistente de codificação onde cada solução amostrada é pontuada de acordo com a aprovação nos testes de unidade e, em seguida, normalizada dentro do grupo.

Reduzindo a memória da GPU em um pipeline RLHF eliminando a rede crítica PPO e usando a média do grupo como linha de base.

Riscos e guarda-corpos

Equipes diferentes podem usar o mesmo termo de maneira diferente, portanto, defina o escopo com antecedência.

Os benchmarks podem parecer fortes, enquanto o desempenho no mundo real é irregular.

Ignorar a qualidade dos dados e os planos de avaliação cria frequentemente resultados frágeis.

Roteiro de implementação

1

Comece com uma definição em linguagem simples do resultado que você precisa.

2

Escolha uma métrica de sucesso e uma condição de falha antes de testar.

3

Execute um pequeno piloto com dados representativos, não um conjunto de demonstração sofisticado.

4

Documente onde a normalização de recompensa agrupada em RLHF ajuda e onde métodos mais simples são melhores.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped Reward Normalization in RLHF quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Normalização de comprimento na otimização de preferências

Perguntas frequentes

What is Grouped Reward Normalization in RLHF?

A normalização de recompensas agrupadas padroniza as recompensas de um modelo dentro de um lote de respostas ao mesmo prompt, transformando pontuações barulhentas em um sinal de treinamento estável. É o truque principal por trás do GRPO, o algoritmo que alimenta muitos modelos de raciocínio modernos.

Na normalização de recompensa agrupada, com o que a recompensa de cada resposta é comparada?

Cada recompensa é convertida em uma pontuação z usando a média e o desvio padrão do grupo de respostas ao mesmo prompt.

Qual algoritmo está mais associado à normalização de recompensas agrupadas?

GRPO, introduzido pelo DeepSeek e usado no DeepSeek-R1, é construído em torno da normalização de recompensas dentro de um grupo.

Qual componente do PPO padrão o GRPO elimina notavelmente?

Ao usar a média do grupo como linha de base, o GRPO elimina o crítico aprendido, economizando memória e computação.

O que acontece com uma resposta cuja recompensa está abaixo da média do grupo?

Subtrair a média do grupo faz com que as respostas abaixo da média tenham vantagem negativa, afastando a política delas.

Por que a normalização dentro de um grupo reduz a variação do treinamento?

Como as comparações são relativas dentro de cada prompt, as diferenças na escala absoluta e na dificuldade do prompt desaparecem.