Normalização de recompensa agrupada em RLHF
A normalização de recompensas agrupadas padroniza as recompensas de um modelo dentro de um lote de respostas ao mesmo prompt, transformando pontuações barulhentas em um sinal de treinamento estável.
Visão geral
It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.
Mergulho profundo
Na aprendizagem por reforço a partir de feedback humano (RLHF), um modelo gera respostas e um modelo de recompensa as pontua, mas as recompensas brutas são barulhentas e variam muito entre os prompts. A normalização de recompensa agrupada corrige isso amostrando um grupo de várias respostas ao mesmo prompt e, em seguida, normalizando cada recompensa subtraindo a média do grupo e dividindo pelo desvio padrão do grupo. Essa pontuação z se torna a vantagem. A abordagem é central para a Otimização de Política Relativa de Grupo (GRPO), introduzida pelo DeepSeek, que impulsionou o raciocínio do DeepSeek-R1. Crucialmente, o GRPO elimina a rede de valor separada (crítica) usada pelo PPO, uma vez que a média do grupo serve como linha de base. Isso torna o treinamento mais simples, mais barato e mais eficiente em termos de memória, ao mesmo tempo que mantém o sinal de gradiente bem dimensionado.
Visão Técnica
Para um grupo de resultados com recompensas r_1...r_G, a vantagem é A_i = (r_i − média(r)) / std(r). Respostas melhores que a média do grupo obtêm vantagem positiva e são reforçadas; os piores que a média são empurrados para baixo. Como a comparação é relativa dentro de uma escala de recompensa imediata e absoluta, a dificuldade por solicitação é anulada, reduzindo a variação. O GRPO mantém o objetivo reduzido do PPO e a penalidade KL em relação a uma política de referência para evitar que o modelo se desloque muito.
Impacto Estratégico
Decisões mais claras
Ajuda a separar afirmações técnicas claras da linguagem de marketing.
Custo e orçamento
Você pode fazer perguntas melhores sobre implementação antes de gastar dinheiro ou tempo.
Equipe e fluxo de trabalho
Equipes com entendimento compartilhado tomam melhores decisões sobre produtos, políticas e aprendizado.
O futuro da normalização de recompensas agrupadas em RLHF
A normalização agrupada está alimentando o boom dos modelos de raciocínio, onde os modelos aprendem com recompensas verificáveis, como respostas matemáticas corretas, sem um crítico instruído. A investigação está a refiná-lo: debates sobre a possibilidade de dividir por desvio padrão, lidar com grupos totalmente corretos ou totalmente errados que produzem vantagem zero e dimensionar o tamanho do grupo. Espere que métodos agrupados e livres de críticas se espalhem para o uso de ferramentas de agente e geração de código, onde verificadores automáticos fornecem sinais de recompensa abundantes e baratos.
Implementação no mundo real
Treinar um modelo de raciocínio matemático amostrando 16 soluções por problema e recompensando aqueles que estiverem acima da média de acerto do grupo.
Ajustar a utilidade de um chatbot normalizando as pontuações do modelo de recompensa em várias respostas de candidatos a cada solicitação do usuário.
Melhorar um assistente de codificação onde cada solução amostrada é pontuada de acordo com a aprovação nos testes de unidade e, em seguida, normalizada dentro do grupo.
Reduzindo a memória da GPU em um pipeline RLHF eliminando a rede crítica PPO e usando a média do grupo como linha de base.
Riscos e guarda-corpos
Equipes diferentes podem usar o mesmo termo de maneira diferente, portanto, defina o escopo com antecedência.
Os benchmarks podem parecer fortes, enquanto o desempenho no mundo real é irregular.
Ignorar a qualidade dos dados e os planos de avaliação cria frequentemente resultados frágeis.
Roteiro de implementação
Comece com uma definição em linguagem simples do resultado que você precisa.
Escolha uma métrica de sucesso e uma condição de falha antes de testar.
Execute um pequeno piloto com dados representativos, não um conjunto de demonstração sofisticado.
Documente onde a normalização de recompensa agrupada em RLHF ajuda e onde métodos mais simples são melhores.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped Reward Normalization in RLHF quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Normalização de comprimento na otimização de preferências
Perguntas frequentes
What is Grouped Reward Normalization in RLHF?
A normalização de recompensas agrupadas padroniza as recompensas de um modelo dentro de um lote de respostas ao mesmo prompt, transformando pontuações barulhentas em um sinal de treinamento estável. É o truque principal por trás do GRPO, o algoritmo que alimenta muitos modelos de raciocínio modernos.
Na normalização de recompensa agrupada, com o que a recompensa de cada resposta é comparada?
Cada recompensa é convertida em uma pontuação z usando a média e o desvio padrão do grupo de respostas ao mesmo prompt.
Qual algoritmo está mais associado à normalização de recompensas agrupadas?
GRPO, introduzido pelo DeepSeek e usado no DeepSeek-R1, é construído em torno da normalização de recompensas dentro de um grupo.
Qual componente do PPO padrão o GRPO elimina notavelmente?
Ao usar a média do grupo como linha de base, o GRPO elimina o crítico aprendido, economizando memória e computação.
O que acontece com uma resposta cuja recompensa está abaixo da média do grupo?
Subtrair a média do grupo faz com que as respostas abaixo da média tenham vantagem negativa, afastando a política delas.
Por que a normalização dentro de um grupo reduz a variação do treinamento?
Como as comparações são relativas dentro de cada prompt, as diferenças na escala absoluta e na dificuldade do prompt desaparecem.