GUIA de IA de linguagem

Modelagem de recompensa

Um modelo de recompensa é uma rede neural treinada para prever quão boa é uma resposta de IA, agindo como um substituto automatizado para o julgamento humano.

2 minutos de leituraÚltima atualização

Visão geral

It is the scoring engine that makes reinforcement learning from human feedback possible at scale.

Mergulho profundo

A modelagem de recompensas resolve um problema prático: os humanos não conseguem avaliar cada um dos milhões de resultados que um modelo gera durante o treinamento. Em vez disso, os rotuladores comparam um pequeno conjunto de respostas, geralmente escolhendo qual das duas respostas para o mesmo prompt é melhor. Um modelo de recompensa é então treinado nessas comparações para gerar uma única pontuação escalar para qualquer par de resposta imediata. O objetivo de treinamento padrão é o modelo Bradley-Terry, que transforma as preferências aos pares em uma probabilidade de que uma resposta supere a outra. Uma vez treinado, esse modelo de recompensa pode avaliar de forma barata novos resultados ilimitados, fornecendo o sinal que algoritmos como o PPO usam para melhorar o modelo de linguagem. Os modelos de recompensa também são reutilizados no momento da inferência para a amostragem melhor de N, onde muitos candidatos são gerados e o de maior pontuação é retornado.

Visão Técnica

Um modelo de recompensa geralmente é o modelo de linguagem base com seu cabeçote de previsão de token substituído por uma única camada linear que emite um escalar. O treinamento maximiza a probabilidade logarítmica de que a resposta escolhida tenha uma pontuação maior que a rejeitada: perda = -log(sigmoid(r_chosen - r_rejected)). Apenas a diferença relativa importa, portanto a escala absoluta é arbitrária. A qualidade depende da consistência dos rótulos e da ampla cobertura dos estilos de resposta.

Impacto Estratégico

Velocidade e escala

Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.

Acesso e alcance

Ele expande o acesso entre idiomas e estilos de comunicação.

Decisões mais claras

As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.

O futuro da modelagem de recompensas

A investigação está a abordar as maiores fraquezas dos modelos de recompensa: podem ser “hackeados” (os modelos exploram peculiaridades como favorecer a duração) e saem da distribuição à medida que a política melhora. As direções promissoras incluem modelos de recompensa de processo que pontuam cada etapa de raciocínio, conjuntos e estimativas de incerteza para resistir a hackers, rótulos de preferência gerados por IA (RLAIF) e modelos de recompensa generativos que produzem críticas e justificativas em vez de um número simples.

Implementação no mundo real

Capacitando o RLHF para assistentes como ChatGPT e Claude pontuando as respostas dos candidatos durante o treinamento PPO

Amostragem melhor de N, onde um modelo gera muitas respostas e o modelo de recompensa seleciona o melhor para o usuário

'Verificadores' de matemática e codificação ou modelos de recompensa de processo que pontuam etapas intermediárias de raciocínio para melhorar a resolução de problemas

Classificar e filtrar dados de treinamento sintéticos, mantendo apenas as gerações com pontuações mais altas para ajustes adicionais

Riscos e guarda-corpos

Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.

A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.

Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.

Roteiro de implementação

1

Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.

2

Respostas terrestres com fontes confiáveis ​​sempre que a precisão for importante.

3

Mantenha um ponto de verificação de revisão humana para resultados de alto risco.

4

Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Modelagem de recompensa Bradley-Terry

Perguntas frequentes

What is Reward Modeling?

Um modelo de recompensa é uma rede neural treinada para prever quão boa é uma resposta de IA, agindo como um substituto automatizado para o julgamento humano. É o mecanismo de pontuação que torna possível o aprendizado por reforço a partir do feedback humano em grande escala.

Qual é o resultado principal de um modelo de recompensa para um determinado par de resposta imediata?

Um modelo de recompensa mapeia um prompt e uma resposta para um número escalar que representa a qualidade prevista ou a preferência humana.

Que tipo de dados humanos são mais comumente usados para treinar modelos de recompensa?

Os rotuladores normalmente comparam duas respostas ao mesmo prompt e escolhem a melhor; o modelo Bradley-Terry converte isso em uma recompensa escalar.

O que a perda do modelo de recompensa padrão otimiza?

A perda de Bradley-Terry, -log(sigmoid(r_chosen - r_rejected)), só se preocupa com a ordem relativa, portanto a escala absoluta é arbitrária.

O que é 'hackeamento de recompensa'?

O hacking de recompensas acontece quando o modelo encontra atalhos (como comprimento excessivo ou bajulação) que o modelo de recompensa imperfeito avalia muito, mas os humanos não.

Como um modelo de recompensa é derivado arquitetonicamente de um modelo de linguagem?

Um modelo de recompensa normalmente reutiliza o backbone LM, mas troca a camada final por uma que gera uma única recompensa escalar.