Ajuste fino de amostragem de rejeição
O ajuste fino da amostragem de rejeição (RFT) gera muitas respostas de candidatos, mantém apenas as com melhor pontuação e retreina o modelo para esses vencedores.
Visão geral
It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.
Mergulho profundo
O ajuste fino da amostragem de rejeição, às vezes chamado de ajuste fino do melhor de N, é um ingrediente chave em como modelos como Llama 2 e Llama 3 de Meta foram alinhados. A receita é simples: para cada solicitação, experimente várias respostas (digamos 4 a 64) do modelo atual, pontue cada uma com um modelo de recompensa ou um verificador automático e, em seguida, descarte ('rejeite') todos, exceto os resultados mais bem classificados. As amostras sobreviventes de alta qualidade tornam-se um novo conjunto de dados supervisionado de ajuste fino, e o modelo é treinado nelas com perda normal do próximo token. A repetição desse loop de forma iterativa estimula o modelo a gerar melhores respostas por conta própria. Como o modelo aprende com seus próprios resultados filtrados, o RFT evita a instabilidade e as dores de cabeça de ajuste do RL com gradiente de política, ao mesmo tempo que aproveita um sinal de recompensa.
Visão Técnica
A RFT explora o fato de que amostrar muitas vezes e manter a resposta de recompensa máxima se aproxima da escolha de uma distribuição mais nítida e de maior qualidade. O treinamento desses vencedores por meio da entropia cruzada padrão destila efetivamente esse comportamento melhor de N de volta aos resultados de amostra única do modelo. Para domínios verificáveis como matemática ou código, a 'recompensa' pode ser simplesmente a aprovação da resposta final ou do teste de unidade, eliminando totalmente a necessidade de um modelo de recompensa aprendido.
Impacto Estratégico
Velocidade e escala
Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.
Acesso e alcance
Ele expande o acesso entre idiomas e estilos de comunicação.
Decisões mais claras
As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.
O futuro do ajuste fino da amostragem de rejeição
O RFT é fundamental para o pós-treinamento moderno, frequentemente usado antes ou junto com métodos de RL como PPO e DPO. Seu apelo cresce com inferência barata e verificadores automáticos fortes: à medida que os modelos melhoram na autogeração e na autoverificação, a amostragem iterada de rejeição suporta dados sintéticos e ciclos de autoaperfeiçoamento. Espere uma integração mais estreita com modelos de raciocínio que produzem cadeias de pensamento verificáveis e um estudo contínuo sobre como evitar o hacking de recompensas e o colapso da diversidade ao treinar repetidamente nos próprios resultados de um modelo.
Implementação no mundo real
Alinhar modelos no estilo Llama amostrando múltiplas respostas por prompt, mantendo as pontuações mais altas do modelo de recompensa e, em seguida, SFT nessas
Melhorar um solucionador matemático gerando muitas soluções e retendo apenas aquelas que alcançam a resposta correta e verificável
Geração de código onde os candidatos são mantidos apenas se passarem nos testes unitários e depois usados como dados de treinamento
Construindo conjuntos de dados de instruções sintéticas, filtrando as melhores respostas autogeradas de um modelo para a próxima rodada de treinamento
Riscos e guarda-corpos
Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.
A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.
Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.
Roteiro de implementação
Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.
Respostas terrestres com fontes confiáveis sempre que a precisão for importante.
Mantenha um ponto de verificação de revisão humana para resultados de alto risco.
Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rejection Sampling Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
QLoRA e ajuste fino de 4 bits
Perguntas frequentes
What is Rejection Sampling Fine-Tuning?
O ajuste fino da amostragem de rejeição (RFT) gera muitas respostas de candidatos, mantém apenas as com melhor pontuação e retreina o modelo para esses vencedores. É importante porque oferece muitos dos benefícios do RLHF usando aprendizagem supervisionada simples em vez de aprendizagem por reforço complexa.
Qual é a ideia central do ajuste fino da amostragem de rejeição?
O RFT faz amostras de múltiplas respostas, filtra as que obtiveram maior pontuação e ajusta o modelo para os vencedores.
Em domínios verificáveis como matemática ou código, o que pode servir como recompensa?
Para tarefas verificáveis, o RFT pode usar a correção exata ou passar em testes unitários, evitando um modelo de recompensa aprendido.
Qual família de modelos usou amostragem de rejeição durante o alinhamento?
Meta descreveu o uso de amostragem de rejeição como parte da receita pós-treinamento para os modelos Llama 2 e Llama 3.
Por que as equipes podem preferir RFT em vez de RL com gradiente de política, como PPO?
O RFT é retreinado com perda padrão do próximo token em amostras filtradas, evitando a dificuldade de ajuste e a instabilidade dos métodos de gradiente de política.
O treinamento nas amostras de recompensa máxima faz efetivamente o quê?
Ao aprender com as principais respostas filtradas, o modelo internaliza comportamentos de maior qualidade em uma única geração.