Otimização de Política Proximal
A Otimização de Política Proximal (PPO) é o algoritmo de aprendizagem por reforço mais associado ao ajuste fino de modelos de linguagem a partir de feedback humano.
Visão geral
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Mergulho profundo
O PPO foi introduzido por OpenAI em 2017 e se tornou o carro-chefe por trás do RLHF para sistemas como InstructGPT e ChatGPT. O principal desafio no RL com gradiente de política é que uma única atualização excessivamente grande pode prejudicar o desempenho. O PPO aborda esta questão com um “objetivo substituto reduzido”: mede o quão mais (ou menos) provável uma ação se tornou em relação à política antiga, multiplica essa proporção pela vantagem (quão melhor a ação foi do que o esperado) e reduz a proporção para um pequeno intervalo como 0,8 a 1,2. Isso limita o quão longe a política pode avançar por atualização, mantendo o aprendizado estável e ao mesmo tempo permitindo melhorias constantes. No modelo de linguagem RLHF, a 'ação' gera um token ou resposta, a recompensa vem de um modelo de recompensa e uma penalidade de divergência KL evita que o modelo se afaste muito de seu comportamento original.
Visão Técnica
O PPO maximiza um objetivo recortado: min(proporção * vantagem, clipe(proporção, 1-eps, 1+eps) * vantagem), onde proporção é a probabilidade de ação nova sobre antiga. As vantagens são geralmente estimadas com Estimativa de Vantagem Generalizada e uma rede de valor aprendido (crítico). No RLHF, a recompensa total combina a pontuação do modelo de recompensa com uma penalidade KL por token em relação à política de referência, equilibrando o ganho de recompensa com a permanência próxima do modelo original.
Impacto Estratégico
Velocidade e escala
Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.
Acesso e alcance
Ele expande o acesso entre idiomas e estilos de comunicação.
Decisões mais claras
As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.
O futuro da otimização de políticas proximais
O PPO permanece forte, mas é notoriamente complicado: ele precisa de uma rede de valor separada, ajuste cuidadoso de hiperparâmetros e muita computação. Alternativas mais simples estão ganhando terreno, incluindo o DPO (sem nenhum RL) e o GRPO, que elimina a rede de valor ao estimar vantagens a partir de grupos de respostas amostradas e tem alimentado modelos de raciocínio recentes. O PPO persistirá onde a exploração dentro da política realmente ajuda, mas o campo está ativamente a negociar alguma da sua complexidade por métodos mais baratos.
Implementação no mundo real
Ajustando InstructGPT e ChatGPT para seguir instruções e preferências humanas via RLHF
Treinamento de agentes de controle de jogos e robótica, domínio original do PPO antes dos modelos de linguagem
Reduzir a toxicidade ou melhorar a utilidade maximizando uma pontuação do modelo de recompensa sob uma restrição KL
Otimizando o uso de ferramentas ou o comportamento do agente em várias etapas, onde um modelo é recompensado por concluir tarefas corretamente
Riscos e guarda-corpos
Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.
A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.
Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.
Roteiro de implementação
Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.
Respostas terrestres com fontes confiáveis sempre que a precisão for importante.
Mantenha um ponto de verificação de revisão humana para resultados de alto risco.
Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Otimização de Política Relativa de Grupo
Perguntas frequentes
What is Proximal Policy Optimization?
A Otimização de Política Proximal (PPO) é o algoritmo de aprendizagem por reforço mais associado ao ajuste fino de modelos de linguagem a partir de feedback humano. Melhora uma política em pequenos e cuidadosos passos para evitar a instabilidade que assola os métodos ingénuos de gradiente político.
Que problema o 'recorte' do PPO aborda principalmente?
Reduzir a razão de probabilidade evita que qualquer atualização leve a política longe demais, o que é a principal fonte de instabilidade nos métodos de gradiente de política.
No modelo de linguagem RLHF com PPO, de onde geralmente vem o sinal de recompensa?
Um modelo de recompensa fornece a recompensa escalar para as respostas geradas, uma vez que seria inviável fazer com que humanos pontuassem todas as saídas durante RL.
O que a penalidade de divergência KL faz no RLHF baseado em PPO?
A penalidade KL por token contra a política original (de referência) desencoraja o modelo de mudar seu comportamento drasticamente enquanto busca recompensa.
Qual é o papel da rede de valor (crítica) no PPO?
PPO é um método ator-crítico; a rede de valor estima a recompensa esperada, permitindo estimativas de vantagens (muitas vezes via GAE) que reduzem a variância.
O que representa a 'vantagem' no PPO?
A vantagem mede até que ponto uma acção escolhida foi melhor (ou pior) em relação à estimativa de valor, informando à política quais as acções a reforçar.