Otimização de preferência direta
A Otimização de Preferência Direta (DPO) é uma forma de alinhar modelos de linguagem com preferências humanas sem treinar um modelo de recompensa separado ou executar aprendizagem por reforço.
Visão geral
It collapses a complex multi-stage pipeline into a single, stable training loss.
Mergulho profundo
O DPO, apresentado por Rafailov e colegas em Stanford em 2023, repensa a forma como ensinamos a um modelo o que as pessoas preferem. A abordagem tradicional (RLHF) treina um modelo de recompensa em comparações humanas e, em seguida, usa o aprendizado por reforço para maximizar essa recompensa. O principal insight do DPO é matemático: a política ideal sob esse objetivo RLHF tem uma relação de forma fechada com a recompensa, para que você possa reorganizar as equações e otimizar o modelo de linguagem diretamente nos pares de preferência. Você fornece um prompt, uma resposta 'escolhida' (preferencial) e uma resposta 'rejeitada', e uma simples perda no estilo de classificação estimula o modelo a tornar a resposta escolhida relativamente mais provável. Sem modelo de recompensa, sem ciclo de amostragem, sem hacking de recompensa. É muito mais simples e estável de executar.
Visão Técnica
O DPO usa uma perda binária de entropia cruzada sobre pares de preferência. Ele aumenta a razão log-probabilidade da resposta escolhida em relação à rejeitada, cada uma medida em relação a um modelo de referência congelado (geralmente o ponto de partida supervisionado e ajustado). Um parâmetro de temperatura beta controla até que ponto a política pode se desviar dessa referência, impondo implicitamente a restrição KL que o RLHF aplica explicitamente. A recompensa nunca é materializada; está implícito nas próprias probabilidades logarítmicas da política.
Impacto Estratégico
Velocidade e escala
Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.
Acesso e alcance
Ele expande o acesso entre idiomas e estilos de comunicação.
Decisões mais claras
As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.
O futuro da otimização de preferências diretas
O DPO tornou-se um método de alinhamento padrão porque é barato e reproduzível, e gerou uma família de variantes: o IPO corrige o overfitting em preferências quase determinísticas, o KTO aprende com rótulos únicos bons ou ruins em vez de pares, e o ORPO dobra o aprendizado de preferência em ajuste fino sem modelo de referência. Espera-se um trabalho contínuo na combinação do DPO com dados sobre políticas e correção de comprimento/qualidade, estreitando a lacuna restante com RLHF totalmente online.
Implementação no mundo real
Ajustando modelos de bate-papo de peso aberto, como Zephyr e muitos derivados de Llama e Mistral, que foram alinhados com DPO em conjuntos de dados de preferência
Reduzir resultados prejudiciais ou inúteis usando pares onde a resposta segura e útil é “escolhida” em vez de uma resposta problemática
Ensinar um assistente de codificação a preferir soluções corretas e bem documentadas em vez de soluções com erros, usando comparações avaliadas pelo desenvolvedor
Ajustando o estilo de resumo para que os modelos favoreçam resumos concisos e fiéis em vez de resumos detalhados ou alucinados
Riscos e guarda-corpos
Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.
A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.
Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.
Roteiro de implementação
Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.
Respostas terrestres com fontes confiáveis sempre que a precisão for importante.
Mantenha um ponto de verificação de revisão humana para resultados de alto risco.
Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Direct Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Otimização de preferência de razão de probabilidade
Perguntas frequentes
What is Direct Preference Optimization?
A Otimização de Preferência Direta (DPO) é uma forma de alinhar modelos de linguagem com preferências humanas sem treinar um modelo de recompensa separado ou executar aprendizagem por reforço. Ele reduz um pipeline complexo de vários estágios em uma perda de treinamento única e estável.
O que o DPO elimina em comparação com o RLHF tradicional?
A principal vantagem do DPO é remover o modelo de recompensa explícito e o ciclo de amostragem RL, otimizando a política diretamente nos pares de preferência.
Em quais dados consiste um único exemplo de treinamento de DPO?
O DPO treina em pares de preferências: um prompt mais uma resposta preferida ('escolhida') e uma resposta não preferida ('rejeitada').
Qual o papel do modelo de referência no DPO?
Uma referência congelada (normalmente o modelo SFT) ancora a perda; o parâmetro beta controla até que ponto a política treinada pode se afastar dele.
No DPO, onde está representada a “recompensa”?
A derivação do DPO mostra que a recompensa está implícita na relação log-probabilidade entre a política e a referência, portanto não é necessário nenhum modelo de recompensa explícito.
O que significa o parâmetro beta (temperatura) no controle do DPO?
Beta rege a restrição KL implícita: um beta mais alto mantém a política mais próxima da referência, um beta mais baixo permite mais desvios.