GUIA de fundamentos

Normalização de comprimento na otimização de preferências

A normalização de comprimento ajusta os objetivos de ajuste de preferência para que os modelos parem de obter aprovação apenas escrevendo respostas mais longas.

2 minutos de leituraÚltima atualização

Visão geral

Isso importa porque sinais de recompensa não corrigidos levam os chatbots a respostas longas e preenchidas, em vez de respostas realmente melhores.

Mergulho profundo

Quando os modelos estão alinhados com métodos como RLHF ou DPO, aprendem com comparações em que os humanos (ou um modelo de recompensa) escolhem a “melhor” de duas respostas. Um bug persistente é que respostas mais longas tendem a ser preferidas mesmo quando não são realmente melhores, então o modelo aprende o atalho: seja prolixo. A normalização do comprimento neutraliza isso. No DPO, a recompensa implícita é uma soma das diferenças de log-probabilidade por token, que cresce mecanicamente com o comprimento. Variantes como DPO normalizado por comprimento e SimPO dividem essa recompensa pelo número de tokens, pontuando em uma média por token. O resultado são modelos que permanecem concisos e precisos, em vez de inflacionar as respostas para atingir o objetivo.

Visão Técnica

A recompensa implícita do DPO é a razão logarítmica entre as políticas ajustadas e de referência, somadas sobre cada token na resposta. Como cada token adiciona outro termo (geralmente positivo), a recompensa bruta aumenta de acordo com o comprimento da sequência, direcionando a otimização para conclusões mais longas. O SimPO descarta o modelo de referência e usa a probabilidade logarítmica média por token como recompensa, além de uma margem de recompensa alvo. A divisão por comprimento remove a vantagem mecânica do comprimento, de modo que os gradientes de preferência refletem a qualidade em vez da contagem de palavras.

Impacto Estratégico

Decisões mais claras

Ajuda a separar afirmações técnicas claras da linguagem de marketing.

Custo e orçamento

Você pode fazer perguntas melhores sobre implementação antes de gastar dinheiro ou tempo.

Equipe e fluxo de trabalho

Equipes com entendimento compartilhado tomam melhores decisões sobre produtos, políticas e aprendizado.

O futuro da normalização de comprimento na otimização de preferências

Espere que o controle de comprimento se torne um botão padrão, em vez de uma reflexão tardia. Os pesquisadores estão combinando a normalização do comprimento com penalidades explícitas de comprimento, recompensas condicionadas ao comprimento e conjuntos de avaliação que mantêm o comprimento da resposta constante para medir os verdadeiros ganhos de qualidade. À medida que os modelos de recompensa melhoram a detecção de vieses de verbosidade, os pipelines de alinhamento provavelmente reportarão taxas de vitória com desvio de comprimento por padrão, e os usuários obterão um controle mais preciso sobre quão concisas ou detalhadas as respostas de um modelo devem ser.

Implementação no mundo real

Ajustar um assistente de suporte ao cliente com SimPO para fornecer respostas nítidas e precisas, em vez de parágrafos preenchidos que apenas parecem completos.

Relatando 'taxa de vitória controlada por comprimento' no AlpacaEval 2 para mostrar um modelo genuinamente melhorado, em vez de apenas ficar mais tagarela.

Adicionar normalização de comprimento ao DPO ao ajustar um modelo de codificação para que ele retorne trechos mínimos corretos, e não clichês inchados.

Diagnosticar um modelo de recompensa que sistematicamente pontua mais ensaios mais longos e, em seguida, desviá-lo antes de usá-lo para alinhar um assistente de redação.

Riscos e guarda-corpos

Equipes diferentes podem usar o mesmo termo de maneira diferente, portanto, defina o escopo com antecedência.

Os benchmarks podem parecer fortes, enquanto o desempenho no mundo real é irregular.

Ignorar a qualidade dos dados e os planos de avaliação cria frequentemente resultados frágeis.

Roteiro de implementação

1

Comece com uma definição em linguagem simples do resultado que você precisa.

2

Escolha uma métrica de sucesso e uma condição de falha antes de testar.

3

Execute um pequeno piloto com dados representativos, não um conjunto de demonstração sofisticado.

4

Documente onde a Normalização de Comprimento na Otimização de Preferências ajuda e onde métodos mais simples são melhores.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Length Normalization in Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Otimização de preferência de razão de probabilidade

Perguntas frequentes

O que é Normalização de Comprimento na Otimização de Preferências?

A normalização de comprimento ajusta os objetivos de ajuste de preferência para que os modelos parem de obter aprovação apenas escrevendo respostas mais longas. É importante porque os sinais de recompensa não corrigidos levam os chatbots a respostas detalhadas e preenchidas, em vez de respostas genuinamente melhores.

Que comportamento indesejável a normalização de comprimento no DPO visa principalmente prevenir?

A recompensa implícita do DPO cresce com a contagem de tokens, portanto, sem a normalização, os modelos aprendem que simplesmente ser mais detalhado tende a ganhar comparações de preferências.

Por que a recompensa implícita do DPO padrão tende a aumentar com a duração da resposta?

A recompensa implícita soma as taxas de log-probabilidade em cada token, portanto, mais tokens geralmente significam uma recompensa total maior.

Como o SimPO aborda o viés de comprimento?

O SimPO pontua as respostas por sua probabilidade logarítmica média (normalizada por comprimento) e adiciona uma margem de recompensa alvo, removendo a vantagem de comprimento mecânico.

Que prática de avaliação ajuda a confirmar um modelo melhorado em qualidade e não apenas em extensão?

A taxa de vitória controlada por comprimento (como no AlpacaEval 2) se ajusta ao comprimento da resposta para que os ganhos reflitam a qualidade, não a verbosidade.