GUIA de IA de linguagem

Otimização Kahneman-Tversky

A Otimização Kahneman-Tversky (KTO) é um método de alinhamento que aprende com simples rótulos positivos ou negativos, em vez de comparações emparelhadas.

2 minutos de leituraÚltima atualização

Visão geral

It matters because binary feedback is far easier and cheaper to collect than the ranked pairs most methods demand.

Mergulho profundo

O KTO, apresentado por Ethayarajh e colegas de Stanford e Contextual AI em 2024, toma emprestado da teoria do prospecto, o trabalho ganhador do Nobel de Daniel Kahneman e Amos Tversky sobre como os humanos valorizam ganhos e perdas. Métodos padrão como DPO precisam de pares de preferências: uma resposta escolhida e uma rejeitada para o mesmo prompt. Em vez disso, o KTO trabalha com dados não pareados, onde cada saída individual é simplesmente marcada como desejável ou indesejável. Ele constrói uma perda consciente do ser humano que trata a melhoria do modelo em uma amostra como um ganho ou perda em relação a um ponto de referência, aplicando aversão à perda para que os resultados indesejáveis ​​sejam penalizados de forma mais acentuada do que os desejáveis ​​sejam recompensados. Isso permite que as equipes usem os abundantes sinais de aprovação/rejeição já coletados em aplicativos de produção.

Visão Técnica

KTO define uma função de valor modelada na teoria do prospecto, medindo até que ponto a recompensa implícita de uma resposta fica acima ou abaixo de uma linha de base de referência (muitas vezes a divergência KL média da política de referência). Os exemplos desejáveis ​​aumentam o valor, os indesejáveis ​​empurram-no para baixo e um coeficiente de aversão à perda faz com que os desvios negativos pesem mais. Crucialmente, ele precisa apenas de um rótulo por exemplo, e não de pares correspondentes.

Impacto Estratégico

Velocidade e escala

Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.

Acesso e alcance

Ele expande o acesso entre idiomas e estilos de comunicação.

Decisões mais claras

As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.

O futuro da otimização Kahneman-Tversky

O KTO é adequado para produtos reais, onde os usuários clicam naturalmente em gostar ou não, mas raramente classificam duas respostas lado a lado. Espere uma adoção mais ampla de ciclos de melhoria contínua que reciclam o feedback da produção, além de pesquisas que ajustem a proporção de dados desejáveis ​​e indesejáveis ​​e o peso da aversão à perda. Combinar o enquadramento da economia comportamental do KTO com outros objetivos e aplicá-lo ao feedback multimodal são direções ativas à medida que as equipes buscam o alinhamento a partir de sinais confusos do mundo real.

Implementação no mundo real

Usando cliques de aprovação/rejeição de um chatbot implantado para ajustá-lo sem nunca criar pares de preferências

Alinhar um modelo quando você tem uma pilha de respostas “boas” e “ruins”, mas não há comparações correspondentes para os mesmos prompts

Uma equipe de produto reciclando sinalizadores de moderação (indesejáveis) e respostas salvas (desejáveis) no treinamento KTO

Lidar com feedback desequilibrado onde desgostos são mais raros do que gostos, ajustando a aversão à perda e os pesos de classe do KTO

Riscos e guarda-corpos

Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.

A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.

Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.

Roteiro de implementação

1

Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.

2

Respostas terrestres com fontes confiáveis ​​sempre que a precisão for importante.

3

Mantenha um ponto de verificação de revisão humana para resultados de alto risco.

4

Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Kahneman-Tversky Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Otimização de preferência direta

Perguntas frequentes

What is Kahneman-Tversky Optimization?

A Otimização Kahneman-Tversky (KTO) é um método de alinhamento que aprende com simples rótulos positivos ou negativos, em vez de comparações emparelhadas. É importante porque o feedback binário é muito mais fácil e barato de coletar do que os pares classificados que a maioria dos métodos exige.

Que tipo de dados o KTO exige?

O KTO aprende com rótulos simples de polegar para cima/baixo por exemplo, em vez de pares de preferências correspondentes.

KTO é inspirado em qual obra?

KTO toma emprestada a ideia da teoria do prospecto de avaliar ganhos e perdas de forma assimétrica, daí o nome.

O que é 'aversão à perda' conforme usado no KTO?

A teoria da perspectiva diz que as perdas são maiores do que os ganhos, então o KTO pondera mais os desvios negativos.

Comparado ao DPO, o KTO é especialmente útil quando você tem o quê?

O KTO brilha quando o feedback consiste em sinais binários desemparelhados, que os produtos coletam com muito mais facilidade do que pares classificados.

No KTO, os desvios são medidos em relação a quê?

A função de valor do KTO avalia se uma resposta está acima ou abaixo de uma linha de base de referência, tratando isso como um ganho ou perda.