GUIDE des fondamentaux

Modélisation des récompenses Bradley-Terry

Le modèle Bradley-Terry est une méthode statistique vieille d'un siècle permettant de transformer des comparaisons par paires (A bat B) en scores numériques.

2 minutes de lectureDernière mise à jour

Aperçu

In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.

Plongée profonde

Bradley-Terry, introduit en 1952, suppose que chaque élément a un score de force caché, et que la probabilité que l'élément A bat l'élément B est la fonction logistique de la différence de leur score. Dans l’alignement de l’IA, cela correspond parfaitement aux données de préférence : les étiqueteurs humains voient deux réponses modèles et choisissent la meilleure, au lieu de donner des notes absolues difficiles à calibrer. Un modèle de récompense, généralement le modèle de langage avec une tête de sortie scalaire, est formé de sorte que la réponse préférée des humains obtienne une récompense scalaire plus élevée. La perte est la log-vraisemblance négative de la probabilité de Bradley-Terry : maximiser le log-sigmoïde de (récompense du choix moins récompense du rejet). Le modèle de récompense résultant note ensuite des sorties arbitraires, fournissant le signal sur lequel les algorithmes d'apprentissage par renforcement comme PPO optimisent pour rendre les modèles plus utiles et plus alignés.

Aperçu technique

La perte de formation pour une comparaison est simplement moins le log-sigmoïde de (r_chosen − r_rejected), de sorte que le modèle n'apprend que les différences relatives. Cela signifie que les récompenses ne sont identifiables que jusqu'à une constante additive ; l'échelle absolue est arbitraire. Parce que les comparaisons sont plus faciles et plus cohérentes pour les humains que les scores de 1 à 10, les données de Bradley-Terry sont moins bruitées. L'optimisation directe des préférences a montré plus tard que vous pouvez ignorer le modèle de récompense séparé et optimiser l'objectif Bradley-Terry directement sur la politique.

Impact stratégique

Décisions plus claires

Il vous aide à séparer les affirmations techniques claires du langage marketing.

Coût et budget

Vous pouvez poser de meilleures questions de mise en œuvre avant de dépenser de l'argent ou du temps.

Équipe et flux de travail

Les équipes partageant une compréhension commune prennent de meilleures décisions en matière de produits, de politiques et d’apprentissage.

L'avenir de la modélisation des récompenses Bradley-Terry

Bradley-Terry suppose un classement unique et cohérent et des préférences transitives, qui s'effondrent lorsque les humains ne sont pas d'accord ou dans un cycle de préférences. La recherche s'oriente vers des modèles qui capturent les distributions de préférences, les récompenses multidimensionnelles (utilité, sécurité, honnêteté notées séparément) et des méthodes telles que l'apprentissage de Nash à partir des commentaires humains qui abandonnent l'hypothèse d'un score unique. Le DPO et ses variantes intègrent de plus en plus l’objectif de Bradley-Terry directement dans la formation politique. Attendez-vous à des systèmes de comparaison plus riches, comprenant des classements de plus de deux éléments et des préférences pondérées en fonction de la confiance, afin de réduire le piratage des récompenses.

Mise en œuvre dans le monde réel

Formation du modèle de récompense dans RLHF qui classe deux réponses de chatbot et transmet le signal du meilleur au pire au réglage fin du PPO.

L'optimisation des préférences directes affine un modèle directement sur les paires de réponses choisies ou rejetées à l'aide de la perte log-sigmoïde de Bradley-Terry.

Classement des joueurs d'échecs ou d'esports via Elo, qui est mathématiquement un proche cousin du modèle Bradley-Terry sur les résultats des jeux.

Créer un classement de recommandations de contenu à partir des données de clics « les utilisateurs ont préféré A plutôt que B » plutôt que des notes absolues par étoiles.

Risques et garde-fous

Différentes équipes peuvent utiliser le même terme différemment, alors définissez la portée dès le début.

Les benchmarks peuvent paraître solides alors que les performances réelles sont inégales.

Ignorer la qualité des données et les plans d’évaluation crée souvent des résultats fragiles.

Feuille de route de mise en œuvre

1

Commencez par une définition en langage simple du résultat dont vous avez besoin.

2

Choisissez une mesure de réussite et une condition d’échec avant de tester.

3

Exécutez un petit pilote avec des données représentatives, pas un ensemble de démonstration raffiné.

4

Documentez les domaines dans lesquels la modélisation des récompenses Bradley-Terry est utile et les domaines dans lesquels les méthodes plus simples sont préférables.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Bradley-Terry Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Modélisation de récompense

Questions fréquemment posées

What is Bradley-Terry Reward Modeling?

Le modèle Bradley-Terry est une méthode statistique vieille d'un siècle permettant de transformer des comparaisons par paires (A bat B) en scores numériques. Dans l’IA moderne, il alimente des modèles de récompense qui apprennent les préférences humaines à partir de « quelle réponse est la meilleure ? » labels, l’épine dorsale du RLHF.

Que convertit le modèle Bradley-Terry en scores numériques ?

Bradley-Terry effectue des comparaisons par paires « A bat B » et en déduit un score de force caché pour chaque élément, raison pour laquelle il correspond si bien à l'étiquetage des préférences humaines.

Dans Bradley-Terry, la probabilité que A batte B est fonction de quoi ?

Le modèle définit P (A bat B) égal à la logistique (sigmoïde) de la différence entre les scores de force cachée de A et de B.

Pourquoi les récompenses Bradley-Terry ne sont-elles identifiables qu'à une constante additive près ?

La perte d'entraînement utilise uniquement la différence entre les récompenses choisies et rejetées, donc le décalage de tous les scores de la même constante laisse la perte inchangée ; l'échelle absolue est arbitraire.

Quelle est la perte standard pour une comparaison de préférence unique dans la modélisation des récompenses ?

La log-vraisemblance négative de Bradley-Terry se réduit à moins le log-sigmoïde de la différence de récompense choisie-moins-rejetée, ce qui pousse la récompense de la réponse choisie plus haut.

Quelle méthode ignore un modèle de récompense distinct en optimisant l'objectif de Bradley-Terry directement sur la politique ?

DPO reformule l'objectif de préférence de Bradley-Terry afin qu'il puisse être appliqué directement au modèle politique, éliminant ainsi le besoin de former et d'interroger un modèle de récompense autonome.