GUIDE IA du langage

Optimisation des préférences directes

L'optimisation directe des préférences (DPO) est un moyen d'aligner les modèles de langage sur les préférences humaines sans former un modèle de récompense distinct ni exécuter un apprentissage par renforcement.

2 minutes de lectureDernière mise à jour

Aperçu

It collapses a complex multi-stage pipeline into a single, stable training loss.

Plongée profonde

DPO, introduit par Rafailov et ses collègues de Stanford en 2023, repense la façon dont nous enseignons à un modèle ce que les gens préfèrent. L'approche traditionnelle (RLHF) forme un modèle de récompense sur la base de comparaisons humaines, puis utilise l'apprentissage par renforcement pour maximiser cette récompense. L'idée clé de DPO est mathématique : la politique optimale dans le cadre de cet objectif RLHF a une relation fermée avec la récompense, vous pouvez donc réorganiser les équations et optimiser le modèle de langage directement sur les paires de préférences. Vous lui donnez une invite, une réponse « choisie » (préférée) et une réponse « rejetée », et une simple perte de style classification pousse le modèle à rendre la réponse choisie relativement plus probable. Pas de modèle de récompense, pas de boucle d'échantillonnage, pas de piratage de récompense. C’est beaucoup plus simple et plus stable à exécuter.

Aperçu technique

DPO utilise une perte d'entropie croisée binaire sur les paires de préférences. Il augmente le rapport log-probabilité de la réponse choisie par rapport à celle rejetée, chacune étant mesurée par rapport à un modèle de référence figé (généralement le point de départ supervisé et affiné). Un paramètre de température bêta contrôle dans quelle mesure la politique peut s'écarter de cette référence, appliquant implicitement la contrainte KL que RLHF applique explicitement. La récompense n’est jamais matérialisée ; c'est implicite dans les propres log-probabilités de la politique.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L’avenir de l’optimisation des préférences directes

DPO est devenu une méthode d'alignement par défaut car elle est bon marché et reproductible, et elle a engendré une famille de variantes : IPO corrige le surajustement sur des préférences quasi déterministes, KTO apprend à partir d'étiquettes simples, bonnes ou mauvaises, au lieu de paires, et ORPO intègre l'apprentissage des préférences en un réglage fin sans modèle de référence. Attendez-vous à un travail continu sur la combinaison du DPO avec les données politiques et le débiaisation longueur/qualité, réduisant ainsi l'écart restant avec le RLHF entièrement en ligne.

Mise en œuvre dans le monde réel

Affiner les modèles de chat à poids ouvert comme Zephyr et de nombreux dérivés de Llama et Mistral, qui étaient alignés sur DPO sur les ensembles de données de préférence

Réduire les résultats nuisibles ou inutiles en utilisant des paires où la réponse sûre et utile est « choisie » plutôt qu'une réponse problématique

Apprendre à un assistant de codage à préférer les solutions correctes et bien documentées aux solutions boguées à l'aide de comparaisons évaluées par les développeurs

Optimiser le style de résumé afin que les modèles privilégient les résumés concis et fidèles plutôt que les résumés verbeux ou hallucinés

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Direct Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Optimisation des préférences de rapport de cotes

Questions fréquemment posées

What is Direct Preference Optimization?

L'optimisation directe des préférences (DPO) est un moyen d'aligner les modèles de langage sur les préférences humaines sans former un modèle de récompense distinct ni exécuter un apprentissage par renforcement. Il réduit un pipeline complexe à plusieurs étapes en une perte de formation unique et stable.

Qu’est-ce que le DPO élimine par rapport au RLHF traditionnel ?

Le principal avantage du DPO est de supprimer le modèle de récompense explicite et la boucle d'échantillonnage RL, et d'optimiser la politique directement sur les paires de préférences.

De quelles données se compose un seul exemple de formation DPO ?

DPO s'entraîne sur des paires de préférences : une invite plus une réponse préférée (« choisi ») et une réponse dépréciée (« rejetée »).

Quel rôle joue le modèle de référence dans le DPO ?

Une référence gelée (généralement le modèle SFT) ancre la perte ; le paramètre bêta contrôle jusqu'où la politique formée peut s'en éloigner.

Dans DPO, où est représentée la « récompense » ?

Le calcul de DPO montre que la récompense est implicite dans le rapport log-probabilité entre la politique et la référence, donc aucun modèle de récompense explicite n'est nécessaire.

Que fait le paramètre bêta (température) dans le contrôle DPO ?

Le bêta régit la contrainte implicite KL : un bêta plus élevé maintient la politique plus proche de la référence, un bêta plus faible permet davantage d'écart.