GUIDE IA du langage

Optimisation des préférences de rapport de cotes

L'optimisation des préférences par rapport aux cotes (ORPO) est une méthode de réglage fin qui enseigne à un modèle de langage le bon comportement et les préférences humaines en une seule passe de formation.

2 minutes de lectureDernière mise à jour

Aperçu

It matters because it skips the usual separate reward model and reference model, making alignment cheaper and simpler.

Plongée profonde

ORPO, introduit par Hong, Lee et Thorne en 2024, combine le réglage fin supervisé et l'alignement des préférences en une seule étape. La plupart des pipelines d'alignement effectuent d'abord SFT sur de bons exemples, puis exécutent une deuxième méthode comme RLHF ou DPO qui nécessite une copie figée du modèle (une référence) ainsi que des paires de préférences stockées. ORPO supprime entièrement le modèle de référence. Sa perte ajoute un terme de pénalité à l'objectif standard du prochain jeton : elle augmente les chances que le modèle attribue à la réponse choisie (préférée) tout en réduisant les chances de celle rejetée. Parce qu'il utilise le rapport de cotes plutôt qu'un fort écart log-probabilité, la pénalité est douce, de sorte que le modèle apprend à privilégier les bonnes réponses sans oublier de manière catastrophique la génération fluide.

Aperçu technique

La perte d'ORPO est la perte d'entropie croisée SFT plus un log-sigmoïde pondéré du rapport de cotes log entre les réponses choisies et rejetées. Les chances sont égales à p/(1-p), donc le rapport compare la probabilité que le modèle trouve la bonne réponse par rapport à la mauvaise. L'utilisation de cotes au lieu de probabilités brutes permet de conserver un contraste doux, ce qui empêche la suppression excessive des jetons rejetés qui peuvent dégrader un modèle non référencé.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L’avenir de l’optimisation des préférences liées aux rapports de cotes

ORPO gagne du terrain car il réduit la mémoire et le calcul en abandonnant le modèle de référence, ce qui est intéressant pour les équipes qui peaufinent leur matériel sur un matériel limité. Attendez-vous à ce qu'il apparaisse plus souvent dans les recettes open source et comme option par défaut dans des bibliothèques comme Hugging Face TRL. Les travaux futurs permettront probablement d'ajuster automatiquement la pondération lambda, de mélanger ORPO avec d'autres objectifs sans référence et de l'étendre aux modèles multimodaux et de très grande taille où la conservation de deux copies en mémoire est coûteuse.

Mise en œuvre dans le monde réel

Affiner un modèle de discussion open source 7B sur des paires de préférences sans charger une deuxième copie de référence, réduisant ainsi de moitié la mémoire GPU

Une startup alignant un assistant de support client pour qu'il préfère les réponses polies et conformes aux politiques en une seule formation au lieu de SFT-puis-DPO

Des chercheurs comparent ORPO à DPO sur le même ensemble de données pour montrer un alignement comparable avec un calcul inférieur

Adapter un modèle de base à un domaine spécialisé (par exemple, la rédaction juridique) où de bons et de mauvais exemples sont disponibles mais où le budget du modèle de récompense ne l'est pas

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Odds Ratio Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Optimisation des préférences directes

Questions fréquemment posées

What is Odds Ratio Preference Optimization?

L'optimisation des préférences par rapport aux cotes (ORPO) est une méthode de réglage fin qui enseigne à un modèle de langage le bon comportement et les préférences humaines en une seule passe de formation. C’est important car il ignore le modèle de récompense séparé habituel et le modèle de référence, ce qui rend l’alignement moins cher et plus simple.

Quel est le principal avantage pratique de l’ORPO par rapport aux méthodes comme le DPO ?

ORPO intègre l'apprentissage des préférences dans la perte SFT et n'a pas besoin d'une copie de référence gelée du modèle, ce qui permet d'économiser de la mémoire et des calculs.

À quoi se compare le « rapport de cotes » dans ORPO ?

ORPO utilise le rapport de cotes (p/(1-p)) que le modèle attribue à la réponse préférée par rapport à celle défavorisée.

ORPO effectue quelles deux tâches en un seul parcours de formation ?

ORPO combine l'objectif standard du prochain jeton SFT avec une pénalité de préférence en une seule perte unifiée.

Pourquoi ORPO utilise-t-il des cotes plutôt qu'une différence brute de probabilité logarithmique pour la pénalité ?

La pénalité basée sur les cotes est plus légère, aidant le modèle non référencé à maintenir une génération fluide tout en préférant les bonnes réponses.

La perte ORPO est mieux décrite par quelle combinaison ?

ORPO ajoute un terme de rapport de cotes log-sigmoïde pondéré en plus de la perte d'entropie croisée supervisée.