GUIDE IA du langage

Modèles de récompense de processus

Les modèles de récompense de processus (PRM) notent chaque étape individuelle du raisonnement d'une IA plutôt que simplement la réponse finale.

2 minutes de lectureDernière mise à jour

Aperçu

This matters because it catches faulty logic mid-stream, making models more reliable at math, coding, and multi-step reasoning.

Plongée profonde

La plupart des modèles de récompense sont des modèles de « résultats » : ils examinent une réponse finale et jugent si elle est bonne ou mauvaise. Un modèle de récompense de processus note à la place chaque étape d’une chaîne de raisonnement, en attribuant un score de qualité ou d’exactitude à chaque ligne d’une solution. L'exemple célèbre est le travail de OpenAI « Vérifions étape par étape » de 2023, dans lequel un PRM formé sur l'ensemble de données PRM800K (environ 800 000 étiquettes au niveau des étapes humaines sur des solutions mathématiques) a largement surpassé la supervision axée uniquement sur les résultats sur le benchmark MATH. L’avantage est qu’une réponse finale peut être bonne par chance alors que le raisonnement est brisé, ou fausse malgré des étapes pour la plupart correctes. En récompensant les étapes intermédiaires correctes, les PRM donnent un feedback plus dense et plus ciblé, ce qui améliore à la fois la vérification (en sélectionnant la meilleure parmi de nombreuses solutions échantillonnées) et la formation via l'apprentissage par renforcement.

Aperçu technique

Un PRM est généralement un transformateur qui génère un score scalaire après chaque étape de raisonnement, souvent au niveau d'un jeton de délimiteur spécial. Pour choisir une réponse finale parmi de nombreuses chaînes échantillonnées, vous regroupez les scores d'étape, généralement en prenant la probabilité de pas minimale (une chaîne est aussi forte que son étape la plus faible) ou le produit. La collecte des étiquettes d'étape coûte cher, c'est pourquoi des méthodes telles que Math-Shepherd étiquetent automatiquement les étapes via les déploiements Monte Carlo, estimant la valeur d'une étape en fonction de la fréquence à laquelle elle conduit à des réponses correctes.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L'avenir des modèles de récompense de processus

Les PRM sont au cœur de l’ère du modèle de raisonnement. Attendez-vous à un étiquetage plus automatique des étapes pour réduire les coûts d'annotation humaine, à des PRM génératifs qui critiquent les étapes en langage naturel plutôt que d'émettre un simple score, et à une extension au-delà des mathématiques dans le code, l'utilisation d'outils agents et le raisonnement scientifique. Ils s'associent également naturellement à la recherche arborescente et au calcul au moment du test, où un vérificateur guide les branches à développer. Un défi ouvert clé est le piratage des récompenses : des modèles apprennent à produire des étapes qui semblent bonnes au PRM sans être vraiment correctes.

Mise en œuvre dans le monde réel

Reclassement de dizaines de solutions échantillonnées à un problème de compétition MATH difficile par score, puis renvoi de la chaîne ayant obtenu le score le plus élevé.

Guider la recherche arborescente dans un modèle de raisonnement, en développant uniquement les solutions partielles dont les étapes intermédiaires sont très appréciées par le PRM.

Étiquetage automatique des données d'entraînement avec des déploiements Monte Carlo de style Math-Shepherd afin qu'un PRM puisse être formé sans annotation humaine exhaustive.

Vérifier la génération de code étape par étape, en signalant la ligne spécifique où la logique d'une fonction diverge de la spécification.

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Process Reward Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Projets de modèles de décodage spéculatif

Questions fréquemment posées

What is Process Reward Models?

Les modèles de récompense de processus (PRM) notent chaque étape individuelle du raisonnement d'une IA plutôt que simplement la réponse finale. Ceci est important car il détecte la logique défectueuse à mi-parcours, rendant les modèles plus fiables en termes de mathématiques, de codage et de raisonnement en plusieurs étapes.

Qu'est-ce qui distingue principalement un modèle de récompense de processus d'un modèle de récompense de résultat ?

Un PRM attribue un score à chaque étape d'une chaîne de raisonnement, alors qu'un modèle de résultats ne juge que le résultat final.

Quel ensemble de données bien connu d'étiquettes mathématiques au niveau des étapes humaines est associé à la recherche sur la MRP ?

Le PRM800K, publié avec « Vérifions étape par étape » de OpenAI, contient environ 800 000 étiquettes de niveau étape sur les solutions mathématiques.

Pourquoi un signal de récompense axé uniquement sur le résultat peut-il être trompeur ?

La notation des résultats ne prend pas en compte les cas où la réponse est bonne par chance ou fausse malgré un bon travail intermédiaire, ce que la notation par étapes rattrape.

Qu'utilise l'approche Math-Shepherd pour étiqueter automatiquement les étapes ?

Math-Shepherd estime la valeur d'une étape en échantillonnant de nombreuses réponses à partir de ce point et en mesurant la fréquence à laquelle elles atteignent la bonne réponse.

Quel risque est particulièrement pertinent lors de la formation de modèles sur un PRM ?

Les modèles peuvent apprendre à jouer avec le vérificateur, produisant des étapes apparemment plausibles qui obtiennent de bons résultats mais qui ne constituent pas réellement un raisonnement solide.