Invite de planification et de résolution
L'invite Planifier et résoudre (PS) indique à un modèle de langage de concevoir d'abord un plan explicite, puis de l'exécuter étape par étape, en corrigeant les échecs que l'invite simple « pensons étape par étape » laisse derrière elle.
Aperçu
It is a simple prompt tweak that meaningfully boosts multi-step reasoning without any extra training.
Plongée profonde
Introduit dans un article de l'ACL de 2023 par Lei Wang et ses collègues, l'incitation Plan-and-Solve était une réponse à une faiblesse spécifique de la chaîne de pensée zéro : les modèles sautent souvent des étapes, calculent mal ou lisent mal la question. PS remplace l'instruction unique « Réfléchissons étape par étape » par une directive en deux parties : « Comprenons d'abord le problème et élaborons un plan pour le résoudre. Ensuite, exécutons le plan et résolvons le problème étape par étape. Une variante améliorée, PS+, ajoute des rappels pour extraire les variables pertinentes, calculer les résultats intermédiaires et prêter attention aux chiffres. Sur des benchmarks tels que GSM8K et SVAMP, PS+ a comblé une grande partie de l'écart avec une chaîne de réflexion en quelques étapes sans avoir besoin d'exemples concrets dans l'invite.
Aperçu technique
Le mécanisme réside uniquement dans l'invite : en demandant un plan avant l'exécution, PS décale la génération autorégressive du modèle afin qu'il produise d'abord des sous-objectifs de haut niveau, qui conditionnent ensuite les jetons de raisonnement détaillés qui suivent. Cette séparation réduit les « étapes manquantes » et les erreurs de calcul. PS+ attire en outre l'attention en nommant explicitement les variables et les quantités intermédiaires, agissant comme un échafaudage auto-généré plutôt que de s'appuyer sur des exemples écrits à la main.
Impact stratégique
Coût et budget
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
Décisions plus claires
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
Contrôle qualité
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
L’avenir de l’invite de planification et de résolution
La réflexion « planifier et résoudre » est désormais intégrée aux cadres d'agents et aux modèles de « raisonnement » qui séparent nativement la planification de l'exécution. Attendez-vous à ce que les invites de planification fusionnent avec les méthodes d'utilisation des outils, d'auto-vérification et de recherche arborescente, et deviennent un comportement interne par défaut dans les modèles entraînés à raisonner plutôt qu'une invite manuelle. La leçon durable est que décomposer une tâche avant d’agir constitue un gain de fiabilité peu coûteux et largement transférable.
Mise en œuvre dans le monde réel
Résoudre des problèmes de mots mathématiques en plusieurs étapes pour l'école primaire (GSM8K) où le modèle répertorie d'abord les quantités, puis les calcule dans l'ordre.
Guider un assistant de codage pour décrire les fonctions et les cas extrêmes avant d'écrire un code d'implémentation.
Structurer un agent de support client pour identifier d'abord l'objectif sous-jacent de l'utilisateur, puis séquencer les étapes de résolution.
Diviser une demande complexe d'analyse de données en phases de « planifier les requêtes » suivies de phases « d'exécution et de combinaison des résultats ».
Risques et garde-fous
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Feuille de route de mise en œuvre
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Plan-and-Solve Prompting quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Du moins au plus d'invites
Questions fréquemment posées
What is Plan-and-Solve Prompting?
L'invite Planifier et résoudre (PS) indique à un modèle de langage de concevoir d'abord un plan explicite, puis de l'exécuter étape par étape, en corrigeant les échecs que l'invite simple « pensons étape par étape » laisse derrière elle. Il s’agit d’une simple modification rapide qui améliore de manière significative le raisonnement en plusieurs étapes sans aucune formation supplémentaire.
Quel changement fondamental l'invite Planifier et résoudre apporte-t-elle à la chaîne de pensée standard ?
Les invites PS divisent l'instruction en l'élaboration d'un plan puis en son exécution étape par étape, au lieu de la seule ligne « Pensons étape par étape ».
Quelles faiblesses spécifiques de la simple chaîne de pensée Plan-and-Solve a-t-il été conçu pour remédier ?
Les auteurs ont ciblé les erreurs d’étape manquante et les erreurs d’arithmétique/de calcul que la chaîne de pensée sans tir produisait fréquemment.
Qu'est-ce que la variante PS+ améliorée ajoute à l'invite de base Planifier et résoudre ?
PS+ ajoute des rappels détaillés pour extraire les variables pertinentes, calculer les résultats intermédiaires et prêter attention aux chiffres, affinant ainsi l'échafaudage auto-généré.
Sur quel type de benchmark Plan-and-Solve a-t-il été évalué de manière visible ?
PS et PS+ ont été testés sur des références de raisonnement mathématique telles que GSM8K et SVAMP, entre autres ensembles de données de raisonnement.
Pourquoi générer un plan avant les étapes détaillées a-t-il tendance à aider un modèle autorégressif ?
La génération étant autorégressive, les jetons de plan de haut niveau deviennent un contexte qui guide le raisonnement étape par étape ultérieur, réduisant ainsi les étapes sautées.