À suivreGuide suivant
Versionnement rapide et tests de régression
Technique
GUIDE Technique
L'optimisation automatique des invites utilise un algorithme pour rechercher de meilleures instructions ou des exemples succincts.
Il évalue les invites des candidats par rapport à une métrique sur un ensemble d'exemples au lieu de s'appuyer sur une formulation modifiée à la main. Les approches bien connues incluent APE, OPRO de Google DeepMind et DSPy, un framework open source de Stanford. Ensemble, ils transforment l’ingénierie rapide d’une conjecture en un processus mesurable et reproductible.
Les invites réglées manuellement ont une faiblesse connue. Une formulation qui fonctionne pour un modèle, un ensemble de données ou une version peut cesser de fonctionner sur un autre, et les modifications sont généralement jugées sur seulement une poignée d'exemples. L'optimisation automatique des invites remplace cette boucle par une recherche. Vous fournissez trois choses : - Une tâche. - Un ensemble d'entrées, idéalement avec les résultats attendus. - Une métrique, telle qu'une correspondance exacte ou une rubrique notée par un autre modèle. L'optimiseur génère des invites de candidats, les exécute, les note et conserve les gagnants. Les premiers exemples ont rendu l’idée concrète. APE (Automatic Prompt Engineer, Zhou et al., 2022) a demandé à un modèle de proposer de nombreuses instructions à partir d'exemples d'entrées-sorties, puis a conservé celles ayant obtenu les scores les plus élevés. OPRO (Optimization by PROmpting, Yang et al., Google DeepMind, 2023) a utilisé un LLM comme optimiseur. Sa méta-invite répertoriait les instructions précédentes avec leurs scores, et le modèle en proposait de nouvelles. OPRO a trouvé des instructions telles que « Respirez profondément et résolvez ce problème étape par étape », qui ont obtenu de bons résultats pour un modèle particulier de mathématiques à l'école primaire. Une formulation optimisée peut être peu intuitive et spécifique à un modèle. DSPy va plus loin en modifiant la façon dont les programmes sont écrits. Il a été développé à Stanford NLP par Omar Khattab et ses collaborateurs et introduit en 2023. Vous déclarez ce que fait chaque étape avec une signature, telle que « question, contexte -> réponse », et combinez des modules comme Predict ou ChainOfThought. Un optimiseur (anciennement appelé téléprompteur), tel que BootstrapFewShot ou MIPROv2, « compile » ensuite le programme en choisissant des démonstrations et des instructions pour chaque module afin de maximiser votre métrique. Trois idées fausses méritent d'être corrigées : - Ces outils suppriment le jugement humain. Ce n’est pas le cas, car la métrique et les exemples définissent « mieux ». - Les invites optimisées sont fiables. Ils peuvent suradapter un petit ensemble de données. - L'optimisation est gratuite. Cela coûte de vrais appels API, parfois nombreux.
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
L'optimisation rapide devient une partie normale de l'ingénierie LLM, aux côtés des suites d'évaluation, plutôt qu'une curiosité de recherche. Des questions ouvertes demeurent. Dans quelle mesure les invites optimisées sont-elles transférées entre les modèles ? Comment rédigez-vous des mesures pour les qualités subjectives comme le ton ou la serviabilité ? Comment éviter le surajustement de petits ensembles de données ? Certaines recherches combinent une optimisation rapide avec un réglage fin léger, et DSpy prend en charge les deux. Les modèles changent souvent, de sorte que la possibilité de ré-optimiser automatiquement par rapport à un ensemble de tests stable est probablement plus importante que n'importe quelle simple invite intelligente. Définir de bons indicateurs et exemples reste un travail humain.
Une équipe créant un classificateur de tickets de support écrit une signature DSPy « ticket -> catégorie » et fournit 200 tickets étiquetés et une métrique de précision. Un optimiseur sélectionne ensuite les démonstrations en quelques plans qui obtiennent les meilleurs résultats.
Lorsqu'une entreprise passe d'un fournisseur LLM à un autre, elle réexécute son optimiseur DSPy pour le nouveau modèle. Il ne réécrit pas manuellement les invites adaptées à l'ancien modèle.
Un chercheur exécute une boucle de style OPRO. Un modèle propose de nouvelles formulations pour une instruction, chaque formulation est notée sur un critère mathématique, et l'historique des meilleures notes remonte dans la série de propositions suivante.
Un pipeline de questions-réponses amélioré par la récupération est optimisé de bout en bout, avec une métrique qui vérifie les réponses finales par rapport aux réponses de référence. L’étape d’écriture de requête et l’étape de réponse s’améliorent ensemble.
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
L'optimisation automatique des invites utilise un algorithme pour rechercher de meilleures instructions ou des exemples succincts. Il évalue les invites des candidats par rapport à une métrique sur un ensemble d'exemples au lieu de s'appuyer sur une formulation modifiée à la main. Les approches bien connues incluent APE, OPRO de Google DeepMind et DSPy, un framework open source de Stanford. Ensemble, ils transforment l’ingénierie rapide d’une conjecture en un processus mesurable et reproductible.
L'optimiseur a besoin d'une tâche, d'exemples et d'une métrique pour pouvoir évaluer les invites des candidats et conserver les meilleures.
OPRO utilise un modèle de langage comme optimiseur. Il voit les instructions passées avec leurs partitions et en propose de nouvelles.
L’enseignement a obtenu de bons résultats pour un modèle particulier de mathématiques à l’école primaire. Les formulations trouvées lors de la recherche peuvent être surprenantes et peuvent ne pas être appliquées à d'autres modèles.
Les signatures déclarent ce qu'un module doit faire en termes de ses champs d'entrée et de sortie. DSPy élabore ensuite l'invite.
Les traces réussies deviennent des exemples ponctuels, y compris pour des étapes internes que vous n'avez jamais étiquetées vous-même.
Continuez à apprendre
Plus de guides sélectionnés pour ce sujet
À suivreGuide suivant
Versionnement rapide et tests de régression
Technique