GUIDE IA du langage

IA constitutionnelle

L'IA constitutionnelle est la méthode utilisée par Anthropic pour aligner les modèles à l'aide d'un ensemble écrit de principes - une « constitution » - de sorte que l'IA critique et révise ses propres réponses au lieu de s'appuyer uniquement sur les humains pour étiqueter les contenus préjudiciables.

2 minutes de lectureDernière mise à jour

Aperçu

It aims to make models helpful and harmless with far less human labor.

Plongée profonde

L'alignement traditionnel s'appuie sur l'apprentissage par renforcement à partir de la rétroaction humaine (RLHF), où les gens classent de nombreux résultats du modèle, y compris les plus perturbants, pour enseigner au modèle ce qu'il doit éviter. L'IA constitutionnelle réduit ce fardeau en fournissant au modèle une liste explicite de principes écrits tirés de sources telles que la Déclaration des droits de l'homme des Nations Unies et les meilleures pratiques en matière de confiance et de sécurité. La formation comporte deux étapes. D’abord, une étape encadrée : le modèle génère une réponse, puis la critique à l’encontre d’un principe constitutionnel et la réécrit pour être meilleure ; ces réponses auto-améliorées sont utilisées pour l’affiner. Deuxièmement, une étape d'apprentissage par renforcement, RLAIF, où le modèle lui-même classe les paires de réponses selon la constitution, et où les données de préférences générées par l'IA entraînent un modèle de récompense. Les principes sont transparents et modifiables, ce qui rend les valeurs qui dirigent le modèle inspectables plutôt que cachées dans des étiquettes humaines opaques.

Aperçu technique

Les deux phases sont souvent appelées SL-CAI et RL-CAI. Dans l'apprentissage supervisé, une boucle « critiquer et réviser » incite le modèle à trouver où sa propre réponse viole un principe échantillonné et à le réécrire, générant ainsi des données d'entraînement sans étiquetage de préjudice humain. Dans la phase RL, un deuxième modèle juge laquelle des deux réponses suit le mieux la constitution, produisant des étiquettes de préférence d'IA (RLAIF) qui entraînent un modèle de récompense utilisé dans le RL standard. La constitution est une orientation en texte brut injectée dans des invites, donc changer le comportement du modèle peut être aussi direct que modifier les principes.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L’avenir de l’IA constitutionnelle

L'IA constitutionnelle pointe vers une « surveillance évolutive », où l'IA aide à superviser l'IA à mesure que les modèles deviennent trop capables pour que les humains puissent vérifier chaque sortie. Attendez-vous à des constitutions plus riches et plus nuancées, à une contribution publique et participative dans le choix des principes (Anthropic a mené des expériences d'« IA constitutionnelle collective ») et à des approches hybrides mêlant retour d'information humain et autocritique de l'IA. La transparence des principes écrits rend cela attrayant pour les régulateurs et les auditeurs qui souhaitent connaître les valeurs codées par un système. À mesure que les modèles frontières progressent, les méthodes qui permettent aux modèles de critiquer et de s’améliorer de manière fiable par rapport à des règles explicites deviendront probablement essentielles à la sécurité.

Mise en œuvre dans le monde réel

Entraîner un chatbot à refuser d'aider à fabriquer une arme en lui demandant de critiquer son propre projet de réponse par rapport à un principe d'évitement des dommages et de le réécrire

Remplacer l'étiquetage coûteux des produits toxiques par l'équipe rouge humaine par des données de préférence générées par l'IA (RLAIF) guidées par la constitution

Modifier un principe écrit pour ajuster le degré de prudence d'un modèle, puis observer le changement de comportement sans réétiqueter des milliers d'exemples

Organiser des exercices de contribution collective où le public propose des principes qui façonnent la constitution du modèle

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Constitutional AI quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Réglage des instructions

Questions fréquemment posées

What is Constitutional AI?

L'IA constitutionnelle est la méthode utilisée par Anthropic pour aligner les modèles à l'aide d'un ensemble écrit de principes - une « constitution » - de sorte que l'IA critique et révise ses propres réponses au lieu de s'appuyer uniquement sur les humains pour étiqueter les contenus préjudiciables. Son objectif est de créer des modèles utiles et inoffensifs avec beaucoup moins de travail humain.

Qu'est-ce que la « constitution » dans l'IA constitutionnelle ?

La constitution est un ensemble transparent de principes écrits, tirés de sources telles que des documents sur les droits de l'homme, que le modèle utilise pour évaluer et améliorer ses réponses.

Quel problème clé du RLHF standard l’IA constitutionnelle vise-t-elle à réduire ?

En permettant au modèle de se critiquer par rapport aux principes, l'IA constitutionnelle réduit le travail humain consistant à examiner et à étiqueter les résultats perturbants ou nuisibles.

Dans la phase supervisée de l’IA constitutionnelle, que fait le modèle sur sa propre sortie ?

Le modèle exécute une boucle de critique et de révision : il identifie les cas où son projet viole un principe échantillonné, puis réécrit la réponse, créant ainsi des données d'entraînement auto-améliorées.

Que signifie RLAIF dans la phase d’apprentissage par renforcement ?

RLAIF signifie Reinforcement Learning from AI Feedback : un modèle classe les réponses selon la constitution, produisant des données de préférence générées par l'IA au lieu d'étiquettes humaines.

Pourquoi le recours à des principes écrits est-il considéré comme un avantage pour la transparence ?

Parce que les valeurs directrices sont écrites, elles peuvent être inspectées, auditées et modifiées directement, contrairement aux préférences implicitement codées dans des évaluations humaines dispersées.