GUIDE IA du langage

Apprentissage en contexte

L'apprentissage en contexte est la capacité surprenante des grands modèles de langage à reprendre une nouvelle tâche à partir de quelques exemples placés dans l'invite, sans aucun recyclage.

2 minutes de lectureDernière mise à jour

Aperçu

It is the reason you can 'teach' a model on the fly just by showing it what you want.

Plongée profonde

Normalement, enseigner une nouvelle tâche à un réseau neuronal signifie mettre à jour ses poids par le biais d’un entraînement. L'apprentissage en contexte est différent : vous écrivez quelques exemples directement dans l'invite (le « contexte »), et le modèle déduit le modèle et l'applique à une nouvelle entrée. Rien à l’intérieur du modèle ne change ; les exemples orientent simplement la prédiction du prochain jeton. Vous entendrez « zéro-coup » (instruction uniquement), « one-shot » (un exemple) et « quelques-coups » (plusieurs exemples). Ce comportement a été popularisé par GPT-3 en 2020 et s'est avéré être une capacité émergente : les petits modèles ne peuvent pas le faire, mais au-delà d'une échelle d'environ 100 milliards de paramètres, la précision des invites de quelques tirs augmente fortement. Le modèle a effectivement appris à reconnaître et à poursuivre les modèles pendant la pré-formation, afin de pouvoir réutiliser cette compétence au moment de l'inférence.

Aperçu technique

Les recherches sur l'interprétabilité ont attribué une grande partie de cette capacité aux « têtes d'induction » – des circuits d'attention qui émergent pendant l'entraînement et effectuent une correspondance floue de préfixe : ils recherchent l'endroit où un jeton similaire est apparu, puis copient ce qui l'a suivi. Ainsi, lorsque votre invite affiche « pomme -> fruit, carotte -> légume », le modèle correspond à la structure et prédit la bonne étiquette pour l'élément suivant. Surtout, aucun gradient ne circule et aucune mise à jour des poids lors de l'inférence. Les exemples remodèlent simplement les activations qui alimentent la distribution de probabilité du prochain jeton.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L'avenir de l'apprentissage en contexte

L'expansion des fenêtres contextuelles (maintenant des centaines de milliers de jetons) pousse l'apprentissage en contexte vers des régimes « à plusieurs reprises », où des dizaines ou des centaines d'exemples peuvent rivaliser avec le réglage fin de certaines tâches, sans aucun coût de formation. Attendez-vous à une intégration plus étroite avec la récupération, afin que les exemples pertinents soient récupérés automatiquement, et à une meilleure théorie sur les cas où l'apprentissage en contexte échoue ou est distrait. Cela restera le moyen rapide et peu coûteux d’adapter un modèle, complétant – et non remplaçant – le réglage fin pour des tâches stables et à volume élevé.

Mise en œuvre dans le monde réel

Donner à un chatbot trois exemples de tickets d'assistance et leurs catégories, puis lui demander de classer un nouveau ticket de la même manière

Affichage d'un modèle de deux paires avant/après de texte désordonné reformaté en JSON propre afin qu'il convertisse le reste

Coller quelques exemples de descriptions de produits dans le ton de votre marque afin que les nouvelles correspondent au style

Démontrer un problème mathématique délicat travaillé étape par étape afin que le modèle résolve des problèmes similaires avec le même format de raisonnement

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the In-Context Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Fenêtres contextuelles

Questions fréquemment posées

What is In-Context Learning?

L'apprentissage en contexte est la capacité surprenante des grands modèles de langage à reprendre une nouvelle tâche à partir de quelques exemples placés dans l'invite, sans aucun recyclage. C'est la raison pour laquelle vous pouvez « enseigner » un modèle à la volée simplement en lui montrant ce que vous voulez.

Qu'est-ce qui change fondamentalement à l'intérieur du modèle lors de l'apprentissage en contexte ?

L'apprentissage en contexte se produit entièrement par inférence. Les exemples dans l'invite façonnent les activations du modèle et les prédictions du prochain jeton, mais aucune pondération n'est mise à jour.

Pourquoi l'apprentissage en contexte est-il décrit comme une capacité « émergente » ?

Cette capacité est faible ou absente dans les petits modèles et augmente fortement une fois que les modèles atteignent une très grande échelle, c'est pourquoi elle est appelée émergente.

Quel mécanisme interne est le plus associé à l’apprentissage en contexte dans les transformateurs ?

Les travaux d’interprétabilité ont identifié les têtes d’induction – des circuits d’attention qui trouvent où un jeton similaire est apparu et copient ce qui a suivi – comme un moteur essentiel de l’apprentissage en contexte.