Fenêtres contextuelles
Une fenêtre contextuelle correspond à la quantité maximale de texte, mesurée en jetons, qu'un modèle peut lire et garder à l'esprit en même temps.
Aperçu
Il fixe une limite stricte à la quantité réelle de votre conversation, de vos documents ou d’instructions que le modèle peut réellement utiliser.
Plongée profonde
Les modèles ne lisent pas directement les caractères ou les mots ; ils lisent des jetons, où un jeton est un morceau de texte représentant environ les trois quarts d'un mot en anglais. La fenêtre contextuelle compte l'invite ainsi que la propre réponse du modèle. Les premiers GPT-3 géraient environ 2 000 jetons ; d'ici 2025-2026, les modèles frontières se sont considérablement développés : le Gemini de Google atteint un à deux millions de jetons, plusieurs modèles Claude et GPT offrent 128 000 jusqu'à un million, soit suffisamment pour des livres entiers ou des bases de code. Mais plus grand n’est pas automatiquement meilleur. Parce que l’attention compare chaque jeton les uns aux autres, les coûts de calcul et de mémoire augmentent fortement avec la longueur. Les modèles montrent également un effet de « perte au milieu », rappelant les informations au début et à la fin d'une longue entrée de manière plus fiable que les informations enfouies au centre.
Aperçu technique
Everything in a single request — system instructions, prior chat turns, pasted documents, and the answer being generated — must fit inside the token budget. Lorsqu'il déborde, le contenu le plus ancien est supprimé ou doit être résumé, c'est pourquoi les longues discussions semblent « oublier ». Les fenêtres plus grandes sont coûteuses car l'attention personnelle évolue à peu près avec le carré du nombre de jetons et parce que le modèle met en cache les vecteurs clé/valeur pour chaque jeton, consommant de la mémoire. C'est pourquoi les fournisseurs évaluent par jetons et pourquoi la récupération est souvent moins chère que de tout mettre en contexte.
Impact stratégique
Vitesse et échelle
Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.
Accès et portée
Il étend l’accès à toutes les langues et styles de communication.
Décisions plus claires
Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.
L'avenir des fenêtres contextuelles
Les fenêtres contextuelles continueront de croître, mais l’accent passera de la taille brute à l’utilisation efficace. Des techniques telles qu'une meilleure formation sur un contexte long, des optimisations de l'attention et une compression du cache clé/valeur visent à réduire le problème de la « perte au milieu » et la courbe des coûts. La génération augmentée par récupération restera un complément pratique, récupérant uniquement les morceaux pertinents au lieu de payer pour traiter des millions de jetons à chaque appel. Attendez-vous à ce que « avec quelle fiabilité le modèle peut-il utiliser sa fenêtre » soit plus important que le nombre maximum du titre.
Mise en œuvre dans le monde réel
Coller l'intégralité d'un contrat ou d'un document de recherche afin que le modèle puisse répondre aux questions à ce sujet sans perdre les sections précédentes.
Longues sessions de codage au cours desquelles l'assistant doit garder en vue simultanément de nombreux fichiers et modifications antérieures.
Des robots de support client qui doivent mémoriser l’intégralité des allers-retours d’une conversation pour rester cohérents.
Analyser des journaux ou des transcriptions volumineux où les détails clés peuvent être éloignés les uns des autres et risquer d'être « perdus au milieu ».
Risques et garde-fous
Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.
La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.
Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.
Feuille de route de mise en œuvre
Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.
Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.
Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.
Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Context Windows quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Mise à l'échelle de la fenêtre contextuelle YaRN
Questions fréquemment posées
Qu’est-ce que les fenêtres contextuelles ?
Une fenêtre contextuelle correspond à la quantité maximale de texte, mesurée en jetons, qu'un modèle peut lire et garder à l'esprit en même temps. Cela fixe une limite stricte à la quantité de conversation, de documents ou d'instructions que le modèle peut réellement utiliser.
Que mesure la fenêtre contextuelle d'un modèle ?
La fenêtre contextuelle est le budget symbolique pour une seule requête : la quantité de texte dans laquelle le modèle peut lire et répondre en même temps.
Qu'est-ce qu'un jeton dans ce contexte ?
Les modèles traitent le texte sous forme de jetons, qui sont des morceaux de sous-mots ; en anglais, un jeton représente en moyenne environ les trois quarts d'un mot.
Quels éléments sont pris en compte dans la fenêtre contextuelle dans une seule requête ?
L'ensemble de la requête partage un seul budget : les instructions, l'historique des conversations, tout contenu collé et la propre sortie du modèle consomment tous des jetons.
Pourquoi une fenêtre contextuelle plus grande n’est-elle pas automatiquement meilleure ?
Le coût d'attention augmente à peu près avec le carré du nombre de jetons, et l'effet « perdu au milieu » signifie que les détails du milieu du document peuvent être rappelés de manière moins fiable.
Pourquoi la génération augmentée par récupération (RAG) est-elle souvent utilisée au lieu de tout mettre dans la fenêtre contextuelle ?
RAG récupère uniquement les éléments pertinents d'une base de connaissances, évitant ainsi le coût lié à l'introduction d'énormes quantités de texte dans le modèle à chaque requête.