GUIDE Technique

Génération augmentée par cache (CAG)

La génération augmentée du cache (CAG) précharge une fois une base de connaissances entière et fixe dans le cache clé-valeur (KV) d'un modèle de langage et réutilise ce cache pour chaque question, au lieu de récupérer des documents par requête comme le fait RAG.

  • 3 minutes de lecture
  • Dernière mise à jour
Sur cette page3 minutes de lecture
  1. Aperçu
  2. Plongée profonde
  3. Impact stratégique
  4. L'avenir de la génération augmentée par cache (CAG)
  5. Mise en œuvre dans le monde réel
  6. Risques et garde-fous
  7. Feuille de route de mise en œuvre
  8. Continuez à explorer
  9. Questions fréquemment posées

Aperçu

C'est important pour les petits corpus stables car cela supprime les erreurs de récupération et la maintenance de l'index tout en répondant plus rapidement qu'en relisant les documents à chaque fois.

Plongée profonde

La génération augmentée du cache, ou CAG, remplace l'étape de récupération par le préchargement. Au lieu de rechercher une base de connaissances pour chaque question, le système alimente le modèle une seule fois dans l'intégralité de la base de connaissances, enregistre le cache clé-valeur (KV) résultant et réutilise ce cache pour chaque requête ultérieure. L'approche a été décrite dans un article de décembre 2024 intitulé Don't Do RAG : When Cache-Augmented Generation is All You Need for Knowledge Tasks. Le cache KV est l'ensemble des clés d'attention intermédiaires et des valeurs qu'un transformateur calcule pour chaque jeton qu'il a lu. Normalement, il est construit au cours d’une seule requête et supprimé. Dans CAG, les documents sont traités à l'avance, le cache est stocké et chaque question est ajoutée après le préfixe mis en cache. Le modèle calcule uniquement les nouveaux jetons de question avant de les générer, de sorte que les réponses démarrent plus rapidement que si les documents étaient relus à chaque fois. Après avoir répondu, les jetons ajoutés sont tronqués afin que le cache revienne à son état de documents uniquement pour la requête suivante. Les avantages sont l'absence d'erreurs de récupération, puisque chaque document est toujours présent, l'absence d'index d'intégration ou de base de données vectorielles à maintenir et une latence par requête inférieure à celle d'un contexte long naïf. Les limites suivent directement : l'ensemble du corpus doit tenir dans la fenêtre contextuelle du modèle, le modèle doit encore raisonner sur autant de texte, et toute modification des documents nécessite de reconstruire le cache. CAG s'adapte donc à des bases de connaissances petites et stables telles qu'un manuel de produit, un ensemble de politiques, un programme ou un texte réglementaire fixe. Il ne convient pas aux collections volumineuses, à évolution rapide ou filtrées par autorisation. Une idée fausse courante est que CAG entraîne le modèle. Rien n'est réglé avec précision ; les poids sont inchangés. La mise en cache des invites commerciales des fournisseurs d’API est un parent hébergé de la même idée.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L'avenir de la génération augmentée par cache (CAG)

La portée pratique de CAG augmente à mesure que les fenêtres de contexte s'allongent et que la compression du cache KV s'améliore, mais elle reste limitée par la mémoire et par la façon dont les modèles raisonnent sur de très longues entrées. Les conceptions hybrides constituent une prochaine étape naturelle : mettre en cache un noyau stable de documents fréquemment nécessaires et récupérer la longue traîne à la demande. La recherche sur la compression du cache, le déchargement des caches vers un stockage moins cher et le choix des jetons à conserver peuvent rendre exploitables des corpus préchargés plus importants. Pour l'instant, le test judicieux est empirique : comparez CAG, RAG et le contexte long simple sur vos propres questions, coûts et fréquence de mise à jour.

Mise en œuvre dans le monde réel

Une entreprise disposant d'un manuel de l'employé de 60 pages le précharge dans le cache KV d'un modèle à pondération ouverte, de sorte que chaque question RH reçoit une réponse avec le manuel complet présent et sans base de données vectorielles à maintenir.

Un éditeur de logiciels met en cache son manuel de produit pour un assistant de support et reconstruit le cache uniquement lorsqu'une nouvelle version du manuel est publiée.

Un instructeur précharge un programme de cours et des notes de cours afin qu'un assistant d'étude puisse répondre rapidement aux questions des étudiants tout au long d'un semestre.

Une équipe de conformité utilise la mise en cache des invites d'une API hébergée pour conserver un texte réglementaire fixe comme préfixe en cache, en payant des tarifs réduits pour les lectures répétées de nombreuses questions.

Risques et garde-fous

  • L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

  • Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

  • Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

  1. Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

  2. Benchmark dans des conditions de charge et de données réalistes.

  3. Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

  4. Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Cache-Augmented Generation (CAG) quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Questions fréquemment posées

Qu'est-ce que la génération augmentée par cache (CAG) ?

La génération augmentée du cache (CAG) précharge une fois une base de connaissances entière et fixe dans le cache clé-valeur (KV) d'un modèle de langage et réutilise ce cache pour chaque question, au lieu de récupérer des documents par requête comme le fait RAG. C'est important pour les petits corpus stables car cela supprime les erreurs de récupération et la maintenance de l'index tout en répondant plus rapidement qu'en relisant les documents à chaque fois.

Qu'est-ce que CAG utilise à la place de la récupération par requête ?

CAG calcule à l'avance le cache KV du corpus et le réutilise pour chaque requête.

Qu'est-ce que le cache KV dans un transformateur ?

Les clés et les valeurs des couches d'attention sont mises en cache afin que les jetons antérieurs n'aient pas besoin d'être recalculés.

Pourquoi un système CAG tronque-t-il le cache après chaque réponse ?

La suppression des jetons ajoutés réinitialise le cache à son état préchargé propre pour la question suivante.

Quelle est la principale limite du CAG ?

Chaque document étant préchargé, le corpus est limité à la fenêtre contextuelle et à la mémoire disponible.

Pourquoi CAG répond-il plus rapidement que de coller les documents dans chaque demande ?

Le calcul des documents est déjà effectué et stocké, donc seule la question est traitée par requête.