GUIDE IA du langage

Attention latente multi-têtes

L'attention latente multi-têtes (MLA) est un mécanisme d'attention, introduit dans DeepSeek-V2, qui compresse le cache clé-valeur gourmand en mémoire dans un petit vecteur latent partagé.

2 minutes de lectureDernière mise à jour

Aperçu

It lets large language models run with far less GPU memory while keeping quality close to standard attention.

Plongée profonde

Lorsqu'un transformateur génère du texte, il stocke un vecteur de clé et de valeur pour chaque jeton passé dans un « cache KV ». Ce cache augmente avec la longueur du contexte et domine l'utilisation de la mémoire lors de l'inférence. MLA remplace les nombreux vecteurs clé/valeur de taille réelle par un seul vecteur latent de bas rang par jeton, puis projette cette sauvegarde latente dans des clés et des valeurs par tête à la volée. Étant donné que seule la latente compacte est mise en cache, DeepSeek-V2 a signalé une réduction de la mémoire cache KV de plus de 90 % par rapport à l'attention multi-tête standard, permettant des contextes plus longs et des lots de plus grande taille. Surtout, les matrices de projection ascendante peuvent être repliées dans d'autres poids, de sorte que MLA réalise cette compression avec peu ou pas de perte mesurable de qualité de modélisation.

Aperçu technique

MLA effectue une compression conjointe de bas rang : l'état caché de chaque jeton est projeté vers un petit vecteur latent, et des matrices de projection vers le haut distinctes reconstruisent les clés et les valeurs par tête. Une astuce astucieuse consiste à « absorber » les poids de projection ascendante dans les projections de requête et de sortie, de sorte que le modèle ne matérialise jamais les clés/valeurs complètes lors de l'inférence. Les intégrations de position rotatives sont gérées avec un chemin de clé découplé, car la rotation ne peut pas être absorbée de la même manière, préservant ainsi les informations de position.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L’avenir de l’attention latente multi-têtes

MLA a contribué à rendre DeepSeek-V2 et V3 économiques pour une utilisation à grande échelle, et la technique se répand à mesure que les équipes recherchent une inférence à long contexte moins chère. Attendez-vous à ce que la compression latente de style MLA se combine avec des couches de mélange d'experts clairsemées, des caches quantifiés et un décodage spéculatif dans les futurs modèles ouverts. Les chercheurs étudient également jusqu’où la dimension latente peut diminuer avant que la qualité ne baisse, et si la même idée de bas rang peut comprimer l’attention pendant la formation, et pas seulement l’inférence.

Mise en œuvre dans le monde réel

Servir les modèles de chat DeepSeek-V2/V3 avec des empreintes de mémoire GPU considérablement réduites par requête

Exécution d'une longue question de document répondant à l'endroit où un grand cache KV épuiserait autrement la VRAM

Augmentation de la taille du lot d'inférence sur un GPU fixe, car chaque séquence ne stocke qu'un petit vecteur latent

Activation de fenêtres contextuelles plus longues sur le matériel standard pour les assistants de récupération augmentée

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Head Latent Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Attention multi-requêtes

Questions fréquemment posées

What is Multi-Head Latent Attention?

L'attention latente multi-têtes (MLA) est un mécanisme d'attention, introduit dans DeepSeek-V2, qui compresse le cache clé-valeur gourmand en mémoire dans un petit vecteur latent partagé. Il permet aux grands modèles de langage de fonctionner avec beaucoup moins de mémoire GPU tout en gardant une qualité proche de l'attention standard.

Quel est le principal problème que l’attention latente multi-têtes est conçue pour réduire ?

MLA cible le cache KV, qui augmente avec la longueur du contexte et domine la mémoire lors de la génération de texte.

Comment MLA réduit-il le cache KV ?

MLA met en cache un vecteur latent compact par jeton et en reconstruit les clés et les valeurs via une projection ascendante.

Quel modèle a introduit pour la première fois l’attention latente multi-têtes ?

MLA a été introduit par DeepSeek dans son modèle DeepSeek-V2 et intégré dans DeepSeek-V3.

Pourquoi MLA a-t-il besoin d'un chemin « découplé » distinct pour les intégrations de positions rotatives ?

La transformation rotative ne peut pas être absorbée dans d'autres matrices de poids, donc MLA conserve un petit composant clé découplé pour transporter les informations de position.

Environ combien de réduction de mémoire cache KV DeepSeek-V2 a-t-il rapporté de MLA par rapport à l'attention multi-tête standard ?

DeepSeek-V2 a signalé une réduction de la mémoire cache KV de plus de 90 %, permettant des contextes plus longs et des lots plus importants.