Attention latente multi-têtes
L'attention latente multi-têtes (MLA) est un mécanisme d'attention, introduit dans DeepSeek-V2, qui compresse le cache clé-valeur gourmand en mémoire dans un petit vecteur latent partagé.
Aperçu
It lets large language models run with far less GPU memory while keeping quality close to standard attention.
Plongée profonde
Lorsqu'un transformateur génère du texte, il stocke un vecteur de clé et de valeur pour chaque jeton passé dans un « cache KV ». Ce cache augmente avec la longueur du contexte et domine l'utilisation de la mémoire lors de l'inférence. MLA remplace les nombreux vecteurs clé/valeur de taille réelle par un seul vecteur latent de bas rang par jeton, puis projette cette sauvegarde latente dans des clés et des valeurs par tête à la volée. Étant donné que seule la latente compacte est mise en cache, DeepSeek-V2 a signalé une réduction de la mémoire cache KV de plus de 90 % par rapport à l'attention multi-tête standard, permettant des contextes plus longs et des lots de plus grande taille. Surtout, les matrices de projection ascendante peuvent être repliées dans d'autres poids, de sorte que MLA réalise cette compression avec peu ou pas de perte mesurable de qualité de modélisation.
Aperçu technique
MLA effectue une compression conjointe de bas rang : l'état caché de chaque jeton est projeté vers un petit vecteur latent, et des matrices de projection vers le haut distinctes reconstruisent les clés et les valeurs par tête. Une astuce astucieuse consiste à « absorber » les poids de projection ascendante dans les projections de requête et de sortie, de sorte que le modèle ne matérialise jamais les clés/valeurs complètes lors de l'inférence. Les intégrations de position rotatives sont gérées avec un chemin de clé découplé, car la rotation ne peut pas être absorbée de la même manière, préservant ainsi les informations de position.
Impact stratégique
Vitesse et échelle
Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.
Accès et portée
Il étend l’accès à toutes les langues et styles de communication.
Décisions plus claires
Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.
L’avenir de l’attention latente multi-têtes
MLA a contribué à rendre DeepSeek-V2 et V3 économiques pour une utilisation à grande échelle, et la technique se répand à mesure que les équipes recherchent une inférence à long contexte moins chère. Attendez-vous à ce que la compression latente de style MLA se combine avec des couches de mélange d'experts clairsemées, des caches quantifiés et un décodage spéculatif dans les futurs modèles ouverts. Les chercheurs étudient également jusqu’où la dimension latente peut diminuer avant que la qualité ne baisse, et si la même idée de bas rang peut comprimer l’attention pendant la formation, et pas seulement l’inférence.
Mise en œuvre dans le monde réel
Servir les modèles de chat DeepSeek-V2/V3 avec des empreintes de mémoire GPU considérablement réduites par requête
Exécution d'une longue question de document répondant à l'endroit où un grand cache KV épuiserait autrement la VRAM
Augmentation de la taille du lot d'inférence sur un GPU fixe, car chaque séquence ne stocke qu'un petit vecteur latent
Activation de fenêtres contextuelles plus longues sur le matériel standard pour les assistants de récupération augmentée
Risques et garde-fous
Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.
La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.
Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.
Feuille de route de mise en œuvre
Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.
Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.
Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.
Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Head Latent Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Attention multi-requêtes
Questions fréquemment posées
What is Multi-Head Latent Attention?
L'attention latente multi-têtes (MLA) est un mécanisme d'attention, introduit dans DeepSeek-V2, qui compresse le cache clé-valeur gourmand en mémoire dans un petit vecteur latent partagé. Il permet aux grands modèles de langage de fonctionner avec beaucoup moins de mémoire GPU tout en gardant une qualité proche de l'attention standard.
Quel est le principal problème que l’attention latente multi-têtes est conçue pour réduire ?
MLA cible le cache KV, qui augmente avec la longueur du contexte et domine la mémoire lors de la génération de texte.
Comment MLA réduit-il le cache KV ?
MLA met en cache un vecteur latent compact par jeton et en reconstruit les clés et les valeurs via une projection ascendante.
Quel modèle a introduit pour la première fois l’attention latente multi-têtes ?
MLA a été introduit par DeepSeek dans son modèle DeepSeek-V2 et intégré dans DeepSeek-V3.
Pourquoi MLA a-t-il besoin d'un chemin « découplé » distinct pour les intégrations de positions rotatives ?
La transformation rotative ne peut pas être absorbée dans d'autres matrices de poids, donc MLA conserve un petit composant clé découplé pour transporter les informations de position.
Environ combien de réduction de mémoire cache KV DeepSeek-V2 a-t-il rapporté de MLA par rapport à l'attention multi-tête standard ?
DeepSeek-V2 a signalé une réduction de la mémoire cache KV de plus de 90 %, permettant des contextes plus longs et des lots plus importants.