Atención latente de múltiples cabezas
La atención latente de múltiples cabezas (MLA) es un mecanismo de atención, introducido en DeepSeek-V2, que comprime la caché de valores-clave que consume mucha memoria en un pequeño vector latente compartido.
Descripción general
It lets large language models run with far less GPU memory while keeping quality close to standard attention.
Buceo profundo
Cuando un transformador genera texto, almacena una clave y un vector de valor para cada token anterior en una 'caché KV'. Ese caché crece con la longitud del contexto y domina el uso de la memoria durante la inferencia. MLA reemplaza los muchos vectores clave/valor de tamaño completo con un único vector latente de bajo rango por token, luego proyecta ese respaldo latente en claves y valores por cabeza sobre la marcha. Debido a que solo se almacena en caché el contenido latente compacto, DeepSeek-V2 informó que redujo la memoria caché KV en más del 90 % en comparación con la atención estándar de múltiples cabezales, lo que permite contextos más largos y tamaños de lotes más grandes. Fundamentalmente, las matrices de proyección superior se pueden plegar en otros pesos, por lo que MLA logra esta compresión con poca o ninguna pérdida mensurable en la calidad del modelado.
Información técnica
MLA realiza una compresión conjunta de bajo rango: el estado oculto de cada token se proyecta hacia un pequeño vector latente, y matrices de proyección ascendente separadas reconstruyen claves y valores por cabeza. Un truco inteligente es "absorber" los pesos de la proyección ascendente en las proyecciones de consulta y salida, de modo que el modelo nunca materialice claves/valores completos durante la inferencia. Las incrustaciones de posición rotatoria se manejan con una ruta de clave desacoplada, ya que la rotación no se puede absorber de la misma manera, preservando la información posicional.
Impacto Estratégico
Speed and scale
Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.
Access and reach
Amplía el acceso a través de idiomas y estilos de comunicación.
Decisiones más claras
Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.
El futuro de la atención latente de múltiples cabezas
MLA ayudó a que DeepSeek-V2 y V3 fueran económicos para funcionar a escala, y la técnica se está extendiendo a medida que los equipos buscan inferencias de contexto largo más baratas. Espere que la compresión latente de estilo MLA se combine con capas escasas de mezcla de expertos, cachés cuantificadas y decodificación especulativa en futuros modelos abiertos. Los investigadores también están explorando hasta qué punto puede reducirse la dimensión latente antes de que baje la calidad, y si la misma idea de bajo rango puede comprimir la atención durante el entrenamiento, no solo la inferencia.
Implementación en el mundo real
Sirviendo modelos de chat DeepSeek-V2/V3 con espacios de memoria GPU dramáticamente más pequeños por solicitud
Ejecutar preguntas de documentos largos respondiendo a situaciones en las que una caché KV grande agotaría la VRAM
Aumento del tamaño del lote de inferencia en una GPU fija porque cada secuencia almacena solo un pequeño vector latente
Habilitación de ventanas contextuales más largas en hardware básico para asistentes de recuperación aumentada
Riesgos y barandillas
Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.
La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.
Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.
Hoja de ruta de implementación
Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.
Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.
Mantenga un punto de control de revisión humana para los resultados de alto riesgo.
Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Head Latent Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Atención multiconsulta
Preguntas frecuentes
What is Multi-Head Latent Attention?
La atención latente de múltiples cabezas (MLA) es un mecanismo de atención, introducido en DeepSeek-V2, que comprime la caché de valores-clave que consume mucha memoria en un pequeño vector latente compartido. Permite ejecutar modelos de lenguajes grandes con mucha menos memoria de GPU y, al mismo tiempo, mantener la calidad cercana a la atención estándar.
¿Cuál es el problema principal que la atención latente de múltiples cabezas está diseñada para reducir?
MLA apunta a la caché KV, que crece con la longitud del contexto y domina la memoria durante la generación de texto.
¿Cómo reduce MLA la caché KV?
MLA almacena en caché un vector latente compacto por token y reconstruye claves y valores a partir de él mediante proyección ascendente.
¿Qué modelo introdujo por primera vez la atención latente de cabezas múltiples?
DeepSeek introdujo MLA en su modelo DeepSeek-V2 y lo incorporó a DeepSeek-V3.
¿Por qué MLA necesita una ruta 'desacoplada' separada para incrustaciones de posiciones rotativas?
La transformación rotativa no se puede absorber en otras matrices de peso, por lo que MLA mantiene un pequeño componente clave desacoplado para transportar información posicional.
¿Aproximadamente cuánta reducción de memoria caché KV reportó DeepSeek-V2 desde MLA en comparación con la atención estándar de múltiples cabezales?
DeepSeek-V2 informó que redujo la memoria caché KV en más del 90 %, lo que permitió contextos más largos y lotes más grandes.