Atenção latente de múltiplas cabeças
Multi-Head Latent Attention (MLA) é um mecanismo de atenção, introduzido no DeepSeek-V2, que compacta o cache de valor-chave que consome muita memória em um pequeno vetor latente compartilhado.
Visão geral
It lets large language models run with far less GPU memory while keeping quality close to standard attention.
Mergulho profundo
Quando um transformador gera texto, ele armazena um vetor de chave e valor para cada token passado em um 'cache KV'. Esse cache cresce com o comprimento do contexto e domina o uso da memória durante a inferência. O MLA substitui os muitos vetores de chave/valor em tamanho real por um único vetor latente de classificação baixa por token e, em seguida, projeta esse backup latente em chaves e valores por cabeça dinamicamente. Como apenas o latente compacto é armazenado em cache, o DeepSeek-V2 relatou um corte na memória do cache KV em mais de 90% em comparação com a atenção multihead padrão, permitindo contextos mais longos e tamanhos de lote maiores. Crucialmente, as matrizes de projeção superior podem ser dobradas em outros pesos, de modo que o MLA atinge essa compressão com pouca ou nenhuma perda mensurável na qualidade da modelagem.
Visão Técnica
O MLA realiza uma compactação conjunta de baixa classificação: o estado oculto de cada token é projetado em um pequeno vetor latente e matrizes de projeção ascendente separadas reconstroem chaves e valores por cabeça. Um truque inteligente é 'absorver' os pesos da projeção ascendente nas projeções de consulta e saída, para que o modelo nunca materialize chaves/valores completos durante a inferência. Os embeddings de posições rotativas são tratados com caminho de chave desacoplado, pois a rotação não pode ser absorvida da mesma forma, preservando as informações posicionais.
Impacto Estratégico
Velocidade e escala
Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.
Acesso e alcance
Ele expande o acesso entre idiomas e estilos de comunicação.
Decisões mais claras
As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.
O futuro da atenção latente multicabeças
O MLA ajudou a tornar o DeepSeek-V2 e V3 econômico para servir em escala, e a técnica está se espalhando à medida que as equipes buscam inferências de longo contexto mais baratas. Espere que a compactação latente no estilo MLA se combine com camadas esparsas de mistura de especialistas, caches quantizados e decodificação especulativa em futuros modelos abertos. Os pesquisadores também estão explorando até que ponto a dimensão latente pode diminuir antes que a qualidade caia, e se a mesma ideia de baixo escalão pode comprimir a atenção durante o treinamento, e não apenas a inferência.
Implementação no mundo real
Servindo modelos de bate-papo DeepSeek-V2/V3 com espaços de memória de GPU drasticamente menores por solicitação
Executando respostas a perguntas de documentos longos onde um cache KV grande esgotaria a VRAM
Aumentando o tamanho do lote de inferência em uma GPU fixa porque cada sequência armazena apenas um pequeno vetor latente
Habilitando janelas de contexto mais longas em hardware comum para assistentes aumentados de recuperação
Riscos e guarda-corpos
Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.
A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.
Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.
Roteiro de implementação
Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.
Respostas terrestres com fontes confiáveis sempre que a precisão for importante.
Mantenha um ponto de verificação de revisão humana para resultados de alto risco.
Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Head Latent Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Atenção multiconsulta
Perguntas frequentes
What is Multi-Head Latent Attention?
Multi-Head Latent Attention (MLA) é um mecanismo de atenção, introduzido no DeepSeek-V2, que compacta o cache de valor-chave que consome muita memória em um pequeno vetor latente compartilhado. Ele permite que modelos de linguagens grandes sejam executados com muito menos memória de GPU, mantendo a qualidade próxima da atenção padrão.
Qual é o principal problema que a Atenção Latente Multi-Cabeça foi projetada para reduzir?
O MLA tem como alvo o cache KV, que cresce com o comprimento do contexto e domina a memória durante a geração de texto.
Como o MLA reduz o cache KV?
O MLA armazena em cache um vetor latente compacto por token e reconstrói chaves e valores dele por meio de projeção ascendente.
Qual modelo introduziu pela primeira vez a Atenção Latente Multi-Head?
O MLA foi introduzido pela DeepSeek em seu modelo DeepSeek-V2 e transportado para o DeepSeek-V3.
Por que o MLA precisa de um caminho 'desacoplado' separado para incorporações de posições rotativas?
A transformação rotativa não pode ser absorvida por outras matrizes de peso, então o MLA mantém um pequeno componente-chave desacoplado para transportar informações posicionais.
Aproximadamente quanta redução de memória do cache KV o DeepSeek-V2 relatou do MLA em comparação com a atenção padrão de vários cabeçotes?
DeepSeek-V2 relatou redução da memória cache KV em mais de 90%, permitindo contextos mais longos e lotes maiores.