Taal AI-GIDS

Latente aandacht met meerdere hoofden

Multi-Head Latent Attention (MLA) is een aandachtsmechanisme, geïntroduceerd in DeepSeek-V2, dat de geheugenvretende sleutelwaardecache comprimeert in een kleine gedeelde latente vector.

2 min readLaatst bijgewerkt

Overzicht

It lets large language models run with far less GPU memory while keeping quality close to standard attention.

Diepe duik

Wanneer een transformator tekst genereert, slaat deze voor elk token uit het verleden een sleutel- en waardevector op in een 'KV-cache'. Die cache groeit met de contextlengte en domineert het geheugengebruik tijdens gevolgtrekking. MLA vervangt de vele sleutel-/waardevectoren op volledige grootte door een enkele latente vector van lage rang per token, en projecteert die latente vervolgens direct in sleutels en waarden per hoofd. Omdat alleen het compacte latente in de cache wordt opgeslagen, rapporteerde DeepSeek-V2 dat het KV-cachegeheugen met meer dan 90% is verminderd ten opzichte van standaard multi-head aandacht, waardoor langere contexten en grotere batchgroottes mogelijk zijn. Cruciaal is dat de opwaartse projectiematrices in andere gewichten kunnen worden gevouwen, zodat MLA deze compressie bereikt met weinig of geen meetbaar verlies aan modelleringskwaliteit.

Technisch inzicht

MLA voert een gezamenlijke compressie van lage rang uit: de verborgen toestand van elk token wordt geprojecteerd tot op een kleine latente vector, en afzonderlijke opwaartse projectiematrices reconstrueren sleutels en waarden per hoofd. Een slimme truc is het 'absorberen' van de gewichten van de opwaartse projectie in de query- en uitvoerprojecties, zodat het model tijdens de gevolgtrekking nooit de volledige sleutels/waarden materialiseert. Inbedding van draaiposities wordt afgehandeld met een ontkoppeld sleutelpad, omdat rotatie niet op dezelfde manier kan worden geabsorbeerd, waardoor positie-informatie behouden blijft.

Strategische impact

Speed and scale

Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.

Access and reach

Het breidt de toegang uit naar meerdere talen en communicatiestijlen.

Clearer decisions

Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.

De toekomst van latente aandacht met meerdere hoofden

MLA heeft ertoe bijgedragen dat DeepSeek-V2 en V3 economisch op grote schaal kunnen worden gebruikt, en de techniek verspreidt zich naarmate teams goedkopere gevolgtrekkingen uit de lange context nastreven. Verwacht dat latente compressie in MLA-stijl wordt gecombineerd met spaarzame Mixture-of-Experts-lagen, gekwantiseerde caches en speculatieve decodering in toekomstige open modellen. Onderzoekers onderzoeken ook in hoeverre de latente dimensie kan krimpen voordat de kwaliteit afneemt, en of hetzelfde laaggeplaatste idee de aandacht tijdens training kan samenpersen, en niet alleen maar gevolgtrekkingen.

Implementatie in de echte wereld

Biedt DeepSeek-V2/V3-chatmodellen met een aanzienlijk kleinere GPU-geheugenvoetafdruk per verzoek

Het beantwoorden van vragen over lange documenten waarbij een grote KV-cache anders VRAM zou uitputten

Het vergroten van de batchgrootte van de gevolgtrekkingen op een vaste GPU omdat elke reeks slechts een kleine latente vector opslaat

Het inschakelen van langere contextvensters op gewone hardware voor ophaalassistenten

Risico's en vangrails

Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.

Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.

Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.

Implementatie routekaart

1

Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.

2

Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.

3

Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.

4

Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Head Latent Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Aandacht voor meerdere zoekopdrachten

Frequently asked questions

What is Multi-Head Latent Attention?

Multi-Head Latent Attention (MLA) is een aandachtsmechanisme, geïntroduceerd in DeepSeek-V2, dat de geheugenvretende sleutelwaardecache comprimeert in een kleine gedeelde latente vector. Het zorgt ervoor dat grote taalmodellen met veel minder GPU-geheugen kunnen werken, terwijl de kwaliteit dicht bij de standaard blijft.

Wat is het voornaamste probleem dat Multi-Head Latente Aandacht moet verminderen?

MLA richt zich op de KV-cache, die groeit met de contextlengte en het geheugen domineert tijdens het genereren van tekst.

Hoe verkleint MLA de KV-cache?

MLA slaat één compacte latente vector per token op in de cache en reconstrueert daaruit sleutels en waarden via up-projectie.

Welk model introduceerde voor het eerst latente aandacht met meerdere hoofden?

MLA werd door DeepSeek geïntroduceerd in zijn DeepSeek-V2-model en overgenomen in DeepSeek-V3.

Waarom heeft MLA een apart 'ontkoppeld' pad nodig voor inbedding van draaiposities?

De roterende transformatie kan niet worden opgenomen in andere gewichtsmatrices, dus MLA behoudt een kleine ontkoppelde sleutelcomponent om positionele informatie over te dragen.

Hoeveel KV-cache-geheugenreductie rapporteerde DeepSeek-V2 grofweg van MLA versus standaard multi-head aandacht?

DeepSeek-V2 meldde dat het KV-cachegeheugen met meer dan 90% is teruggebracht, waardoor langere contexten en grotere batches mogelijk zijn.