Latente aandacht met meerdere hoofden
Multi-Head Latent Attention (MLA) is een aandachtsmechanisme, geïntroduceerd in DeepSeek-V2, dat de geheugenvretende sleutelwaardecache comprimeert in een kleine gedeelde latente vector.
Overzicht
It lets large language models run with far less GPU memory while keeping quality close to standard attention.
Diepe duik
Wanneer een transformator tekst genereert, slaat deze voor elk token uit het verleden een sleutel- en waardevector op in een 'KV-cache'. Die cache groeit met de contextlengte en domineert het geheugengebruik tijdens gevolgtrekking. MLA vervangt de vele sleutel-/waardevectoren op volledige grootte door een enkele latente vector van lage rang per token, en projecteert die latente vervolgens direct in sleutels en waarden per hoofd. Omdat alleen het compacte latente in de cache wordt opgeslagen, rapporteerde DeepSeek-V2 dat het KV-cachegeheugen met meer dan 90% is verminderd ten opzichte van standaard multi-head aandacht, waardoor langere contexten en grotere batchgroottes mogelijk zijn. Cruciaal is dat de opwaartse projectiematrices in andere gewichten kunnen worden gevouwen, zodat MLA deze compressie bereikt met weinig of geen meetbaar verlies aan modelleringskwaliteit.
Technisch inzicht
MLA voert een gezamenlijke compressie van lage rang uit: de verborgen toestand van elk token wordt geprojecteerd tot op een kleine latente vector, en afzonderlijke opwaartse projectiematrices reconstrueren sleutels en waarden per hoofd. Een slimme truc is het 'absorberen' van de gewichten van de opwaartse projectie in de query- en uitvoerprojecties, zodat het model tijdens de gevolgtrekking nooit de volledige sleutels/waarden materialiseert. Inbedding van draaiposities wordt afgehandeld met een ontkoppeld sleutelpad, omdat rotatie niet op dezelfde manier kan worden geabsorbeerd, waardoor positie-informatie behouden blijft.
Strategische impact
Speed and scale
Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.
Access and reach
Het breidt de toegang uit naar meerdere talen en communicatiestijlen.
Clearer decisions
Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.
De toekomst van latente aandacht met meerdere hoofden
MLA heeft ertoe bijgedragen dat DeepSeek-V2 en V3 economisch op grote schaal kunnen worden gebruikt, en de techniek verspreidt zich naarmate teams goedkopere gevolgtrekkingen uit de lange context nastreven. Verwacht dat latente compressie in MLA-stijl wordt gecombineerd met spaarzame Mixture-of-Experts-lagen, gekwantiseerde caches en speculatieve decodering in toekomstige open modellen. Onderzoekers onderzoeken ook in hoeverre de latente dimensie kan krimpen voordat de kwaliteit afneemt, en of hetzelfde laaggeplaatste idee de aandacht tijdens training kan samenpersen, en niet alleen maar gevolgtrekkingen.
Implementatie in de echte wereld
Biedt DeepSeek-V2/V3-chatmodellen met een aanzienlijk kleinere GPU-geheugenvoetafdruk per verzoek
Het beantwoorden van vragen over lange documenten waarbij een grote KV-cache anders VRAM zou uitputten
Het vergroten van de batchgrootte van de gevolgtrekkingen op een vaste GPU omdat elke reeks slechts een kleine latente vector opslaat
Het inschakelen van langere contextvensters op gewone hardware voor ophaalassistenten
Risico's en vangrails
Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.
Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.
Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.
Implementatie routekaart
Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.
Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.
Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.
Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Head Latent Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Aandacht voor meerdere zoekopdrachten
Frequently asked questions
What is Multi-Head Latent Attention?
Multi-Head Latent Attention (MLA) is een aandachtsmechanisme, geïntroduceerd in DeepSeek-V2, dat de geheugenvretende sleutelwaardecache comprimeert in een kleine gedeelde latente vector. Het zorgt ervoor dat grote taalmodellen met veel minder GPU-geheugen kunnen werken, terwijl de kwaliteit dicht bij de standaard blijft.
Wat is het voornaamste probleem dat Multi-Head Latente Aandacht moet verminderen?
MLA richt zich op de KV-cache, die groeit met de contextlengte en het geheugen domineert tijdens het genereren van tekst.
Hoe verkleint MLA de KV-cache?
MLA slaat één compacte latente vector per token op in de cache en reconstrueert daaruit sleutels en waarden via up-projectie.
Welk model introduceerde voor het eerst latente aandacht met meerdere hoofden?
MLA werd door DeepSeek geïntroduceerd in zijn DeepSeek-V2-model en overgenomen in DeepSeek-V3.
Waarom heeft MLA een apart 'ontkoppeld' pad nodig voor inbedding van draaiposities?
De roterende transformatie kan niet worden opgenomen in andere gewichtsmatrices, dus MLA behoudt een kleine ontkoppelde sleutelcomponent om positionele informatie over te dragen.
Hoeveel KV-cache-geheugenreductie rapporteerde DeepSeek-V2 grofweg van MLA versus standaard multi-head aandacht?
DeepSeek-V2 meldde dat het KV-cachegeheugen met meer dan 90% is teruggebracht, waardoor langere contexten en grotere batches mogelijk zijn.