Nyelvi AI ÚTMUTATÓ

Többfejű látens figyelem

A Multi-Head Latent Attention (MLA) a DeepSeek-V2-ben bevezetett figyelemmechanizmus, amely a memóriaéhes kulcsérték-gyorsítótárat egy kis megosztott látens vektorba tömöríti.

2 perc olvasásUtoljára frissítve

Áttekintés

It lets large language models run with far less GPU memory while keeping quality close to standard attention.

Mély merülés

Amikor egy transzformátor szöveget generál, minden múltbeli jogkivonathoz kulcs- és értékvektort tárol a „KV gyorsítótárban”. Ez a gyorsítótár a kontextus hosszával nő, és uralja a memóriahasználatot a következtetés során. Az MLA lecseréli a sok teljes méretű kulcs/érték vektort egyetlen alacsony rangú látens vektorra tokenenként, majd ezt a látenst menet közben visszavetíti fejenkénti kulcsokká és értékekké. Mivel csak a kompakt látens van gyorsítótárazva, a DeepSeek-V2 arról számolt be, hogy több mint 90%-kal csökkenti a KV-gyorsítótár memóriáját a hagyományos többfejes figyelemhez képest, ami hosszabb környezetet és nagyobb kötegméreteket tesz lehetővé. Lényeges, hogy a felfelé vetítési mátrixok más súlyokká hajtogathatók, így az MLA ezt a tömörítést csekély vagy semmilyen mérhető modellezési minőségromlás nélkül éri el.

Technikai betekintés

Az MLA alacsony rangú együttes tömörítést hajt végre: minden jogkivonat rejtett állapota egy kis látens vektorra vetül le, és külön felfelé vetítési mátrixok rekonstruálják a fejenkénti kulcsokat és értékeket. Egy okos trükk a felvetítési súlyok „elnyelése” a lekérdezésbe és a kimeneti vetületekbe, így a modell soha nem valósítja meg a teljes kulcsokat/értékeket a következtetés során. A forgópozíciós beágyazások kezelése leválasztott kulcspályával történik, mivel a forgást nem lehet ugyanúgy felvenni, megőrizve a helyzetinformációkat.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A többfejű látens figyelem jövője

Az MLA segített abban, hogy a DeepSeek-V2 és a V3 gazdaságos legyen a nagyméretű kiszolgáláshoz, és a technika egyre terjed, ahogy a csapatok olcsóbb, hosszú kontextusú következtetéseket kergetnek. Várható, hogy az MLA-stílusú látens tömörítés egyesülni fog a ritka Mixture-of-Experts rétegekkel, kvantált gyorsítótárral és spekulatív dekódolással a jövőbeli nyílt modellekben. A kutatók azt is vizsgálják, hogy a látens dimenzió meddig zsugorodik a minőség romlása előtt, és hogy ugyanaz az alacsony rangú ötlet összenyomhatja-e a figyelmet az edzés során, nem csak következtetéseket.

Valós megvalósítás

DeepSeek-V2/V3 chatmodellek kiszolgálása drámaian kisebb GPU memóriaterülettel kérésenként

Hosszú dokumentumkérdés futtatása, amely megválaszolja, hogy egy nagy KV gyorsítótár egyébként hol merítené ki a VRAM-ot

Következtetési köteg méretének növelése rögzített GPU-n, mivel minden sorozat csak egy apró látens vektort tárol

Hosszabb kontextusablakok engedélyezése az árucikk hardverén a visszakereséssel kiegészített asszisztensek számára

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Head Latent Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Több lekérdezés figyelem

Gyakran ismételt kérdések

What is Multi-Head Latent Attention?

A Multi-Head Latent Attention (MLA) a DeepSeek-V2-ben bevezetett figyelemmechanizmus, amely a memóriaéhes kulcsérték-gyorsítótárat egy kis megosztott látens vektorba tömöríti. Lehetővé teszi, hogy a nagy nyelvű modellek sokkal kevesebb GPU-memóriával fussanak, miközben a minőség a szokásos figyelem közelében marad.

Mi az elsődleges probléma a többfejű látens figyelem csökkentésére?

Az MLA a KV gyorsítótárat célozza meg, amely a környezet hosszával nő, és uralja a memóriát a szöveggenerálás során.

Hogyan csökkenti az MLA a KV gyorsítótárat?

Az MLA tokenenként egy kompakt látens vektort gyorsítótáraz, és abból felfelé kivetítéssel rekonstruálja a kulcsokat és az értékeket.

Melyik modell vezette be először a Multi-Head Latent Attention funkciót?

Az MLA-t a DeepSeek vezette be a DeepSeek-V2 modelljében, és átvitte a DeepSeek-V3-ba.

Miért van szüksége az MLA-nak külön „leválasztott” útvonalra a forgópozíciós beágyazáshoz?

A forgó transzformáció nem abszorbeálható más súlymátrixokba, így az MLA megtart egy kis leválasztott kulcskomponenst a helyzetinformáció továbbítására.

Körülbelül mennyi KV-cache memória csökkenést jelentett a DeepSeek-V2 az MLA-ból a hagyományos többfejes figyelemhez képest?

A DeepSeek-V2 arról számolt be, hogy több mint 90%-kal csökkentette a KV-cache memóriát, ami hosszabb kontextusokat és nagyobb kötegeket tesz lehetővé.