Ukryta uwaga wielogłowicowa
Multi-Head Latent Attention (MLA) to mechanizm uwagi wprowadzony w DeepSeek-V2, który kompresuje wymagającą pamięci pamięć podręczną klucz-wartość do małego współdzielonego wektora utajonego.
Przegląd
It lets large language models run with far less GPU memory while keeping quality close to standard attention.
Głębokie nurkowanie
Kiedy transformator generuje tekst, przechowuje klucz i wektor wartości dla każdego przeszłego tokena w „pamięci podręcznej KV”. Ta pamięć podręczna rośnie wraz z długością kontekstu i dominuje w wykorzystaniu pamięci podczas wnioskowania. MLA zastępuje wiele pełnowymiarowych wektorów klucz/wartość jednym ukrytym wektorem niskiej rangi na token, a następnie projektuje te ukryte klucze i wartości na bieżąco w locie. Ponieważ buforowana jest tylko kompaktowa, utajona zawartość, DeepSeek-V2 zgłosił zmniejszenie pamięci podręcznej KV o ponad 90% w porównaniu ze standardową obsługą wielu głowic, umożliwiając dłuższe konteksty i większe rozmiary wsadów. Co najważniejsze, matryce projekcji w górę można złożyć w inne wagi, dzięki czemu MLA osiąga tę kompresję przy niewielkiej lub żadnej mierzalnej utracie jakości modelowania.
Wgląd techniczny
MLA wykonuje kompresję złącza niskiego rzędu: ukryty stan każdego tokena jest rzutowany na mały ukryty wektor, a oddzielne macierze projekcji w górę rekonstruują klucze i wartości dla poszczególnych głowic. Sprytną sztuczką jest „absorbowanie” wag projekcji w górę do projekcji zapytania i wyników, dzięki czemu model nigdy nie materializuje pełnych kluczy/wartości podczas wnioskowania. Osadzenie pozycji obrotowej jest obsługiwane przy użyciu oddzielonej ścieżki klucza, ponieważ obrót nie może zostać wchłonięty w ten sam sposób, zachowując informacje o położeniu.
Wpływ strategiczny
Szybkość i skala
Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.
Dostęp i zasięg
Rozszerza dostęp w różnych językach i stylach komunikacji.
Jaśniejsze decyzje
Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.
Przyszłość wielogłowej uwagi utajonej
MLA pomogło sprawić, że DeepSeek-V2 i V3 będą ekonomiczne w obsłudze na dużą skalę, a technika ta rozprzestrzenia się, gdy zespoły poszukują tańszego wnioskowania w długim kontekście. W przyszłych otwartych modelach można spodziewać się połączenia utajonej kompresji w stylu MLA z rzadkimi warstwami mieszanki ekspertów, skwantowanymi pamięciami podręcznymi i dekodowaniem spekulatywnym. Naukowcy badają również, jak bardzo ukryty wymiar może się skurczyć, zanim jakość spadnie, i czy ten sam pomysł o niskiej randze może przykuć uwagę podczas szkolenia, a nie tylko wnioskowanie.
Implementacja w świecie rzeczywistym
Udostępnianie modeli czatu DeepSeek-V2/V3 ze znacznie mniejszym zużyciem pamięci GPU na żądanie
Uruchamianie pytań obejmujących długi dokument, w przypadku których duża pamięć podręczna KV w przeciwnym razie wyczerpałaby pamięć VRAM
Zwiększanie rozmiaru partii wnioskowania na stałym GPU, ponieważ każda sekwencja przechowuje tylko mały ukryty wektor
Włączenie dłuższych okien kontekstowych na standardowym sprzęcie dla asystentów wspomaganych wyszukiwaniem
Zagrożenia i poręcze
Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.
Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.
Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.
Plan wdrożenia
Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.
Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.
Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.
Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Head Latent Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Uwaga dotycząca wielu zapytań
Często zadawane pytania
What is Multi-Head Latent Attention?
Multi-Head Latent Attention (MLA) to mechanizm uwagi wprowadzony w DeepSeek-V2, który kompresuje wymagającą pamięci pamięć podręczną klucz-wartość do małego współdzielonego wektora utajonego. Umożliwia działanie dużych modeli językowych przy znacznie mniejszej ilości pamięci GPU, przy jednoczesnym zachowaniu jakości zbliżonej do standardowej.
Jaki jest główny problem, który ma zmniejszyć wielogłowicowa uwaga utajona?
MLA celuje w pamięć podręczną KV, która rośnie wraz z długością kontekstu i dominuje w pamięci podczas generowania tekstu.
W jaki sposób MLA zmniejsza pamięć podręczną KV?
MLA buforuje jeden kompaktowy wektor ukryty na token i rekonstruuje z niego klucze i wartości poprzez projekcję w górę.
W którym modelu po raz pierwszy wprowadzono funkcję Multi-Head Latent Attention?
MLA został wprowadzony przez firmę DeepSeek w modelu DeepSeek-V2 i przeniesiony do DeepSeek-V3.
Dlaczego MLA potrzebuje oddzielnej „oddzielonej” ścieżki do osadzania w pozycji obrotowej?
Transformacji obrotowej nie można zaabsorbować w innych macierzach wag, dlatego MLA przechowuje mały, oddzielony kluczowy komponent do przenoszenia informacji o położeniu.
W przybliżeniu, o ile redukcji pamięci podręcznej KV wykazał DeepSeek-V2 z MLA w porównaniu ze standardową uwagą wielogłowicową?
DeepSeek-V2 zgłosił zmniejszenie pamięci podręcznej KV o ponad 90%, umożliwiając dłuższe konteksty i większe partie.