Çok Kafalı Gizli Dikkat
Çok Kafalı Gizli Dikkat (MLA), DeepSeek-V2'de tanıtılan, belleğe aç anahtar/değer önbelleğini küçük bir paylaşılan gizli vektöre sıkıştıran bir dikkat mekanizmasıdır.
Genel Bakış
It lets large language models run with far less GPU memory while keeping quality close to standard attention.
Derin Dalış
Bir transformatör metin ürettiğinde, her geçmiş belirteç için bir anahtar ve değer vektörünü 'KV önbelleğinde' saklar. Bu önbellek bağlam uzunluğuyla birlikte büyür ve çıkarım sırasında bellek kullanımına hakim olur. MLA, birçok tam boyutlu anahtar/değer vektörünü, jeton başına tek bir düşük dereceli gizli vektörle değiştirir, ardından bu gizli yedeklemeyi anında kafa başına anahtarlara ve değerlere yansıtır. Yalnızca kompakt gizli bellek önbelleğe alındığından DeepSeek-V2, KV önbellek belleğini standart çok kafalı dikkat ile karşılaştırıldığında %90'ın üzerinde azaltarak daha uzun bağlamlara ve daha büyük toplu iş boyutlarına olanak sağladığını bildirdi. En önemlisi, yukarı projeksiyon matrisleri diğer ağırlıklara katlanabilir, böylece MLA bu sıkıştırmayı modelleme kalitesinde ölçülebilir çok az kayıpla veya hiç kayıp olmadan gerçekleştirir.
Teknik Bilgi
MLA, düşük dereceli bir ortak sıkıştırma gerçekleştirir: her tokenin gizli durumu, küçük bir gizli vektöre yansıtılır ve ayrı yukarı projeksiyon matrisleri, kafa başına anahtarları ve değerleri yeniden oluşturur. Akıllıca bir numara, yukarı projeksiyon ağırlıklarını sorgu ve çıktı projeksiyonlarına 'emmektir', böylece model çıkarım sırasında hiçbir zaman tam anahtarları/değerleri gerçekleştirmez. Döndürme aynı şekilde absorbe edilemediğinden, konum bilgisi korunduğundan, döner konum yerleştirmeleri ayrılmış bir anahtar yolu ile gerçekleştirilir.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Çok Kafalı Gizli Dikkatin Geleceği
MLA, DeepSeek-V2 ve V3'ün geniş ölçekte hizmet verme açısından ekonomik olmasına yardımcı oldu ve ekipler daha ucuz uzun bağlam çıkarımı peşinde koştukça bu teknik yaygınlaşıyor. MLA tarzı gizli sıkıştırmanın, gelecekteki açık modellerde seyrek Uzman Karması katmanları, nicelenmiş önbellekler ve spekülatif kod çözme ile birleşmesini bekleyin. Araştırmacılar aynı zamanda kalite düşmeden önce gizli boyutun ne kadar küçülebileceğini ve aynı düşük dereceli fikrin sadece çıkarım yapmakla kalmayıp eğitim sırasında da dikkati sıkıştırıp sıkıştıramayacağını araştırıyor.
Gerçek Dünya Uygulaması
İstek başına önemli ölçüde daha küçük GPU bellek ayak izine sahip DeepSeek-V2/V3 sohbet modellerinin sunulması
Büyük bir KV önbelleğinin aksi takdirde VRAM'i tüketeceği yeri yanıtlayan uzun belge sorusunu çalıştırma
Her dizi yalnızca küçük bir gizli vektör depoladığından, sabit bir GPU'da çıkarım toplu boyutunun artırılması
Erişimle zenginleştirilmiş asistanlar için emtia donanımında daha uzun bağlam pencerelerinin etkinleştirilmesi
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Head Latent Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Çoklu Sorgu Dikkati
Sık sorulan sorular
What is Multi-Head Latent Attention?
Çok Kafalı Gizli Dikkat (MLA), DeepSeek-V2'de tanıtılan, belleğe aç anahtar/değer önbelleğini küçük bir paylaşılan gizli vektöre sıkıştıran bir dikkat mekanizmasıdır. Kaliteyi standartlara yakın tutarken büyük dil modellerinin çok daha az GPU belleğiyle çalışmasına olanak tanır.
Çok Kafalı Gizli Dikkatin azaltmak için tasarlandığı temel sorun nedir?
MLA, bağlam uzunluğuyla birlikte büyüyen ve metin oluşturma sırasında belleğe hakim olan KV önbelleğini hedefler.
MLA, KV önbelleğini nasıl küçültür?
MLA, jeton başına bir kompakt gizli vektörü önbelleğe alır ve yukarı projeksiyon yoluyla anahtarları ve değerleri yeniden oluşturur.
Çok Kafalı Gizli Dikkati ilk kez hangi model tanıttı?
MLA, DeepSeek tarafından DeepSeek-V2 modelinde tanıtıldı ve DeepSeek-V3'e taşındı.
MLA'nın neden döner konum yerleştirmeleri için ayrı bir 'ayrılmış' yola ihtiyacı var?
Döner dönüşüm diğer ağırlık matrisleri tarafından absorbe edilemez, bu nedenle MLA konumsal bilgiyi taşımak için küçük, ayrıştırılmış bir anahtar bileşeni tutar.
DeepSeek-V2, standart çok kafalı dikkat ile karşılaştırıldığında MLA'dan kabaca ne kadar KV önbellek belleği azalması bildirdi?
DeepSeek-V2, KV önbellek belleğini %90'dan fazla azaltarak daha uzun bağlamlara ve daha büyük toplu işlere olanak sağladığını bildirdi.