Dil AI KILAVUZU

Çok Kafalı Gizli Dikkat

Çok Kafalı Gizli Dikkat (MLA), DeepSeek-V2'de tanıtılan, belleğe aç anahtar/değer önbelleğini küçük bir paylaşılan gizli vektöre sıkıştıran bir dikkat mekanizmasıdır.

2 min readSon güncelleme

Genel Bakış

It lets large language models run with far less GPU memory while keeping quality close to standard attention.

Derin Dalış

Bir transformatör metin ürettiğinde, her geçmiş belirteç için bir anahtar ve değer vektörünü 'KV önbelleğinde' saklar. Bu önbellek bağlam uzunluğuyla birlikte büyür ve çıkarım sırasında bellek kullanımına hakim olur. MLA, birçok tam boyutlu anahtar/değer vektörünü, jeton başına tek bir düşük dereceli gizli vektörle değiştirir, ardından bu gizli yedeklemeyi anında kafa başına anahtarlara ve değerlere yansıtır. Yalnızca kompakt gizli bellek önbelleğe alındığından DeepSeek-V2, KV önbellek belleğini standart çok kafalı dikkat ile karşılaştırıldığında %90'ın üzerinde azaltarak daha uzun bağlamlara ve daha büyük toplu iş boyutlarına olanak sağladığını bildirdi. En önemlisi, yukarı projeksiyon matrisleri diğer ağırlıklara katlanabilir, böylece MLA bu sıkıştırmayı modelleme kalitesinde ölçülebilir çok az kayıpla veya hiç kayıp olmadan gerçekleştirir.

Teknik Bilgi

MLA, düşük dereceli bir ortak sıkıştırma gerçekleştirir: her tokenin gizli durumu, küçük bir gizli vektöre yansıtılır ve ayrı yukarı projeksiyon matrisleri, kafa başına anahtarları ve değerleri yeniden oluşturur. Akıllıca bir numara, yukarı projeksiyon ağırlıklarını sorgu ve çıktı projeksiyonlarına 'emmektir', böylece model çıkarım sırasında hiçbir zaman tam anahtarları/değerleri gerçekleştirmez. Döndürme aynı şekilde absorbe edilemediğinden, konum bilgisi korunduğundan, döner konum yerleştirmeleri ayrılmış bir anahtar yolu ile gerçekleştirilir.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

Çok Kafalı Gizli Dikkatin Geleceği

MLA, DeepSeek-V2 ve V3'ün geniş ölçekte hizmet verme açısından ekonomik olmasına yardımcı oldu ve ekipler daha ucuz uzun bağlam çıkarımı peşinde koştukça bu teknik yaygınlaşıyor. MLA tarzı gizli sıkıştırmanın, gelecekteki açık modellerde seyrek Uzman Karması katmanları, nicelenmiş önbellekler ve spekülatif kod çözme ile birleşmesini bekleyin. Araştırmacılar aynı zamanda kalite düşmeden önce gizli boyutun ne kadar küçülebileceğini ve aynı düşük dereceli fikrin sadece çıkarım yapmakla kalmayıp eğitim sırasında da dikkati sıkıştırıp sıkıştıramayacağını araştırıyor.

Gerçek Dünya Uygulaması

İstek başına önemli ölçüde daha küçük GPU bellek ayak izine sahip DeepSeek-V2/V3 sohbet modellerinin sunulması

Büyük bir KV önbelleğinin aksi takdirde VRAM'i tüketeceği yeri yanıtlayan uzun belge sorusunu çalıştırma

Her dizi yalnızca küçük bir gizli vektör depoladığından, sabit bir GPU'da çıkarım toplu boyutunun artırılması

Erişimle zenginleştirilmiş asistanlar için emtia donanımında daha uzun bağlam pencerelerinin etkinleştirilmesi

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Head Latent Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Çoklu Sorgu Dikkati

Sık sorulan sorular

What is Multi-Head Latent Attention?

Çok Kafalı Gizli Dikkat (MLA), DeepSeek-V2'de tanıtılan, belleğe aç anahtar/değer önbelleğini küçük bir paylaşılan gizli vektöre sıkıştıran bir dikkat mekanizmasıdır. Kaliteyi standartlara yakın tutarken büyük dil modellerinin çok daha az GPU belleğiyle çalışmasına olanak tanır.

Çok Kafalı Gizli Dikkatin azaltmak için tasarlandığı temel sorun nedir?

MLA, bağlam uzunluğuyla birlikte büyüyen ve metin oluşturma sırasında belleğe hakim olan KV önbelleğini hedefler.

MLA, KV önbelleğini nasıl küçültür?

MLA, jeton başına bir kompakt gizli vektörü önbelleğe alır ve yukarı projeksiyon yoluyla anahtarları ve değerleri yeniden oluşturur.

Çok Kafalı Gizli Dikkati ilk kez hangi model tanıttı?

MLA, DeepSeek tarafından DeepSeek-V2 modelinde tanıtıldı ve DeepSeek-V3'e taşındı.

MLA'nın neden döner konum yerleştirmeleri için ayrı bir 'ayrılmış' yola ihtiyacı var?

Döner dönüşüm diğer ağırlık matrisleri tarafından absorbe edilemez, bu nedenle MLA konumsal bilgiyi taşımak için küçük, ayrıştırılmış bir anahtar bileşeni tutar.

DeepSeek-V2, standart çok kafalı dikkat ile karşılaştırıldığında MLA'dan kabaca ne kadar KV önbellek belleği azalması bildirdi?

DeepSeek-V2, KV önbellek belleğini %90'dan fazla azaltarak daha uzun bağlamlara ve daha büyük toplu işlere olanak sağladığını bildirdi.