Çoklu Sorgu Dikkati
Çoklu Sorgu Dikkati (MQA), tüm dikkat kafaları arasında bir dizi anahtarı ve değeri paylaşan, transformatör dikkatine yönelik, bellekten tasarruf sağlayan bir değişikliktir.
Genel Bakış
It dramatically speeds up text generation by shrinking the memory the model must shuffle around.
Derin Dalış
Standart çok kafalı dikkat, her kafaya kendi sorgusunu, anahtarını ve değer projeksiyonlarını verir. Oluşturma sırasında, tüm geçmiş belirteçlerin anahtarları ve değerleri her adımda önbelleğe alınmalı ve yeniden yüklenmelidir; bu KV önbelleği ana darboğaz haline gelir, çünkü onu bellekten okumak matematikten daha yavaştır. Noam Shazeer tarafından 2019'da önerilen Çoklu Sorgu Dikkati, kişi başına ayrı sorgu projeksiyonları tutar ancak anahtarları ve değerleri tek bir paylaşılan kafaya daraltır. Bu, KV önbelleğini kafa sayısına eşit bir faktör kadar, bazen 8 ila 64 kat daha az küçültür. Sonuç olarak, çok daha hızlı otoregresif kod çözme ve daha hafif bir bellek alanı ile yalnızca mütevazı bir kalite düşüşü elde edilir. Orta yol olan Gruplandırılmış Sorgu Dikkati bu dengeyi dengeler.
Teknik Bilgi
MQA'da sorgu ağırlıkları hala H ayrı sorgu vektörü üretiyor ancak tek bir anahtar projeksiyonu ve tek değer projeksiyonu tüm başlıklar arasında paylaşılıyor. Her kafa, aynı anahtarlara ve değerlere karşı kendi sorgusunu kullanarak dikkati hesaplar. Önbelleğe alınan K ve V tensörleri artık kafa sayısına göre ölçeklenmediğinden, kod çözme sırasında bellek bant genişliği keskin bir şekilde düşer ve modern hızlandırıcılarda kapı oluşturma hızını hesaplama değil bant genişliği belirler.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Çoklu Sorgu Dikkatinin Geleceği
MQA, gereksiz anahtar/değer başlıklarını çok az zararla budayabileceğinizi ve bu içgörünün artık neredeyse tüm hızlı çıkarımlı LLM'yi şekillendirdiğini tespit etti. Bu alan büyük ölçüde Llama 2/3 ve diğerlerinde kullanılan, hızın çoğunu korurken kaliteyi iyileştirmek için bir yerine birkaç KV grubu kullanan Gruplandırılmış Sorgu Dikkatine (GQA) odaklanmıştır. Gelecekteki çalışmalar, daha uzun bağlamları ve daha ucuz hizmeti zorlamak için bu fikirleri KV-önbellek sıkıştırması, niceleme ve çoklu gizli dikkat ile harmanlıyor.
Gerçek Dünya Uygulaması
Ham hesaplamanın değil KV önbelleğinin verimi sınırladığı sohbet asistanlarında jeton bazlı jeton oluşturmayı hızlandırma.
Google'nin PaLM'si, verimli büyük ölçekli çıkarım sağlamak için Çoklu Sorgu Dikkatini kullandı.
İstek başına KV önbelleğini küçülterek tek bir GPU üzerinde çok sayıda eş zamanlı kullanıcıya hizmet verir.
Llama 2 70B ve Llama 3'teki Gruplandırılmış Sorgu Dikkati, MQA'nın hızını tam dikkat kalitesiyle dengeleyen doğrudan bir alt öğedir.
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Query Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Gruplandırılmış Sorgu Dikkati
Sık sorulan sorular
What is Multi-Query Attention?
Çoklu Sorgu Dikkati (MQA), tüm dikkat kafaları arasında bir dizi anahtarı ve değeri paylaşan, transformatör dikkatine yönelik, bellekten tasarruf sağlayan bir değişikliktir. Modelin karıştırması gereken belleği daraltarak metin üretimini önemli ölçüde hızlandırır.
Çoklu Sorgu Dikkati tüm dikkat kafalarında neyi paylaşıyor?
MQA, kişi başına ayrı sorgular tutar ancak tüm kafalar arasında bir anahtar projeksiyonu ve bir değer projeksiyonunu paylaşır.
Otoregresif oluşturma sırasında MQA'nın ele aldığı birincil darboğaz nedir?
Büyük KV önbelleğinin her adımda yeniden yüklenmesi bant genişliğine bağlıdır; MQA, kod çözmeyi hızlandırmak için bu önbelleği küçültür.
MQA, KV önbelleğini kabaca hangi faktörle küçültür?
Anahtarlar ve değerler H baştan bire düştüğünden, önbellek yaklaşık olarak kafa sayısı kadar küçülür.
MQA kullanmanın temel avantajı nedir?
Anahtarların ve değerlerin paylaşılması, temsil kapasitesini bir miktar azaltır ve büyük hız kazanımları karşılığında küçük bir kalite düşüşüne neden olur.
Hangi değişken standart çok kafalı dikkat ile MQA arasında yer alır?
Gruplandırılmış Sorgu Dikkati (GQA), kalite ve hızı dengeleyerek bir yerine birkaç KV grubu kullanır.