Dil AI KILAVUZU

Çoklu Sorgu Dikkati

Çoklu Sorgu Dikkati (MQA), tüm dikkat kafaları arasında bir dizi anahtarı ve değeri paylaşan, transformatör dikkatine yönelik, bellekten tasarruf sağlayan bir değişikliktir.

2 min readSon güncelleme

Genel Bakış

It dramatically speeds up text generation by shrinking the memory the model must shuffle around.

Derin Dalış

Standart çok kafalı dikkat, her kafaya kendi sorgusunu, anahtarını ve değer projeksiyonlarını verir. Oluşturma sırasında, tüm geçmiş belirteçlerin anahtarları ve değerleri her adımda önbelleğe alınmalı ve yeniden yüklenmelidir; bu KV önbelleği ana darboğaz haline gelir, çünkü onu bellekten okumak matematikten daha yavaştır. Noam Shazeer tarafından 2019'da önerilen Çoklu Sorgu Dikkati, kişi başına ayrı sorgu projeksiyonları tutar ancak anahtarları ve değerleri tek bir paylaşılan kafaya daraltır. Bu, KV önbelleğini kafa sayısına eşit bir faktör kadar, bazen 8 ila 64 kat daha az küçültür. Sonuç olarak, çok daha hızlı otoregresif kod çözme ve daha hafif bir bellek alanı ile yalnızca mütevazı bir kalite düşüşü elde edilir. Orta yol olan Gruplandırılmış Sorgu Dikkati bu dengeyi dengeler.

Teknik Bilgi

MQA'da sorgu ağırlıkları hala H ayrı sorgu vektörü üretiyor ancak tek bir anahtar projeksiyonu ve tek değer projeksiyonu tüm başlıklar arasında paylaşılıyor. Her kafa, aynı anahtarlara ve değerlere karşı kendi sorgusunu kullanarak dikkati hesaplar. Önbelleğe alınan K ve V tensörleri artık kafa sayısına göre ölçeklenmediğinden, kod çözme sırasında bellek bant genişliği keskin bir şekilde düşer ve modern hızlandırıcılarda kapı oluşturma hızını hesaplama değil bant genişliği belirler.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

Çoklu Sorgu Dikkatinin Geleceği

MQA, gereksiz anahtar/değer başlıklarını çok az zararla budayabileceğinizi ve bu içgörünün artık neredeyse tüm hızlı çıkarımlı LLM'yi şekillendirdiğini tespit etti. Bu alan büyük ölçüde Llama 2/3 ve diğerlerinde kullanılan, hızın çoğunu korurken kaliteyi iyileştirmek için bir yerine birkaç KV grubu kullanan Gruplandırılmış Sorgu Dikkatine (GQA) odaklanmıştır. Gelecekteki çalışmalar, daha uzun bağlamları ve daha ucuz hizmeti zorlamak için bu fikirleri KV-önbellek sıkıştırması, niceleme ve çoklu gizli dikkat ile harmanlıyor.

Gerçek Dünya Uygulaması

Ham hesaplamanın değil KV önbelleğinin verimi sınırladığı sohbet asistanlarında jeton bazlı jeton oluşturmayı hızlandırma.

Google'nin PaLM'si, verimli büyük ölçekli çıkarım sağlamak için Çoklu Sorgu Dikkatini kullandı.

İstek başına KV önbelleğini küçülterek tek bir GPU üzerinde çok sayıda eş zamanlı kullanıcıya hizmet verir.

Llama 2 70B ve Llama 3'teki Gruplandırılmış Sorgu Dikkati, MQA'nın hızını tam dikkat kalitesiyle dengeleyen doğrudan bir alt öğedir.

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Gruplandırılmış Sorgu Dikkati

Sık sorulan sorular

What is Multi-Query Attention?

Çoklu Sorgu Dikkati (MQA), tüm dikkat kafaları arasında bir dizi anahtarı ve değeri paylaşan, transformatör dikkatine yönelik, bellekten tasarruf sağlayan bir değişikliktir. Modelin karıştırması gereken belleği daraltarak metin üretimini önemli ölçüde hızlandırır.

Çoklu Sorgu Dikkati tüm dikkat kafalarında neyi paylaşıyor?

MQA, kişi başına ayrı sorgular tutar ancak tüm kafalar arasında bir anahtar projeksiyonu ve bir değer projeksiyonunu paylaşır.

Otoregresif oluşturma sırasında MQA'nın ele aldığı birincil darboğaz nedir?

Büyük KV önbelleğinin her adımda yeniden yüklenmesi bant genişliğine bağlıdır; MQA, kod çözmeyi hızlandırmak için bu önbelleği küçültür.

MQA, KV önbelleğini kabaca hangi faktörle küçültür?

Anahtarlar ve değerler H baştan bire düştüğünden, önbellek yaklaşık olarak kafa sayısı kadar küçülür.

MQA kullanmanın temel avantajı nedir?

Anahtarların ve değerlerin paylaşılması, temsil kapasitesini bir miktar azaltır ve büyük hız kazanımları karşılığında küçük bir kalite düşüşüne neden olur.

Hangi değişken standart çok kafalı dikkat ile MQA arasında yer alır?

Gruplandırılmış Sorgu Dikkati (GQA), kalite ve hızı dengeleyerek bir yerine birkaç KV grubu kullanır.