Sürgülü Pencere Dikkat
Kayan pencere dikkati, her bir jetonun, tüm dizi yerine yalnızca yakındaki jetonların sabit boyutlu bir mahallesine katılmasını kısıtlar.
Genel Bakış
This cuts the quadratic cost of standard attention down to linear, making long-context models far cheaper to run.
Derin Dalış
Standart öz-dikkat her jetonu diğer jetonlarla karşılaştırır, dolayısıyla N uzunluğundaki bir dizi kabaca N kareli karşılaştırmalar gerektirir. Kayan pencere dikkati, her jetona W boyutunda bir pencere vererek (örneğin 4.096 jeton) ve yalnızca bu pencerenin içindeki komşularla ilgilenerek bunu düzeltir. Maliyet, N-kare yerine N çarpı W olarak artar. Çok sayıda pencereli katmanın istiflenmesi, etkili alıcı alanı genişletir: L katmandan sonra, bilgi, bir CNN'nin büyüyen alıcı alanı gibi, kabaca L çarpı W belirteçleri boyunca yayılabilir. Mistral 7B, bunu 32 katmanda 4.096 jetonluk bir pencereyle popüler hale getirerek teorik olarak 131K jeton aralığına ulaştı. Modeller, uzun menzilli bağlantıları korumak için genellikle pencereli katmanları ara sıra tam dikkat katmanlarıyla karıştırır.
Teknik Bilgi
Dikkat maskesinde, i konumundaki bir sorgunun yalnızca i eksi W artı 1 ila i arasındaki konumlardaki anahtarları görmesine izin verilir (nedensel durum). Bu seyrek maske, KV önbelleğinin katman başına yalnızca son W belirteçlerine ihtiyaç duyduğu ve üretim sırasında belleğin kesildiği anlamına gelir. Pencere her yeni jetonla birlikte değiştiğinden, sonsuza kadar büyümek yerine en eski girişlerin üzerine yazan bir dönen arabellek önbelleğiyle doğal olarak eşleşir.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Sürgülü Pencerenin Geleceği Dikkat
Hibrit tasarımlar artık birçok kayan pencere katmanı arasına birkaç küresel veya tam dikkat katmanını serpiştirerek verimliliği gerçek uzun vadeli akıl yürütmeyle dengeliyor. Gemma 2 ve diğerleri yerel ve küresel blokları değiştiriyor. Pencere dikkatinin durum alanı modelleri, dikkat havuzları ve KV önbellek sıkıştırmasıyla birleştirilmesini bekleyin; böylece sınır modelleri, kaçak bellek olmadan milyon jetonlu bağlamları yönetir. Egzotik bir optimizasyon yerine varsayılan bir yapı taşı haline geliyor.
Gerçek Dünya Uygulaması
Mistral 7B, tüketici GPU'larında uzun istemleri ucuz bir şekilde yönetmek için katmanları boyunca 4.096 jetonluk kayan bir pencere kullanıyor.
Longformer, çok sayfalı belgeleri sınıflandırmak ve özetlemek için pencereli dikkat artı birkaç genel belirteç uygular.
Gemma 2, hızı ve uzun menzilli hatırlamayı dengelemek için yerel kayan pencere katmanlarını küresel dikkat katmanlarıyla değiştiriyor.
Sohbet asistanlarındaki kayan arabellek KV önbellekleri, yalnızca en son belirteç penceresini tutar ve uzun konuşmalar sırasında belleği sınırlandırır.
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Sliding Window Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Gruplandırılmış Sorgu Dikkati
Sık sorulan sorular
What is Sliding Window Attention?
Kayan pencere dikkati, her bir jetonun, tüm dizi yerine yalnızca yakındaki jetonların sabit boyutlu bir mahallesine katılmasını kısıtlar. Bu, standart dikkatin ikinci dereceden maliyetini doğrusala indirerek uzun bağlamlı modellerin çalıştırılmasını çok daha ucuz hale getirir.
Pencere dikkatini standart kişisel dikkat üzerine kaydırmanın temel hesaplama faydası nedir?
Her jetonu W komşulardan oluşan sabit bir pencereyle sınırlayarak maliyet, N-kare yerine N çarpı W (N'de doğrusal) olarak artar.
Mistral 7B'nin tasarımında, bilgi nasıl hala 4.096 jetonluk tek bir pencerenin çok ötesine geçebilir?
Bir CNN gibi, her katman bilgiyi bir pencere daha ileri iter, böylece L katmanları kabaca L çarpı W jetondan oluşan etkili bir aralık sağlar.
Kayan pencere dikkati neden metin oluşturma sırasında belleği azaltır?
Bir belirteç yalnızca son penceresine katıldığından, eski anahtar/değer girişleri genellikle dönen arabellek önbelleği aracılığıyla atılabilir.
Gemma 2 gibi modeller, uzun vadeli akıl yürütmeyi sürdürmek için sürgülü pencerelerin yanı sıra hangi tasarım seçeneğini kullanıyor?
Ara sıra küresel/tam dikkat katmanlarını yerel katmanlar arasında karıştırmak, saf pencerelemenin zayıflattığı gerçek uzun mesafeli bağlantıları korur.
W boyutunda bir nedensel kayan pencere için, i konumundaki bir sorgu hangi anahtarlara katılabilir?
Nedensel durumda sorgu kendisini ve W eksi 1 jetonlarını hemen önünde görür, asla gelecekteki jetonları görmez.