Teknik KILAVUZ

Doğrusal Dikkat ve Performans Çekirdekleri

Doğrusal dikkat, Transformers'taki ikinci dereceden softmax dikkatini, dizi uzunluğuyla doğrusal olarak ölçeklenen bir matematik numarasıyla değiştirir.

2 min readSon güncelleme

Genel Bakış

Performer is a landmark method that approximates softmax using random feature kernels, making very long sequences computationally affordable.

Derin Dalış

Standard Transformer dikkati her jeton çifti arasında bir puan hesaplar, bu da dizi uzunluğunun karesiyle (O(n^2)) büyüyen zaman ve belleğe mal olur. Doğrusal dikkat hesaplamayı yeniden yazar, böylece maliyet yalnızca doğrusal olarak artar (O(n)). Ana fikir: softmax dikkati softmax(QK^T)V'dir, ancak softmax'ı çekirdek özellik haritası phi ile değiştirirseniz phi(Q)(phi(K)^T V) elde edersiniz. Matris çarpımı ilişkisel olduğundan, önce phi(K)^T V'yi (küçük bir d'ye d matrisi) hesaplarsınız ve devasa n'ye n puan matrisinden tamamen kaçınırsınız. 2020'de Google'den Performer, FAVOR+ (Pozitif Ortogonal Rastgele özelliklerle Hızlı Dikkat) kullanarak bunu gerçek softmax'a sadık bir yaklaşım haline getiriyor ve çekirdek tahminlerini tarafsız ve istikrarlı tutan rastgele projeksiyonlar çiziyor.

Teknik Bilgi

Performer's FAVOR+, pozitif rastgele özellikler kullanarak softmax çekirdek exp(q.k)'ye yaklaşır: sorguları ve anahtarları üstel olarak sarılmış rastgele Gauss projeksiyonları aracılığıyla eşler, negatif olmayan dikkat ağırlıklarını garanti eder ve daha önceki tahmincilerin sayısal istikrarsızlıklarından kaçınır. Ortogonal rastgele özelliklerin kullanılması varyansı azaltır. En önemlisi, n'ye n dikkat matrisi hiçbir zaman hayata geçirilmez, bu nedenle bellek ikinci dereceden doğrusaldan doğrusala düşer ve onbinlerce jetonun dizilimini mümkün kılar.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

Doğrusal Dikkat ve Performans Çekirdeklerinin Geleceği

Saf doğrusal dikkat, kalite açısından çoğu zaman softmax'ı takip eder, bu nedenle alan hibritlere yaklaşır: durum-uzay modelleri (Mamba), geçitli doğrusal dikkat ve birkaç tam dikkat katmanını birçok doğrusal katmanla karıştıran mimariler. Bağlam pencereleri milyonlarca jetona doğru ilerlerken, doğrusal ve ikinci dereceden mekanizmalar maliyet açısından giderek daha çekici hale geliyor ve verimli akış çıkarımı ve cihaz üzeri modeller için yinelenen tarzdaki doğrusal dikkat yeniden gözden geçiriliyor.

Gerçek Dünya Uygulaması

Tam karesel dikkatin GPU belleğini tüketeceği uzun genomik veya protein dizilerinin işlenmesi

Performer tarzı bir omurga kullanarak çok uzun raporlar üzerinde parçalama olmadan belge düzeyinde özetleme

Sekansların on binlerce adıma yayıldığı verimli uzun biçimli ses veya zaman serisi modelleme

Bazı softmax katmanlarını doğrusal dikkat değişkenleriyle değiştirerek uzun bağlamlı sohbet modellerinde çıkarım maliyetini azaltmak

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Linear Attention and Performer Kernels quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

RWKV Doğrusal Dikkat

Sık sorulan sorular

What is Linear Attention and Performer Kernels?

Doğrusal dikkat, Transformers'taki ikinci dereceden softmax dikkatini, dizi uzunluğuyla doğrusal olarak ölçeklenen bir matematik numarasıyla değiştirir. Performer, rastgele öznitelik çekirdekleri kullanarak softmax'a yaklaşan ve çok uzun dizileri hesaplama açısından uygun maliyetli hale getiren dönüm noktası niteliğinde bir yöntemdir.

Standart softmax dikkati dizi uzunluğuna göre neden zayıf ölçekleniyor?

Softmax dikkati her token çiftini karşılaştırarak n'ye n puan matrisi üretir, böylece maliyet O(n^2) kadar artar.

Hangi matematiksel özellik doğrusal dikkatin n'ye n matristen kaçınmasını sağlar?

Matris çarpımı ilişkisel olduğundan, önce phi(Q)phi(K)^T yerine küçük bir d-by-d matrisi olan phi(K)^T V'yi hesaplayabilirsiniz.

Performer'ın FAVOR+ mekanizması yaklaşık olarak ne kadardır?

FAVOR+, tam dikkat matrisini oluşturmadan üstel softmax çekirdeğine yaklaşmak için pozitif ortogonal rastgele özellikler kullanır.

Performer neden daha önceki trigonometrik özellikler yerine pozitif rastgele özellikler kullanıyor?

Pozitif özellikler, çekirdek tahminlerinin negatif olmamasını sağlar ve daha önceki sin/cos özellik haritalarını rahatsız eden kararsızlıklardan ve negatif değerlerden kaçınır.

n dizi uzunluğundaki Performansçı tarzı doğrusal dikkatin yaklaşık karmaşıklığı nedir?

Hesaplamayı yeniden düzenleyerek ve hiçbir zaman n'ye n matrisi oluşturmayarak maliyet, dizi uzunluğuyla doğrusal olarak ölçeklenir.