FlashDikkat
FlashAttention, standart transformatörlerle tamamen aynı dikkati hesaplayan, ancak dev dikkat matrisini yavaş GPU belleğine asla yazmayan, bellek açısından verimli bir algoritmadır.
Genel Bakış
It made long-context training and inference dramatically faster and cheaper.
Derin Dalış
Standart dikkat, her jeton çifti için bir puan hesaplayarak N'ye N'lik bir matris üretir. 4.000 jetonlu bir dizi için bu 16 milyon puan anlamına gelir ve matrisin GPU'nun yüksek bant genişlikli belleğine (HBM) yazılması ve buradan geri okunması gerekir. Gerçek darboğaz matematik değil, hafıza trafiğidir. Tri Dao ve meslektaşları tarafından 2022'de tanıtılan FlashAttention, hesaplamayı, matrisin hiçbir zaman tam olarak hayata geçmeyeceği şekilde yeniden yapılandırıyor. Sırayı GPU'nun küçük, ultra hızlı çip üzerindeki SRAM'ına sığacak şekilde parçalar halinde işler ve softmax'ı ilerledikçe artımlı olarak hesaplar. Sonuç, matematiksel olarak standart dikkat ile aynıdır ancak çok daha az bellek kullanır ve birkaç kat daha hızlı çalışarak çok daha uzun bağlam pencerelerine olanak tanır.
Teknik Bilgi
İşin püf noktası, döşemeyle birleştirilmiş 'çevrimiçi softmax'tır. FlashAttention küçük sorgu, anahtar ve değer bloklarını SRAM'e yükler, kısmi dikkat çıktılarını hesaplar ve yeni bloklar geldikçe çalışan toplamları yeniden ölçeklendirir, böylece softmax normalizasyonu tüm puanları aynı anda görmeden doğru kalır. N'ye N matrisinin tamamını HBM'de hiçbir zaman saklamadığından, bellek karesel olarak değil doğrusal olarak ölçeklenir ve yavaş bellek okuma ve yazma işlemlerini en aza indirmek için çekirdek tek bir GPU işleminde birleştirilir.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
FlashAttention'ın Geleceği
FlashAttention varsayılan bir yapı taşı haline geldi. FlashAttention-2, GPU iş bölümlemesini geliştirdi ve FlashAttention-3, eşzamansız ve düşük hassasiyetli FP8 gibi daha yeni Hopper donanım özelliklerinden yararlanıyor. Çiplerle sürekli ortak tasarım, uzun belgeler için çıkarım sunucularına daha derin entegrasyon ve seyrek veya kayan pencere dikkati için ayarlanmış değişkenler bekleyebilirsiniz. Bağlam pencereleri milyonlarca jetona doğru ilerlerken, bunun gibi IO uyumlu çekirdekler, eğitim ve hizmet maliyetlerini yönetilebilir tutmak için temel olmaya devam ediyor.
Gerçek Dünya Uygulaması
Llama ve GPT tarzı sistemler gibi büyük dil modellerini daha hızlı ve daha düşük GPU maliyetiyle eğitme
Bellek tükenmeden kitapların veya kod tabanlarının tamamını alan uzun bağlamlı sohbet yardımcılarının sunulması
On binlerce jetonu aynı anda işleyen belge özetleme ardışık düzenlerini hızlandırma
Uzun görüntü yama dizilerinin dikkati pahalı hale getirdiği görüntü ve multimodal transformatörlere güç verilmesi
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the FlashAttention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Döner Pozisyon Gömmeleri
Sık sorulan sorular
What is FlashAttention?
FlashAttention, standart transformatörlerle tamamen aynı dikkati hesaplayan, ancak dev dikkat matrisini yavaş GPU belleğine asla yazmayan, bellek açısından verimli bir algoritmadır. Uzun bağlamlı eğitim ve çıkarımı önemli ölçüde daha hızlı ve daha ucuz hale getirdi.
FlashAttention'ın standart dikkatteki ana darboğaz hedefleri nelerdir?
Standart dikkat belleğe bağlıdır: devasa N'ye N matrisinin yüksek bant genişliğine sahip belleğe gidip gelmesi zamana hakimdir, aritmetiğin kendisi değil.
FlashAttention'ın çıktısı standart dikkatle nasıl karşılaştırılır?
FlashAttention tam olarak aynı dikkat değerlerini hesaplar; tam matrisin gerçekleşmesini önlemek için hesaplamayı yeniden düzenler.
FlashAttention kutucuklardaki verileri işleyerek hangi GPU belleğinden yararlanır?
FlashAttention, küçük parçaları GPU'nun hızlı çip üzerindeki SRAM'ına yükleyerek ağır işleri hesaplama birimlerine yakın tutar.
FlashAttention'ın tüm puanları aynı anda görmeden softmax hesaplamasını hangi teknik sağlar?
Çevrimiçi bir softmax, çalışan maksimumları ve toplamları korur, yeni döşemeler geldikçe kısmi sonuçları yeniden ölçeklendirir, böylece son normalleştirme doğru olur.
FlashAttention-3 özellikle neyden yararlandı?
FlashAttention-3, daha fazla hızlanma için eşzamansız yürütme ve düşük hassasiyetli FP8 kullanılarak modern Hopper GPU'larla birlikte tasarlandı.