Dil AI KILAVUZU

FlashDikkat

FlashAttention, standart transformatörlerle tamamen aynı dikkati hesaplayan, ancak dev dikkat matrisini yavaş GPU belleğine asla yazmayan, bellek açısından verimli bir algoritmadır.

2 min readSon güncelleme

Genel Bakış

It made long-context training and inference dramatically faster and cheaper.

Derin Dalış

Standart dikkat, her jeton çifti için bir puan hesaplayarak N'ye N'lik bir matris üretir. 4.000 jetonlu bir dizi için bu 16 milyon puan anlamına gelir ve matrisin GPU'nun yüksek bant genişlikli belleğine (HBM) yazılması ve buradan geri okunması gerekir. Gerçek darboğaz matematik değil, hafıza trafiğidir. Tri Dao ve meslektaşları tarafından 2022'de tanıtılan FlashAttention, hesaplamayı, matrisin hiçbir zaman tam olarak hayata geçmeyeceği şekilde yeniden yapılandırıyor. Sırayı GPU'nun küçük, ultra hızlı çip üzerindeki SRAM'ına sığacak şekilde parçalar halinde işler ve softmax'ı ilerledikçe artımlı olarak hesaplar. Sonuç, matematiksel olarak standart dikkat ile aynıdır ancak çok daha az bellek kullanır ve birkaç kat daha hızlı çalışarak çok daha uzun bağlam pencerelerine olanak tanır.

Teknik Bilgi

İşin püf noktası, döşemeyle birleştirilmiş 'çevrimiçi softmax'tır. FlashAttention küçük sorgu, anahtar ve değer bloklarını SRAM'e yükler, kısmi dikkat çıktılarını hesaplar ve yeni bloklar geldikçe çalışan toplamları yeniden ölçeklendirir, böylece softmax normalizasyonu tüm puanları aynı anda görmeden doğru kalır. N'ye N matrisinin tamamını HBM'de hiçbir zaman saklamadığından, bellek karesel olarak değil doğrusal olarak ölçeklenir ve yavaş bellek okuma ve yazma işlemlerini en aza indirmek için çekirdek tek bir GPU işleminde birleştirilir.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

FlashAttention'ın Geleceği

FlashAttention varsayılan bir yapı taşı haline geldi. FlashAttention-2, GPU iş bölümlemesini geliştirdi ve FlashAttention-3, eşzamansız ve düşük hassasiyetli FP8 gibi daha yeni Hopper donanım özelliklerinden yararlanıyor. Çiplerle sürekli ortak tasarım, uzun belgeler için çıkarım sunucularına daha derin entegrasyon ve seyrek veya kayan pencere dikkati için ayarlanmış değişkenler bekleyebilirsiniz. Bağlam pencereleri milyonlarca jetona doğru ilerlerken, bunun gibi IO uyumlu çekirdekler, eğitim ve hizmet maliyetlerini yönetilebilir tutmak için temel olmaya devam ediyor.

Gerçek Dünya Uygulaması

Llama ve GPT tarzı sistemler gibi büyük dil modellerini daha hızlı ve daha düşük GPU maliyetiyle eğitme

Bellek tükenmeden kitapların veya kod tabanlarının tamamını alan uzun bağlamlı sohbet yardımcılarının sunulması

On binlerce jetonu aynı anda işleyen belge özetleme ardışık düzenlerini hızlandırma

Uzun görüntü yama dizilerinin dikkati pahalı hale getirdiği görüntü ve multimodal transformatörlere güç verilmesi

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FlashAttention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Döner Pozisyon Gömmeleri

Sık sorulan sorular

What is FlashAttention?

FlashAttention, standart transformatörlerle tamamen aynı dikkati hesaplayan, ancak dev dikkat matrisini yavaş GPU belleğine asla yazmayan, bellek açısından verimli bir algoritmadır. Uzun bağlamlı eğitim ve çıkarımı önemli ölçüde daha hızlı ve daha ucuz hale getirdi.

FlashAttention'ın standart dikkatteki ana darboğaz hedefleri nelerdir?

Standart dikkat belleğe bağlıdır: devasa N'ye N matrisinin yüksek bant genişliğine sahip belleğe gidip gelmesi zamana hakimdir, aritmetiğin kendisi değil.

FlashAttention'ın çıktısı standart dikkatle nasıl karşılaştırılır?

FlashAttention tam olarak aynı dikkat değerlerini hesaplar; tam matrisin gerçekleşmesini önlemek için hesaplamayı yeniden düzenler.

FlashAttention kutucuklardaki verileri işleyerek hangi GPU belleğinden yararlanır?

FlashAttention, küçük parçaları GPU'nun hızlı çip üzerindeki SRAM'ına yükleyerek ağır işleri hesaplama birimlerine yakın tutar.

FlashAttention'ın tüm puanları aynı anda görmeden softmax hesaplamasını hangi teknik sağlar?

Çevrimiçi bir softmax, çalışan maksimumları ve toplamları korur, yeni döşemeler geldikçe kısmi sonuçları yeniden ölçeklendirir, böylece son normalleştirme doğru olur.

FlashAttention-3 özellikle neyden yararlandı?

FlashAttention-3, daha fazla hızlanma için eşzamansız yürütme ve düşük hassasiyetli FP8 kullanılarak modern Hopper GPU'larla birlikte tasarlandı.