Teknik KILAVUZ

Dizi Paralelliği ve Halka Dikkat

Sıra paralelliği, tek bir uzun giriş dizisini belirteç (zaman) boyutu boyunca birden fazla GPU'ya böler ve Ring Attention, bu GPU'ların anahtar/değer bloklarını bir halka etrafından geçirerek tam dikkat hesaplamasına olanak tanır.

2 min readSon güncelleme

Genel Bakış

Together they make million-token context windows feasible without any single GPU holding the whole sequence.

Derin Dalış

Standart dikkat, her anahtarı/değeri görmek için her sorguya ihtiyaç duyar, dolayısıyla etkinleştirme belleği dizi uzunluğuyla birlikte büyür ve tam K/V'nin mevcut olması gerekir. Dizi paralelliği, diziyi parçalara ayırarak her GPU'nun bitişik bir token yığınına (ve bunların sorgularına, anahtarlarına, değerlerine) sahip olmasını sağlar. Ring Attention daha sonra GPU'ları mantıksal bir halka halinde düzenler: K/V blokları halka etrafında atlamalı olarak aktarılırken her cihaz yerel sorgularını sabit tutar. Her blok geldiğinde, GPU kısmi bir dikkati hesaplar ve çevrimiçi-softmax (FlashAttention ile aynı çalışan maksimum/toplam hilesi) kullanarak sonuçları toplar. Tam bir döngüden sonra, hiçbir GPU K/V'nin tamamını depolamadan, her sorgu her anahtarla tam olarak ilgilenir. En önemlisi, K/V iletişimi hesaplamayla örtüşüyor, bu nedenle duvar saati maliyeti çok az artıyor.

Teknik Bilgi

Ring Attention çevrimiçi softmax'a dayanır: Dikkat, çalışan bir maksimum ve çalışan bir normalleştiriciyi korurken blok blok hesaplanabilir, daha sonra daha büyük bir değer göründüğünde daha önceki kısmi toplamlar yeniden ölçeklenebilir. Bu, sonucun matematiksel olarak tam dikkatle aynı olmasını sağlar. Halka yalnızca K/V tensörlerini geçer (boyut, blokla ölçeklenir, tam diziyle değil) ve her atlama noktasının iletişimi önceki bloğun matmul'uyla örtüştüğü için, bellek değil bant genişliği sınırlayıcı faktör haline gelir.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

Dizi Paralelliğinin ve Halka Dikkatinin Geleceği

Dizi paralelliği, uzun bağlam eğitimi ve çıkarımı için standart hale geliyor ve genellikle '4D' veya '5D' paralel düzenlerde tensör ve ardışık düzen paralelliğiyle birleşiyor. Çizgili veya zikzak dikkat gibi değişkenler, nedensel maskelemenin neden olduğu çalışmayı yeniden dengeler. NVLink üzerinde topolojiye duyarlı halkalar ve KV-önbellek boşaltma ile daha sıkı entegrasyon, pratik bağlam uzunluklarını alma, kod tabanları ve uzun belgeler için on milyonlarca jetona doğru itmeyi bekleyin.

Gerçek Dünya Uygulaması

Ring Attention ile her diziyi 8 GPU'ya bölerek 1 milyon jetonlu bağlam LLM'sini eğitme

Megatron-LM'nin sıra paralelliği, LayerNorm ve bırakma bölgelerindeki aktivasyon belleğini azaltır

Bir kitabın tamamını veya büyük kod deposunu kesmeden tek bir ileri geçişte işleme

Çoklu GPU düğümünde ultra uzun bağlam çıkarımını sığdırmak için Ring Attention'ı tensör paralelliğiyle birleştirmek

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sequence Parallelism and Ring Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Büyük Modeller için Tensör Paralelliği

Sık sorulan sorular

What is Sequence Parallelism and Ring Attention?

Sıra paralelliği, tek bir uzun giriş dizisini belirteç (zaman) boyutu boyunca birden fazla GPU'ya böler ve Ring Attention, bu GPU'ların anahtar/değer bloklarını bir halka etrafından geçirerek tam dikkat hesaplamasına olanak tanır. Birlikte, tüm diziyi tutan tek bir GPU olmadan milyonlarca jetonlu bağlam pencerelerini mümkün kılarlar.

Dizi paralelliği verileri hangi boyut boyunca böler?

Dizi paralelliği, belirteç/zaman ekseni boyunca GPU'lar arasında tek bir diziyi parçalara ayırır, böylece her cihaz bitişik bir belirteç yığınına sahip olur.

Ring Attention bir halka şeklinde düzenlenmiş GPU'lar arasında ne aktarır?

Her GPU, yerel sorgularını sabit tutar ve anahtar/değer bloklarını halkanın etrafında atlamalı olarak geçirir, böylece her sorgu sonunda her anahtarı görür.

Hangi teknik dikkatin blok blok hesaplanmasına ve yine de tüm dikkatin tam olarak eşleştirilmesine olanak sağlar?

Çevrimiçi softmax, çalışan bir maksimumu ve toplamı izler, kısmi sonuçları gerektiği gibi yeniden ölçeklendirir, blok bazında hesaplamayı sayısal olarak tam dikkatle aynı hale getirir.

Ring Attention neden K/V'nin tamamını depolamak için tek bir GPU'ya ihtiyaç duymuyor?

K/V blokları artımlı olarak ulaştığından ve her GPU kısmi ilgi topladığından, hiçbir cihazın bellekte ayarlanan anahtar/değerin tamamına aynı anda ihtiyacı olmaz.

Ring Attention iletişimin çalışma zamanına hakim olmasını nasıl engelliyor?

Her atlama noktasının K/V iletişimi, geçerli bloğun matris çarpımlarıyla örtüşür, dolayısıyla aktarım süresi büyük ölçüde hesaplamanın arkasında gizlenir.