Teknik KILAVUZ

Model ve Boru Hattı Paralelliği

Bir model tek bir GPU'ya sığmayacak kadar büyük olduğunda model ve işlem hattı paralelliği, modeli cihazlar arasında böler.

2 min readSon güncelleme

Genel Bakış

This is what makes training giant language models with hundreds of billions of parameters physically possible.

Derin Dalış

Model paralelliği, tek bir modeli birden fazla GPU'ya böler, böylece hiçbir cihazın tüm ağırlığı taşımasına gerek kalmaz. İki ana lezzet var. Tensör (katman içi) paralelliği, her biri çıktının bir kısmını hesaplayan GPU'lar arasında büyük bir matris çarpımının kesilmesi gibi, matematiği bir katman içinde böler. İşlem hattı (katmanlar arası) paralelliği, farklı GPU'lara farklı ardışık katmanlar atar, böylece katman bloğu 1 GPU 0'da, blok 2 GPU 1'de yaşar ve aktivasyonlar bir montaj hattı gibi ileriye aktarılarak böyle devam eder. Saf ardışık düzen oluşturmanın zorluğu 'balon'dur: GPU 0 ilk partide çalışırken, aşağı yöndeki GPU'lar boşta kalır. İşlem hattı, her partiyi mikro partilere bölerek tüm aşamaların meşgul kalmasını sağlar ve kullanımı önemli ölçüde artırır.

Teknik Bilgi

Tensör paralelliği (NVIDIA Megatron-LM'de olduğu gibi), ağırlık matrislerini sütun veya satır bazında böler ve kısmi sonuçları yeniden birleştirmek için all-reduce'u kullanarak iletişimi hızlı bir NVLink düğümü içinde tutar. İşlem hattı paralelliği (GPipe, PipeDream), partiyi kademeli bir programda aşamalar boyunca akan mikro partilere bölerek boş 'balon' süresini kısaltır. İkisi genellikle bir düğüm içindeki tensör paralelliği ve düğümler arasındaki boru hattı paralelliği ile birlikte katmanlanır.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

Model ve Boru Hattı Paralelliğinin Geleceği

Çerçeveler, bilgi işlem ve iletişimi dengelemek için profil oluşturma ve aramayı kullanarak, bir modelin cihazlar arasında nasıl bölümleneceğine karar verme gibi zor bir sorunu giderek daha fazla otomatik hale getiriyor. Tensör, boru hattı ve veri paralelliğinin (3D paralellik) daha sıkı entegrasyonunu, boru hattı kabarcıklarını neredeyse ortadan kaldıracak daha akıllı mikro toplu planlamayı ve daha hızlı ara bağlantılara sahip donanımın, böylece tek bir katmanın çipler arasında bölünmesinin giderek daha büyük modeller için daha ucuz ve daha rutin hale gelmesini bekleyin.

Gerçek Dünya Uygulaması

Tensör paralelliği yoluyla her transformatör katmanının dikkatini ve ileri besleme matrislerini GPU'lar arasında bölen NVIDIA Megatron-LM ile GPT tarzı modelleri eğitme.

Mikro gruplama onları meşgul ederken dev bir vizyonun veya dil modelinin farklı katmanlarını ayrı hızlandırıcılara yerleştirmek için GPipe'ı kullanmak.

DeepSpeed'in yüz milyarlarca parametreli bir modeli birçok düğümdeki aşamalara bölen boru hattı motoru.

Tek bir 8 GPU'lu sunucu içindeki tensör paralelliğini, tek bir makine için çok büyük bir modeli eğitmek üzere birden fazla sunucuya yayılan boru hattı paralelliğiyle birleştirmek.

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model and Pipeline Parallelism quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Büyük Modeller için Tensör Paralelliği

Sık sorulan sorular

What is Model and Pipeline Parallelism?

Bir model tek bir GPU'ya sığmayacak kadar büyük olduğunda model ve işlem hattı paralelliği, modeli cihazlar arasında böler. Yüz milyarlarca parametreye sahip dev dil modellerinin eğitilmesini fiziksel olarak mümkün kılan şey budur.

Model ve boru hattı paralelliği hangi temel sorunu çözüyor?

Model ve boru hattı paralelliği, modelin kendisini cihazlar arasında bölerek herhangi bir GPU'nun taşıyamayacağı kadar büyük ağların eğitilmesine olanak tanır.

Tensör (katman içi) paralellik ayrımı nasıl çalışır?

Tensör paralelliği hesaplamayı tek bir katmana böler; örneğin büyük bir ağırlık matrisini her GPU'nun çıktının bir kısmını hesaplaması için böler.

Saf boru hattı paralelliğindeki 'balon' nedir?

Boru hattı adımının başlarında, alt aşamaların henüz girişi yoktur ve boşta bekleyerek GPU zamanını boşa harcar; bu boş boşluğa balon denir.

Boru hattı paralelliği balonu nasıl azaltır?

Bir grubun mikro gruplara bölünmesi, birden fazla mikro grubun aynı anda farklı aşamaları işgal etmesine olanak tanıyarak tüm GPU'ları meşgul eder ve boşta kalma süresini kısaltır.

Tensör paralelliği neden genellikle tek bir düğümde tutulur?

Tensör paralelliği, kısmi matris sonuçlarını yeniden birleştirmek için sıklıkla iletişim kurar; bu nedenle, ara bağlantı bant genişliğinin en yüksek olduğu yere, NVLink üzerinden bir düğümün içine yerleştirilir.