Teknik KILAVUZ

Büyük Modeller için Tensör Paralelliği

Tek bir sinir ağı katmanındaki matematiği birden fazla GPU'ya bölmenin bir yolu, böylece bir cihaz için çok büyük bir model çalışmaya devam edebilir.

2 min readSon güncelleme

Genel Bakış

It matters because frontier models have hundreds of billions of parameters that no single GPU can hold or compute fast enough alone.

Derin Dalış

Tensör paralelliği (aynı zamanda katman içi model paralelliği olarak da adlandırılır), tüm katmanları ayrı cihazlara koymak yerine bireysel ağırlık matrislerini GPU'lar arasında parçalara ayırır. Bir transformatörde, büyük matris çarpımları (dikkat projeksiyonları ve ileri beslemeli MLP) bölünür: örneğin, MLP'nin ilk ağırlık matrisi sütunlara ve ikincisi satırlara göre bölünür, böylece her GPU bir dilim hesaplar ve tek bir tümünü azaltma işlemi sonuçları birleştirir. Her GPU'nun bir alt kümeyi ele almasıyla dikkat, kafalar arasında bölünmüştür. Her GPU her katmanın bir kısmını aynı anda yaptığı için tensör paralelliği GPU başına belleği azaltır ve hesaplamayı hızlandırır, ancak her katmandaki GPU'lar arasında sık, yüksek bant genişliğine sahip iletişim gerektirir. Bu nedenle genellikle NVLink ile bağlanan bir düğüm içinde sınırlandırılır ve çok büyük eğitim ve hizmet işleri için işlem hattı ve veri paralelliği ile birleştirilir.

Teknik Bilgi

Megatron-LM tarafından popüler hale getirilen püf noktası, iletişimin minimum düzeyde olması için bölme boyutlarını seçmektir. İlk MLP matrisini sütun bazında bölmek, her GPU'nun doğrusal olmamayı senkronizasyon olmadan yerel olarak uygulamasına olanak tanır; ikinci sırayı bölmek, çıktıların kısmi sonuçları toplamak için yalnızca bir tümü-indirgemeye ihtiyaç duyduğu anlamına gelir. Bu nedenle her katman kabaca iki (ileri) ve iki (geri) tamamen azaltma içerir. Bu kolektifler her katmanda meydana geldiğinden gecikme hakimdir; dolayısıyla tensör paralelliği, daha yavaş düğümler arası ağlar yerine NVLink gibi hızlı düğüm içi bağlantıların arkasında yaşar.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

Büyük Modeller İçin Tensör Paralelliğinin Geleceği

Tensör paralelliği temel olmaya devam ediyor ancak giderek '3 boyutlu paralellik' (tensör + ardışık düzen + veri) ile harmanlanıyor ve Uzmanların Karması modelleri için uzman paralelliği ile birleşiyor. Megatron-LM, DeepSpeed ​​ve vLLM gibi çerçeveler parçalamayı otomatikleştirir. GPU ara bağlantıları (NVLink, NVSwitch) ve optik yapılar hızlandıkça düğüm sınırı sınırı gevşer ve daha geniş tensör-paralel gruplara olanak tanır. Belirli bir küme topolojisi için iletişimi en aza indirmek amacıyla parça boyutlarını ve grup boyutlarını seçen daha akıllı otomatik paralelleştirmeyi bekleyebilirsiniz.

Gerçek Dünya Uygulaması

Megatron-LM kullanarak her katmanın ağırlık matrislerini NVLink bağlantılı tek bir düğümde 8 GPU'ya bölerek 175B parametreli bir modeli eğitme.

Ağırlıkların dört GPU'ya sığması ve gerçek zamanlı yanıt vermesi için vLLM'de tensor_parallel_size=4 ile 70B parametreli bir sohbet modeli sunuluyor.

Her cihazın bir alt kümeyi hesaplaması için transformatörün dikkati GPU'lara dağıtılır ve ardından bir sonraki katman için çıktılar birleştirilir.

Büyük GPU kümelerinde trilyon parametreli modelleri eğitmek için düğümler içindeki tensör paralelliğini ve düğümler arasındaki boru hattı paralelliğini birleştirmek.

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tensor Parallelism for Large Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Model ve Boru Hattı Paralelliği

Sık sorulan sorular

What is Tensor Parallelism for Large Models?

Tek bir sinir ağı katmanındaki matematiği birden fazla GPU'ya bölmenin bir yolu, böylece bir cihaz için çok büyük bir model çalışmaya devam edebilir. Bu önemlidir çünkü sınır modelleri, tek bir GPU'nun tek başına yeterince hızlı tutamayacağı veya hesaplayamayacağı yüz milyarlarca parametreye sahiptir.

Tensör paralelliği GPU'lar arasında nasıl bölünür?

Tensör (katman içi) paralelliği, bir katmanın içindeki ağırlık matrislerini parçalara ayırır, böylece her GPU aynı katmanın bir kısmını hesaplar; bu, tüm katmanları farklı GPU'lara yerleştiren ardışık düzen paralelliğinden farklıdır.

Megatron tarzı MLP bölünmesinde, iletişimi en aza indirmek için iki ağırlık matrisi nasıl bölünür?

İlk matrisin sütunlara bölünmesi, her GPU'nun doğrusal olmamayı yerel olarak uygulamasına olanak tanır; saniyeyi satırlara bölmek, tek bir tümünü azaltma işleminin kısmi çıktıları toplaması anlamına gelir; bu da senkronizasyonu en aza indirir.

Tensör paralelliği neden genellikle tek bir düğümde tutulur?

Her katman kolektif iletişimi tetikler (hepsi azalır), dolayısıyla yoğun, gecikmeye duyarlı trafik, daha yavaş düğümler arası ağlar yerine NVLink gibi hızlı düğüm içi bağlantılar gerektirir.

Dikkat mekanizması tipik olarak tensör paralelliği altında nasıl paralelleştirilir?

Dikkat kafaları bağımsızdır, dolayısıyla GPU'lar arasında dağıtılırlar; her cihaz bazı kafaları hesaplar ve çıktılar birleştirilir.

Hangi kolektif işlem genellikle kısmi sonuçları tensör paralelliğinde birleştirir?

Tümünü azalt, her GPU'da hesaplanan kısmi çıktıları toplar, böylece katman sonucu üzerinde anlaşırlar; bu, ileri ve geri geçişlerde katman başına birden çok kez gerçekleşir.