Teknik KILAVUZ

MEB Hizmeti için Uzman Paralelliği

Uzman paralelliği, Uzmanların Karması modelinin birçok ileri beslemeli 'uzmanını' farklı GPU'lara böler, böylece her cihaz parametrelerin yalnızca bir dilimini tutar.

2 min readSon güncelleme

Genel Bakış

It is the key to serving trillion-parameter MoE models cheaply, since only a few experts run per token.

Derin Dalış

Uzmanlar Karması (MoE) katmanı, büyük bir ileri beslemeli ağı birçok küçük ağla (uzmanlar) ve ayrıca belirteç başına en iyi k'yi (genellikle 1 veya 2) seçen bir yönlendiriciyle değiştirir. Uzman paralelliği (EP), farklı uzmanları farklı GPU'lara yerleştirir. Çıkarım olarak yönlendirici, her bir tokenın hangi uzmanlara ihtiyaç duyduğuna karar verir, ardından hepsi bir arada iletişim adımı, tokenları seçtikleri uzmanları tutan GPU'lara gönderir, FFN'yi çalıştırır ve sonuçları geri karıştırır. Bu, bir modelin çok büyük toplam parametrelere (seyrek) sahip olmasına ve jeton başına yalnızca küçük bir kısmı (düşük FLOP'lar) etkinleştirmesine olanak tanır. Mixtral 8x7B, DeepSeek-V3 ve GPT-OSS gibi modeller bunu kullanıyor. Zor kısımlar, uzmanlar arasında yük dengeleme ve katman başına iki maliyetli, hepsine atlamadır.

Teknik Bilgi

Temel mekanizma, MoE katmanı başına iki genel kolektiften oluşur: gönderme (uzmanlarına jeton gönderme) ve birleştirme (çıktıları geri toplama). Yönlendirme verilere bağlı olduğundan, her bir uzmana isabet eden token sayısı farklılık göstererek yük dengesizliğine ve "başıboş" duruma neden olur. Hizmet sistemleri, GEMM'leri (matris çarpımlarını) tekdüze tutmak için kapasite faktörleri, uzman ara bellekler ve belirteç bırakma veya doldurma ekler ve gecikmeyi gizlemek için genellikle hepsi bir arada iletişimi uzman hesaplamayla örtüştürür.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

MEB Hizmetinde Uzman Paralelliğinin Geleceği

Yönlendirme ve donanımın daha sıkı bir ortak tasarımını bekleyebilirsiniz: birleştirilmiş dağıtım-hesaplama-birleştirme çekirdekleri, birçok uzmanı gruplandıran gruplandırılmış GEMM'ler ve NVLink/InfiniBand uyumlu, hepsi bir arada. DeepSeek'in yardımcı kayıpsız dengeleme ve düğüm sınırlı yönlendirme gibi teknikler, düğümler arası trafiği azaltır. Ayrıştırılmış hizmet, 'uzman' GPU'ları ilgi GPU'larından ayrı olarak ayıracak ve daha iyi top-k ile daha büyük uzman sayıları (yüzlerce) MoE'yi jeton başına maliyeti sabit tutarken aşırı seyrekliğe doğru itecektir.

Gerçek Dünya Uygulaması

Mixtral 8x7B'yi 8 uzmanından 2-4'ünü her cihaza yerleştirerek 2-4 GPU üzerinden hizmet veriyor

DeepSeek-V3, bir token uzmanlarının yaydığı düğüm sayısını sınırlamak için düğüm sınırlı yönlendirmeyi kullanıyor ve düğümler arası tümünü kesiyor

Tek bir 8 GPU düğümünde 200B+ seyrek modeli barındırmak için vLLM veya SGLang uzman paralel modunu kullanma

Hibrit bir EP+TP dağıtımında uzman paralelliğini dikkat katmanlarındaki tensör paralelliğiyle birleştirmek

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Expert Parallelism for MoE Serving quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Ayrıştırılmış Önceden Doldurma ve Kod Çözme Sunumu

Sık sorulan sorular

What is Expert Parallelism for MoE Serving?

Uzman paralelliği, Uzmanların Karması modelinin birçok ileri beslemeli 'uzmanını' farklı GPU'lara böler, böylece her cihaz parametrelerin yalnızca bir dilimini tutar. Token başına yalnızca birkaç uzman çalıştığından, trilyon parametreli MoE modellerine ucuza hizmet vermenin anahtarıdır.

Uzman paralelliği GPU'lar arasında ne dağıtır?

Uzman paralelliği, farklı uzmanları (bir MoE katmanının FFN alt ağları) farklı GPU'lara yerleştirir, böylece her cihaz yalnızca bir uzman alt kümesini barındırır.

MEB uzman paralelliğinin merkezinde hangi iletişim modeli yer alır?

Her bir MoE katmanının tipik olarak, jetonları uzmanlarına göndermek için bir hepsine ve çıktıları birleştirmek için başka bir hepsine bir araya ihtiyacı vardır.

MoE, devasa toplam parametrelere rağmen neden jeton başına hesaplamayı düşük tutuyor?

Bir yönlendirici, jeton başına yalnızca en üst düzey uzmanları (genellikle 1-2) etkinleştirir, böylece modelin toplamda birçok uzmanı olmasına rağmen FLOP'lar küçük kalır.

Yönlendirmenin verilere bağlı olması nedeniyle hangi sorun ortaya çıkar?

Yönlendiricinin seçimleri girdiye bağlı olduğundan, bazı uzmanlar diğerlerinden çok daha fazla jeton alır, bu da yük dengesizliği ve başıboşluk yaratır.

Uzman matris çarpımlarının boyutunu tekdüze tutmak için yaygın olarak kullanılan bir teknik nedir?

Servis yığınları, uzman başına bir kapasite (maksimum jeton sayısı) belirler ve jetonları bunun ötesinde doldurur veya bırakır, böylece her uzmanın GEMM'si öngörülebilir bir şekle sahip olur.