Uzmanların Karışımı
Uzmanların Karması (MoE), bir ağı birçok özel alt ağa bölen ve giriş başına yalnızca birkaçını etkinleştiren bir model tasarımıdır.
Genel Bakış
It lets models hold enormous knowledge while keeping each prediction fast and cheap.
Derin Dalış
Standart bir transformatör her girişi aynı yoğun katmanlardan geçirir; dolayısıyla modeli daha akıllı hale getirmek genellikle her hesaplamayı daha pahalı hale getirmek anlamına gelir. Uzmanların Karışımı bu bağlantıyı koparır. Büyük ileri besleme katmanını birçok küçük 'uzman' ağ ve her bir tokenı hangi uzmanların ele alacağına karar veren küçük bir 'yönlendirici' ile değiştirir. Tipik olarak yalnızca en iyi 1 veya 2 uzman ateşlenir, dolayısıyla bir model yüz milyarlarca toplam parametreye sahip olabilir ancak jeton başına yalnızca küçük bir kısmı etkinleştirebilir. Mixtral 8x7B gibi modellerin ve GPT-4'ün arkasında olduğu söylenen mimarinin, orantısal olarak yüksek çıkarım maliyeti olmadan yüksek kaliteye ulaşmasının nedeni budur. Takas karmaşıktır: Tüm uzmanların hâlâ belleğe sığması gerekir ve yönlendirici bazı uzmanları yanlış yönlendirebilir veya aşırı yükleyebilir, bu nedenle eğitim dikkatli bir dengeleme gerektirir.
Teknik Bilgi
MoE'nin kalbi, her uzmanı gelen bir token için puanlayan ve tokenı en yüksek puana sahip olanlara (genellikle k=1 veya 2) yönlendiren küçük, öğrenilmiş bir katman olan geçiş ağıdır. Yönlendiricinin her şeyi birkaç favori uzmana göndermesini engellemek için eğitim, dengesiz kullanımı cezalandıran yardımcı bir 'yük dengeleme kaybı' ekler. Token başına yalnızca k uzman çalıştığından, daha fazla uzman ekleseniz bile hesaplama (FLOP'lar) yaklaşık olarak sabit kalır, dolayısıyla toplam parametreler ve token başına maliyet bağımsız olarak ölçeklenir.
Stratejik Etki
Maliyet ve bütçe
Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.
Daha net kararlar
Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.
Quality control
Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.
Uzman Karmasının Geleceği
MoE, kapasiteyi maliyetten ayırdığı için sınır ölçekli modeller için varsayılan bir araç haline geliyor. Daha ayrıntılı uzmanların, daha fazla bağlamı göz önünde bulunduran daha akıllı yönlendirmenin ve sınırlı donanım üzerinde devasa seyrek modellerin sunulmasına yönelik daha iyi tekniklerin olmasını bekleyin. Araştırma aynı zamanda hafıza problemini de ele alıyor, çünkü çok az sayıda çalışma olsa bile tüm uzmanların uzman boşaltma ve nicemleme yoluyla yüklenmesi gerekiyor. Mixtral ve DeepSeek-MoE gibi açık modeller olgunlaştıkça, seyrek mimariler muhtemelen daha küçük GPU bütçeleriyle daha verimli asistanlara güç verecek.
Gerçek Dünya Uygulaması
Mixtral 8x7B, 8 uzman kullanır ve jeton başına 2 kişiyi etkinleştirir; daha hızlı, daha ucuz çıkarım için kabaca 47B toplam parametre sağlar, ancak jeton başına yalnızca ~13B aktiftir.
DeepSeek ve Qwen, daha düşük token başına bilgi işlemle çalışırken karşılaştırmalı değerlendirmelerdeki yoğun modellerle eşleşen büyük MoE dil modelleri sunuyor.
Cloud LLM sağlayıcıları MoE'yi kullanıyor, böylece her talep yalnızca birkaç uzmana ışık tuttuğundan, tek bir büyük model birçok kullanıcıya uygun maliyetle hizmet verebilir.
Google'in önceki Switch Transformer'ı, eğitim hesaplamasını yönetilebilir tutmak için ilk 1 yönlendirmeyi kullanarak bir trilyonun üzerinde parametreye ölçeklendirildi.
Riskler ve Korkuluklar
Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.
Altyapı ve bakım maliyetleri genellikle hafife alınır.
Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.
Uygulama Yol Haritası
Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.
Gerçekçi yük ve veri koşulları altında kıyaslama yapın.
Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.
Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixture of Experts quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
LoRA Uzmanlarının Karışımı
Sık sorulan sorular
What is Mixture of Experts?
Uzmanların Karması (MoE), bir ağı birçok özel alt ağa bölen ve giriş başına yalnızca birkaçını etkinleştiren bir model tasarımıdır. Her tahmini hızlı ve ucuz tutarken modellerin muazzam miktarda bilgi taşımasına olanak tanır.
Uzmanlar Karması katmanında, hangi uzmanların belirli bir tokenı işleyeceğine ne karar verir?
Küçük bir geçiş ağı, her uzmanı token için puanlamayı öğrenir ve onu en yüksek puana sahip olanlara yönlendirir. Yönlendirme öğrenilir, sabit veya rastgele değildir.
Neden bir MoE modeli, jeton başına maliyette aynı artış olmadan yoğun bir modele göre çok daha fazla toplam parametreye sahip olabiliyor?
Token başına yalnızca en üst düzey uzmanlar ateşlendiğinden, daha fazla uzman eklenerek toplam parametre sayısı artsa bile aktif hesaplama yaklaşık olarak sabit kalır.
MEB eğitimi sırasında yük dengeleme (yardımcı) kaybı hangi sorunu çözer?
Dengeleme olmadığında yönlendirici bir avuç uzmanın lehine olma eğilimindedir. Yardımcı kayıp, dengesiz kullanımı cezalandırır, böylece tüm uzmanlar eğitilir.
Mixtral 8x7B, token başına 8 uzmanından 2'sini etkinleştirir. Bu, hesaplama ve boyutu hakkında ne anlama geliyor?
8 uzmandan yalnızca 2'si aktif olduğundan, jeton başına aktif parametreler (~13B), toplam ~47B'den çok daha küçüktür ve çıkarım maliyetini düşürür.
Eşit derecede yetenekli yoğun modellerle karşılaştırıldığında MoE modellerinin gerçek dezavantajı hangisidir?
Her ne kadar jeton başına yalnızca birkaç uzman hesaplama yapsa da, her uzmanın ağırlıklarının belleğe yüklenmesi gerekir, bu da MoE modellerinin hizmet vermeye aç olmasına neden olur.