Teknik KILAVUZ

Mixtral ve Seyrek Modeller

Mixtral, Mistral AI'nin küçük model hızında büyük model kalitesi sunan açık uzman karışımı modelidir.

2 min readSon güncelleme

Genel Bakış

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

Derin Dalış

Mistral AI tarafından 2023'ün sonlarında piyasaya sürülen Mixtral 8x7B, açık modellerde seyrek uzmanlar karışımı (MoE) yaklaşımını popüler hale getirdi. Yaklaşık 47 milyar toplam parametreyle katman başına sekiz ayrı 'uzman' ileri besleme ağı içerir, ancak hafif bir yönlendirici her simge için yalnızca iki uzman seçer. Sonuç olarak, jeton başına yalnızca kabaca 13 milyar parametre aktif olduğundan çıkarım, 13B yoğun bir model kadar hızlı gerçekleşirken, çok daha büyük modellerle karşılaştırılabilecek kaliteye ulaşır. Mixtral, birçok kıyaslamada GPT-3.5 ve Llama 2 70B'yi eşleştirdi veya geride bıraktı; aynı zamanda daha hızlı ve daha ucuz hizmet verdi. Mistral daha sonra Mixtral 8x22B'yi piyasaya sürdü. Model, Apache 2.0 altında açıkça lisanslanmıştır ve açık kaynak topluluğunda hızlı benimsenmeyi ve ince ayarların yapılmasını sağlar.

Teknik Bilgi

Seyrek bir MoE katmanında, yoğun ileri besleme bloğunun yerini N uzman ağ artı küçük bir geçit ağı (yönlendirici) alır. Yönlendirici, her bir token için puanları hesaplar ve en iyi uzmanları (Mixtral'da ilk 2) seçer ve tokenı yalnızca bunlar arasından yönlendirir. Çıktıları ağırlıklandırılır ve toplanır. Uzmanların çoğu jeton başına boşta kaldığından, model birçok parametreyi hafızasında tutar ancak çok daha az hesaplama yapar. Takas: Sadece bazıları çalışsa bile tüm uzmanların VRAM'e yüklenmesi gerekir.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

Mixtral ve Seyrek Modellerin Geleceği

Seyrek MoE artık sınır yapay zekasının merkezinde yer alıyor. Daha fazla açık MoE sürümü, birçok küçük uzmanla daha ayrıntılı yönlendirme ve verimliliği daha da artıran paylaşılan veya hibrit uzman tasarımları bekleyebilirsiniz. Modeller trilyonlarca toplam parametreye doğru ölçeklenirken, seyreklik, çıkarımı uygun maliyetli tutmanın ana aracıdır. Araştırmalar MoE'nin zayıf noktalarıyla, uzmanlar arasında yük dengelemeyle, bellek yüküyle ve eğitim kararlılığıyla uğraşırken, donanım ve hizmet yığınları uzman yönlendirme için giderek daha fazla optimize ediliyor.

Gerçek Dünya Uygulaması

Çok daha küçük, yoğun bir modelin maliyeti ve hızında yüksek kaliteli bir chatbot sunmak

Kullanım ücreti olmadan ticari ürünler için Apache-2.0 lisanslı modeli kendi kendine barındırma

Kodlama, özetleme veya çok dilli görevler için Mixtral'de bireysel davranışlara ince ayar yapma

70B yoğun bir modelin çok yavaş olacağı tek bir çoklu GPU sunucusunda hızlı çıkarım çalıştırma

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Model ve Boru Hattı Paralelliği

Sık sorulan sorular

What is Mixtral and Sparse Models?

Mixtral, Mistral AI'nin küçük model hızında büyük model kalitesi sunan açık uzman karışımı modelidir. Bunun gibi seyrek modeller, jeton başına parametrelerinin yalnızca bir kısmını etkinleştirerek kapasiteden ödün vermeden bilgi işlem kesintisine uğrar.

Mixtral 8x7B'de her bir token kaç uzman tarafından işleniyor?

Mixtral en iyi 2 yönlendirmeyi kullanır: bir yönlendirici, her bir jetonu işlemek için sekiz uzmandan ikisini seçer.

Bir tokenın hangi uzmanlara gönderileceğine hangi bileşen karar veriyor?

Yönlendirici adı verilen küçük bir geçit ağı, uzmanları puanlıyor ve her bir jetonu hangisinin işleyeceğini seçiyor.

Mixtral 8x7B'nin yaklaşık 47B toplam parametresi olmasına rağmen, token başına kabaca kaç tanesi aktiftir?

Token başına yalnızca iki uzman çalıştığı için yaklaşık 13 milyar parametre etkindir ve bu da ona çok daha küçük bir modelin hızını verir.

Mixtral gibi seyrek MoE modellerinin önemli bir değiş-tokuşu nedir?

MoE, jeton başına hesaplama tasarrufu sağlar ancak yine de tüm uzmanların VRAM'de tutulmasını gerektirir, bu da bellek ihtiyaçlarını artırır.

Mistral AI, Mixtral'ı hangi lisans kapsamında piyasaya sürerek açık benimsemeyi teşvik etti?

Mixtral, ücretsiz ticari kullanıma ve ince ayara izin veren, izin verilen Apache 2.0 lisansı altında piyasaya sürüldü.