Modele mieszane i rzadkie
Mixtral to otwarty model Mistral AI, będący mieszanką ekspertów, który zapewnia jakość dużego modelu przy szybkości małego modelu.
Przegląd
Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.
Głębokie nurkowanie
Mixtral 8x7B, wydany przez Mistral AI pod koniec 2023 roku, spopularyzował podejście rzadkiej mieszanki ekspertów (MoE) w modelach otwartych. Zawiera osiem oddzielnych „eksperckich” sieci ze sprzężeniem zwrotnym na warstwę, z łącznymi około 47 miliardami parametrów, ale lekki router wybiera tylko dwóch ekspertów dla każdego tokena. W rezultacie na każdy token aktywnych jest tylko około 13 miliardów parametrów, więc wnioskowanie przebiega mniej więcej tak szybko, jak w przypadku gęstego modelu 13B, a jednocześnie osiąga jakość porównywalną do znacznie większych. Mixtral dorównał lub pokonał GPT-3.5 i Llama 2 70B w wielu testach porównawczych, będąc jednocześnie szybszym i tańszym w obsłudze. Mistral wypuścił później Mixtral 8x22B. Model jest objęty otwartą licencją Apache 2.0, co ułatwia szybkie przyjęcie i udoskonalenie w społeczności open source.
Wgląd techniczny
W rzadkiej warstwie MoE gęsty blok przekazywania sygnału jest zastępowany przez N sieci eksperckich oraz małą sieć bramkową (router). Dla każdego tokena router oblicza wyniki i wybiera najlepszych ekspertów (2 najlepszych w Mixtral), kierując token tylko przez nich. Ich wyniki są ważone i sumowane. Ponieważ większość ekspertów pozostaje bezczynna w zależności od tokena, model przechowuje w pamięci wiele parametrów, a jednocześnie wykonuje znacznie mniej obliczeń. Kompromis: wszyscy eksperci muszą zostać załadowani do pamięci VRAM, nawet jeśli tylko niektórzy z nich działają.
Wpływ strategiczny
Koszt i budżet
Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.
Jaśniejsze decyzje
Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.
Kontrola jakości
Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.
Przyszłość modeli mieszanych i rzadkich
Sparse MoE ma obecnie kluczowe znaczenie dla pionierskiej sztucznej inteligencji. Spodziewaj się bardziej otwartych wydań MoE, bardziej szczegółowego routingu z udziałem wielu małych ekspertów oraz wspólnych lub hybrydowych projektów ekspertów, które jeszcze bardziej poprawią wydajność. W miarę skalowania modeli w kierunku bilionów całkowitych parametrów, rzadkość jest główną dźwignią pozwalającą na utrzymanie przystępnej ceny wnioskowania. Badania skupiają się na słabych punktach MoE, równoważeniu obciążenia między ekspertami, obciążeniu pamięci i stabilności treningu, podczas gdy sprzęt i stosy obsługujące są w coraz większym stopniu optymalizowane specjalnie pod kątem routingu eksperckiego.
Implementacja w świecie rzeczywistym
Zapewnienie wysokiej jakości chatbota kosztem i szybkością znacznie mniejszego, gęstego modelu
Samodzielny hosting modelu licencjonowanego Apache-2.0 dla produktów komercyjnych bez opłat za użytkowanie
Dostosowywanie indywidualnych zachowań w Mixtralu do kodowania, podsumowywania lub zadań wielojęzycznych
Uruchamianie szybkiego wnioskowania na pojedynczym serwerze z wieloma procesorami graficznymi, gdzie gęsty model 70B byłby zbyt wolny
Zagrożenia i poręcze
Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.
Koszty infrastruktury i utrzymania są często niedoszacowane.
W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.
Plan wdrożenia
Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.
Test porównawczy w realistycznych warunkach obciążenia i danych.
Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.
Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixtral and Sparse Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Równoległość modelu i potoku
Często zadawane pytania
What is Mixtral and Sparse Models?
Mixtral to otwarty model Mistral AI, będący mieszanką ekspertów, który zapewnia jakość dużego modelu przy szybkości małego modelu. Rzadkie modele, takie jak ten, aktywują tylko ułamek ich parametrów na token, zmniejszając moc obliczeniową bez poświęcania wydajności.
Ilu ekspertów przetwarza każdy indywidualny token w Mixtral 8x7B?
Mixtral korzysta z routingu 2 najlepszych: router wybiera dwóch z ośmiu ekspertów w celu przetworzenia każdego tokena.
Jaki komponent decyduje do jakich ekspertów wysyłany jest token?
Mała sieć bramkowa, zwana routerem, ocenia ekspertów i wybiera, którzy obsługują każdy token.
Chociaż Mixtral 8x7B ma łącznie około 47B parametrów, ile mniej więcej jest aktywnych na token?
Ponieważ na token działa tylko dwóch ekspertów, aktywnych jest około 13 miliardów parametrów, co zapewnia szybkość znacznie mniejszego modelu.
Jaki jest kluczowy kompromis w przypadku rzadkich modeli MoE, takich jak Mixtral?
MoE oszczędza moc obliczeniową na token, ale nadal wymaga przechowywania wszystkich ekspertów w pamięci VRAM, co zwiększa zapotrzebowanie na pamięć.
Na jakiej licencji Mistral AI wypuścił Mixtral, napędzając otwartą adopcję?
Mixtral został wydany na liberalnej licencji Apache 2.0, umożliwiającej bezpłatne wykorzystanie komercyjne i dostrajanie.