PRZEWODNIK techniczny

Modele mieszane i rzadkie

Mixtral to otwarty model Mistral AI, będący mieszanką ekspertów, który zapewnia jakość dużego modelu przy szybkości małego modelu.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

Głębokie nurkowanie

Mixtral 8x7B, wydany przez Mistral AI pod koniec 2023 roku, spopularyzował podejście rzadkiej mieszanki ekspertów (MoE) w modelach otwartych. Zawiera osiem oddzielnych „eksperckich” sieci ze sprzężeniem zwrotnym na warstwę, z łącznymi około 47 miliardami parametrów, ale lekki router wybiera tylko dwóch ekspertów dla każdego tokena. W rezultacie na każdy token aktywnych jest tylko około 13 miliardów parametrów, więc wnioskowanie przebiega mniej więcej tak szybko, jak w przypadku gęstego modelu 13B, a jednocześnie osiąga jakość porównywalną do znacznie większych. Mixtral dorównał lub pokonał GPT-3.5 i Llama 2 70B w wielu testach porównawczych, będąc jednocześnie szybszym i tańszym w obsłudze. Mistral wypuścił później Mixtral 8x22B. Model jest objęty otwartą licencją Apache 2.0, co ułatwia szybkie przyjęcie i udoskonalenie w społeczności open source.

Wgląd techniczny

W rzadkiej warstwie MoE gęsty blok przekazywania sygnału jest zastępowany przez N sieci eksperckich oraz małą sieć bramkową (router). Dla każdego tokena router oblicza wyniki i wybiera najlepszych ekspertów (2 najlepszych w Mixtral), kierując token tylko przez nich. Ich wyniki są ważone i sumowane. Ponieważ większość ekspertów pozostaje bezczynna w zależności od tokena, model przechowuje w pamięci wiele parametrów, a jednocześnie wykonuje znacznie mniej obliczeń. Kompromis: wszyscy eksperci muszą zostać załadowani do pamięci VRAM, nawet jeśli tylko niektórzy z nich działają.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość modeli mieszanych i rzadkich

Sparse MoE ma obecnie kluczowe znaczenie dla pionierskiej sztucznej inteligencji. Spodziewaj się bardziej otwartych wydań MoE, bardziej szczegółowego routingu z udziałem wielu małych ekspertów oraz wspólnych lub hybrydowych projektów ekspertów, które jeszcze bardziej poprawią wydajność. W miarę skalowania modeli w kierunku bilionów całkowitych parametrów, rzadkość jest główną dźwignią pozwalającą na utrzymanie przystępnej ceny wnioskowania. Badania skupiają się na słabych punktach MoE, równoważeniu obciążenia między ekspertami, obciążeniu pamięci i stabilności treningu, podczas gdy sprzęt i stosy obsługujące są w coraz większym stopniu optymalizowane specjalnie pod kątem routingu eksperckiego.

Implementacja w świecie rzeczywistym

Zapewnienie wysokiej jakości chatbota kosztem i szybkością znacznie mniejszego, gęstego modelu

Samodzielny hosting modelu licencjonowanego Apache-2.0 dla produktów komercyjnych bez opłat za użytkowanie

Dostosowywanie indywidualnych zachowań w Mixtralu do kodowania, podsumowywania lub zadań wielojęzycznych

Uruchamianie szybkiego wnioskowania na pojedynczym serwerze z wieloma procesorami graficznymi, gdzie gęsty model 70B byłby zbyt wolny

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Równoległość modelu i potoku

Często zadawane pytania

What is Mixtral and Sparse Models?

Mixtral to otwarty model Mistral AI, będący mieszanką ekspertów, który zapewnia jakość dużego modelu przy szybkości małego modelu. Rzadkie modele, takie jak ten, aktywują tylko ułamek ich parametrów na token, zmniejszając moc obliczeniową bez poświęcania wydajności.

Ilu ekspertów przetwarza każdy indywidualny token w Mixtral 8x7B?

Mixtral korzysta z routingu 2 najlepszych: router wybiera dwóch z ośmiu ekspertów w celu przetworzenia każdego tokena.

Jaki komponent decyduje do jakich ekspertów wysyłany jest token?

Mała sieć bramkowa, zwana routerem, ocenia ekspertów i wybiera, którzy obsługują każdy token.

Chociaż Mixtral 8x7B ma łącznie około 47B parametrów, ile mniej więcej jest aktywnych na token?

Ponieważ na token działa tylko dwóch ekspertów, aktywnych jest około 13 miliardów parametrów, co zapewnia szybkość znacznie mniejszego modelu.

Jaki jest kluczowy kompromis w przypadku rzadkich modeli MoE, takich jak Mixtral?

MoE oszczędza moc obliczeniową na token, ale nadal wymaga przechowywania wszystkich ekspertów w pamięci VRAM, co zwiększa zapotrzebowanie na pamięć.

Na jakiej licencji Mistral AI wypuścił Mixtral, napędzając otwartą adopcję?

Mixtral został wydany na liberalnej licencji Apache 2.0, umożliwiającej bezpłatne wykorzystanie komercyjne i dostrajanie.