Mifano ya Mixtral na Sparse
Mixtral ni muundo wa wazi wa mchanganyiko wa wataalam wa Mistral AI ambao hutoa ubora wa modeli kubwa kwa kasi ya modeli ndogo.
Muhtasari
Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.
Dive ya kina
Mixtral 8x7B, iliyotolewa na Mistral AI mwishoni mwa 2023, ilieneza mbinu ya uchanganyiko wa wataalam (MoE) katika mifano wazi. Ina mitandao minane tofauti ya kusambaza 'mtaalam' kwa kila safu, yenye jumla ya vigezo bilioni 47, lakini kipanga njia chepesi huchagua wataalam wawili tu kwa kila tokeni. Kwa hivyo, ni takribani vigezo bilioni 13 pekee ndivyo vinavyotumika kwa kila tokeni, kwa hivyo makisio huenda haraka kama kielelezo mnene cha 13B huku ikifikia ubora unaolingana na zile kubwa zaidi. Mixtral ililingana au kushinda GPT-3.5 na Llama 2 70B kwenye vigezo vingi huku ikiwa kwa haraka na kwa bei nafuu kuhudumia. Mistral baadaye ilitoa Mixtral 8x22B. Mtindo huu umeidhinishwa waziwazi chini ya Apache 2.0, na hivyo kuchochea upitishwaji wa haraka na urekebishaji mzuri katika jumuiya ya chanzo huria.
Ufahamu wa Kiufundi
Katika safu ndogo ya MoE, kizuizi mnene cha kusambaza malisho kinabadilishwa na mitandao ya wataalam N pamoja na mtandao mdogo wa lango (kipanga njia). Kwa kila ishara, kipanga njia huhesabu alama na kuchagua wataalam wa juu-k (juu-2 katika Mixtral), kuelekeza ishara kupitia hizo pekee. Matokeo yao yana uzito na muhtasari. Kwa sababu wataalam wengi hukaa bila kufanya kazi kwa kila tokeni, modeli inashikilia vigezo vingi kwenye kumbukumbu lakini haina hesabu ndogo sana. Ubadilishanaji: wataalam wote lazima wawekwe kwenye VRAM ingawa ni baadhi tu wanaoendesha.
Athari za kimkakati
Cost and budget
Maamuzi ya usanifu huendesha utendaji na gharama ya uendeshaji kwa miaka.
Maamuzi ya wazi zaidi
Elimu ya kiufundi husaidia timu kuchagua safu sahihi, sio tu mpya zaidi.
Quality control
Chaguo bora za uhandisi hupunguza matukio ya kuaminika katika uzalishaji.
Mustakabali wa Miundo ya Mchanganyiko na Sparse
Sparse MoE sasa iko katikati ya mpaka wa AI. Tarajia matoleo ya wazi zaidi ya MoE, uelekezaji ulioboreshwa na wataalam wengi wadogo, na miundo ya wataalamu iliyoshirikiwa au mseto ambayo inaboresha ufanisi zaidi. Vile mifano inavyopanda hadi matrilioni ya jumla ya vigezo, sparsity ndio kigezo kikuu cha kuweka makisio kuwa nafuu. Utafiti unashughulikia maeneo hafifu ya MoE, kusawazisha upakiaji kote kwa wataalam, juu ya kumbukumbu, na uthabiti wa mafunzo, huku maunzi na rundo la huduma vikizidi kuboreshwa haswa kwa uelekezaji wa kitaalamu.
Utekelezaji wa Ulimwengu Halisi
Kutumikia chatbot ya ubora wa juu kwa gharama na kasi ya muundo mdogo zaidi mnene
Kujipangisha mwenyewe modeli yenye leseni ya Apache-2.0 kwa bidhaa za kibiashara bila ada za matumizi
Kurekebisha vyema tabia za mtu binafsi kwenye Mixtral kwa usimbaji, muhtasari, au kazi za lugha nyingi
Kuendesha makisio ya haraka kwenye seva moja ya GPU nyingi ambapo muundo mnene wa 70B ungekuwa polepole sana
Hatari & Walinzi
Kuboresha kiwango kimoja kunaweza kuficha udhaifu mkubwa wa mfumo.
Gharama za miundombinu na matengenezo mara nyingi hupunguzwa.
Mapengo ya usalama na uonekanaji yanaweza kukua kadiri mifumo inavyozidi kuwa ngumu.
Ramani ya Utekelezaji
Bainisha muda, ubora na malengo ya gharama kabla ya utekelezaji.
Benchmark chini ya mzigo halisi na hali ya data.
Ufuatiliaji wa ala kwa makosa, kuteleza, na athari za mtumiaji.
Tayarisha njia za urejeshaji na majibu ya matukio kabla ya kuongeza ukubwa.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixtral and Sparse Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Usambamba wa Mfano na Bomba
Maswali yanayoulizwa mara kwa mara
What is Mixtral and Sparse Models?
Mixtral ni muundo wa wazi wa mchanganyiko wa wataalam wa Mistral AI ambao hutoa ubora wa modeli kubwa kwa kasi ya modeli ndogo. Miundo michache kama hiyo huwasha sehemu ndogo tu ya vigezo vyao kwa kila tokeni, ikikata kokotoo bila uwezo wa kutoa sadaka.
Katika Mixtral 8x7B, ni wataalam wangapi wanaochakata kila tokeni ya mtu binafsi?
Mixtral hutumia uelekezaji wa juu-2: kipanga njia huchagua wataalam wawili kati ya wanane ili kuchakata kila tokeni.
Ni sehemu gani inayoamua ni wataalam gani ishara inatumwa?
Mtandao mdogo wa lango, unaoitwa kipanga njia, huwaweka alama wataalam na kuchagua ni zipi zinazoshughulikia kila ishara.
Ingawa Mixtral 8x7B ina jumla ya vigezo 47B, takribani ni ngapi zinazotumika kwa kila tokeni?
Kwa sababu wataalam wawili tu wanaendesha kwa tokeni, takribani vigezo bilioni 13 vinafanya kazi, na hivyo kutoa kasi ya mfano mdogo zaidi.
Ni biashara gani kuu ya mifano michache ya MoE kama Mixtral?
MoE huokoa hesabu kwa kila tokeni lakini bado inahitaji wataalam wote kushikiliwa katika VRAM, na kuongeza mahitaji ya kumbukumbu.
Je, Mistral AI ilitoa Mixtral chini ya leseni gani, na hivyo kuchochea kupitishwa kwa wazi?
Mixtral ilitolewa chini ya leseni ruhusu ya Apache 2.0, ikiruhusu matumizi ya bure ya kibiashara na urekebishaji mzuri.