MWONGOZO wa Kiufundi

Mifano ya Mixtral na Sparse

Mixtral ni muundo wa wazi wa mchanganyiko wa wataalam wa Mistral AI ambao hutoa ubora wa modeli kubwa kwa kasi ya modeli ndogo.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

Dive ya kina

Mixtral 8x7B, iliyotolewa na Mistral AI mwishoni mwa 2023, ilieneza mbinu ya uchanganyiko wa wataalam (MoE) katika mifano wazi. Ina mitandao minane tofauti ya kusambaza 'mtaalam' kwa kila safu, yenye jumla ya vigezo bilioni 47, lakini kipanga njia chepesi huchagua wataalam wawili tu kwa kila tokeni. Kwa hivyo, ni takribani vigezo bilioni 13 pekee ndivyo vinavyotumika kwa kila tokeni, kwa hivyo makisio huenda haraka kama kielelezo mnene cha 13B huku ikifikia ubora unaolingana na zile kubwa zaidi. Mixtral ililingana au kushinda GPT-3.5 na Llama 2 70B kwenye vigezo vingi huku ikiwa kwa haraka na kwa bei nafuu kuhudumia. Mistral baadaye ilitoa Mixtral 8x22B. Mtindo huu umeidhinishwa waziwazi chini ya Apache 2.0, na hivyo kuchochea upitishwaji wa haraka na urekebishaji mzuri katika jumuiya ya chanzo huria.

Ufahamu wa Kiufundi

Katika safu ndogo ya MoE, kizuizi mnene cha kusambaza malisho kinabadilishwa na mitandao ya wataalam N pamoja na mtandao mdogo wa lango (kipanga njia). Kwa kila ishara, kipanga njia huhesabu alama na kuchagua wataalam wa juu-k (juu-2 katika Mixtral), kuelekeza ishara kupitia hizo pekee. Matokeo yao yana uzito na muhtasari. Kwa sababu wataalam wengi hukaa bila kufanya kazi kwa kila tokeni, modeli inashikilia vigezo vingi kwenye kumbukumbu lakini haina hesabu ndogo sana. Ubadilishanaji: wataalam wote lazima wawekwe kwenye VRAM ingawa ni baadhi tu wanaoendesha.

Athari za kimkakati

Cost and budget

Maamuzi ya usanifu huendesha utendaji na gharama ya uendeshaji kwa miaka.

Maamuzi ya wazi zaidi

Elimu ya kiufundi husaidia timu kuchagua safu sahihi, sio tu mpya zaidi.

Quality control

Chaguo bora za uhandisi hupunguza matukio ya kuaminika katika uzalishaji.

Mustakabali wa Miundo ya Mchanganyiko na Sparse

Sparse MoE sasa iko katikati ya mpaka wa AI. Tarajia matoleo ya wazi zaidi ya MoE, uelekezaji ulioboreshwa na wataalam wengi wadogo, na miundo ya wataalamu iliyoshirikiwa au mseto ambayo inaboresha ufanisi zaidi. Vile mifano inavyopanda hadi matrilioni ya jumla ya vigezo, sparsity ndio kigezo kikuu cha kuweka makisio kuwa nafuu. Utafiti unashughulikia maeneo hafifu ya MoE, kusawazisha upakiaji kote kwa wataalam, juu ya kumbukumbu, na uthabiti wa mafunzo, huku maunzi na rundo la huduma vikizidi kuboreshwa haswa kwa uelekezaji wa kitaalamu.

Utekelezaji wa Ulimwengu Halisi

Kutumikia chatbot ya ubora wa juu kwa gharama na kasi ya muundo mdogo zaidi mnene

Kujipangisha mwenyewe modeli yenye leseni ya Apache-2.0 kwa bidhaa za kibiashara bila ada za matumizi

Kurekebisha vyema tabia za mtu binafsi kwenye Mixtral kwa usimbaji, muhtasari, au kazi za lugha nyingi

Kuendesha makisio ya haraka kwenye seva moja ya GPU nyingi ambapo muundo mnene wa 70B ungekuwa polepole sana

Hatari & Walinzi

Kuboresha kiwango kimoja kunaweza kuficha udhaifu mkubwa wa mfumo.

Gharama za miundombinu na matengenezo mara nyingi hupunguzwa.

Mapengo ya usalama na uonekanaji yanaweza kukua kadiri mifumo inavyozidi kuwa ngumu.

Ramani ya Utekelezaji

1

Bainisha muda, ubora na malengo ya gharama kabla ya utekelezaji.

2

Benchmark chini ya mzigo halisi na hali ya data.

3

Ufuatiliaji wa ala kwa makosa, kuteleza, na athari za mtumiaji.

4

Tayarisha njia za urejeshaji na majibu ya matukio kabla ya kuongeza ukubwa.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Usambamba wa Mfano na Bomba

Maswali yanayoulizwa mara kwa mara

What is Mixtral and Sparse Models?

Mixtral ni muundo wa wazi wa mchanganyiko wa wataalam wa Mistral AI ambao hutoa ubora wa modeli kubwa kwa kasi ya modeli ndogo. Miundo michache kama hiyo huwasha sehemu ndogo tu ya vigezo vyao kwa kila tokeni, ikikata kokotoo bila uwezo wa kutoa sadaka.

Katika Mixtral 8x7B, ni wataalam wangapi wanaochakata kila tokeni ya mtu binafsi?

Mixtral hutumia uelekezaji wa juu-2: kipanga njia huchagua wataalam wawili kati ya wanane ili kuchakata kila tokeni.

Ni sehemu gani inayoamua ni wataalam gani ishara inatumwa?

Mtandao mdogo wa lango, unaoitwa kipanga njia, huwaweka alama wataalam na kuchagua ni zipi zinazoshughulikia kila ishara.

Ingawa Mixtral 8x7B ina jumla ya vigezo 47B, takribani ni ngapi zinazotumika kwa kila tokeni?

Kwa sababu wataalam wawili tu wanaendesha kwa tokeni, takribani vigezo bilioni 13 vinafanya kazi, na hivyo kutoa kasi ya mfano mdogo zaidi.

Ni biashara gani kuu ya mifano michache ya MoE kama Mixtral?

MoE huokoa hesabu kwa kila tokeni lakini bado inahitaji wataalam wote kushikiliwa katika VRAM, na kuongeza mahitaji ya kumbukumbu.

Je, Mistral AI ilitoa Mixtral chini ya leseni gani, na hivyo kuchochea kupitishwa kwa wazi?

Mixtral ilitolewa chini ya leseni ruhusu ya Apache 2.0, ikiruhusu matumizi ya bure ya kibiashara na urekebishaji mzuri.