Техническо РЪКОВОДСТВО

Mixtral и Sparse модели

Mixtral е отвореният модел за смесване на експерти на Mistral AI, който осигурява качество на голям модел при скорост на малък модел.

2 min readПоследна актуализация

Преглед

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

Дълбоко гмуркане

Mixtral 8x7B, пуснат от Mistral AI в края на 2023 г., популяризира подхода на разредената смес от експерти (MoE) в отворените модели. Той съдържа осем отделни „експертни“ мрежи за предаване напред на слой, с около 47 милиарда общи параметри, но олекотен рутер избира само двама експерти за всеки токен. В резултат на това само приблизително 13 милиарда параметъра са активни на токен, така че изводът работи приблизително толкова бързо, колкото 13B плътен модел, като същевременно достига качество, сравнимо с много по-големи. Mixtral съвпада или победи GPT-3.5 и Llama 2 70B на много показатели, като същевременно беше по-бърз и по-евтин за обслужване. По-късно Mistral пусна Mixtral 8x22B. Моделът е открито лицензиран под Apache 2.0, което стимулира бързото приемане и фина настройка в общността с отворен код.

Техническа информация

В рядък MoE слой, плътният блок за предаване напред се заменя с N експертни мрежи плюс малка стробираща мрежа (рутер). За всеки токен рутерът изчислява резултати и избира най-добрите k експерти (топ-2 в Mixtral), насочвайки токена само през тях. Техните резултати се претеглят и сумират. Тъй като повечето експерти остават неактивни за токен, моделът държи много параметри в паметта, но прави много по-малко изчисления. Компромисът: всички експерти трябва да бъдат заредени във VRAM, въпреки че само някои работят.

Стратегическо въздействие

Cost and budget

Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.

Clearer decisions

Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.

Quality control

По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.

Бъдещето на моделите Mixtral и Sparse

Sparse MoE вече е централно за граничния AI. Очаквайте по-отворени издания на MoE, по-фино маршрутизиране с много малки експерти и споделени или хибридни експертни дизайни, които подобряват ефективността допълнително. Тъй като моделите се мащабират към трилиони общи параметри, разредността е основният лост за поддържане на изводите достъпни. Изследванията се занимават със слабите места на MoE, балансирането на натоварването между експертите, натоварването на паметта и стабилността на обучението, докато хардуерът и обслужващите стекове все повече се оптимизират специално за експертно маршрутизиране.

Внедряване в реалния свят

Обслужване на висококачествен чатбот на цената и скоростта на много по-малък плътен модел

Самостоятелно хостване на лицензиран модел Apache-2.0 за търговски продукти без такси за използване

Фина настройка на индивидуалното поведение на Mixtral за кодиране, обобщаване или многоезични задачи

Изпълнение на бързи изводи на единичен мулти-GPU сървър, където 70B плътен модел би бил твърде бавен

Рискове и предпазни огради

Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.

Разходите за инфраструктура и поддръжка често се подценяват.

Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.

Пътна карта за изпълнение

1

Определете целите за латентност, качество и разходи преди внедряването.

2

Бенчмарк при реалистични условия на натоварване и данни.

3

Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.

4

Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Паралелизъм на модел и конвейер

Frequently asked questions

What is Mixtral and Sparse Models?

Mixtral е отвореният модел за смесване на експерти на Mistral AI, който осигурява качество на голям модел при скорост на малък модел. Разредените модели като него активират само част от своите параметри на токен, намалявайки изчисленията, без да жертват възможностите.

В Mixtral 8x7B колко експерти обработват всеки отделен токен?

Mixtral използва топ-2 маршрутизиране: рутерът избира двама от осемте експерти за обработка на всеки токен.

Какъв компонент решава до кои експерти се изпраща токен?

Малка стробираща мрежа, наречена рутер, оценява експертите и избира кои да обработват всеки токен.

Въпреки че Mixtral 8x7B има общо около 47B параметри, колко приблизително са активни на токен?

Тъй като само двама експерти работят на токен, приблизително 13 милиарда параметри са активни, което му придава скоростта на много по-малък модел.

Какъв е ключов компромис от оскъдни модели на MoE като Mixtral?

MoE спестява изчисления на токен, но все пак изисква всички експерти да бъдат държани във VRAM, което увеличава нуждите от памет.

Под какъв лиценз Mistral AI пусна Mixtral, подхранвайки отвореното приемане?

Mixtral беше пуснат под разрешителния лиценз Apache 2.0, позволяващ безплатна търговска употреба и фина настройка.