Смес от експерти
Смес от експерти (MoE) е дизайн на модел, който разделя мрежата на много специализирани подмрежи и активира само няколко на вход.
Преглед
It lets models hold enormous knowledge while keeping each prediction fast and cheap.
Дълбоко гмуркане
Стандартен трансформатор пуска всеки вход през едни и същи плътни слоеве, така че правенето на модела по-интелигентен обикновено означава оскъпяване на всяко изчисление. Смес от експерти прекъсва тази връзка. Той заменя големия слой за предаване с много по-малки „експертни“ мрежи плюс малък „рутер“, който решава кои експерти обработват всеки токен. Обикновено само най-добрите 1 или 2 експерти се задействат, така че един модел може да има стотици милиарди общи параметри, но да активира само малка част на токен. Ето защо модели като Mixtral 8x7B и слуховата архитектура зад GPT-4 достигат високо качество без пропорционално високи разходи за изводи. Компромисът е сложността: всички експерти все пак трябва да се поберат в паметта и рутерът може да пренасочи или претовари някои експерти, така че обучението изисква внимателно балансиране.
Техническа информация
Сърцето на MoE е стробиращата мрежа, малък научен слой, който оценява всеки експерт за входящ токен и насочва токена към първите k най-добри резултати (често k=1 или 2). За да спре рутера да изпраща всичко на няколко любими експерти, обучението добавя спомагателна „загуба при балансиране на натоварването“, която наказва неравномерното използване. Тъй като само k експерти работят на токен, изчисленията (FLOPs) остават приблизително постоянни дори когато добавите повече експерти, така че общите параметри и разходите за токен се мащабират независимо.
Стратегическо въздействие
Cost and budget
Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.
Clearer decisions
Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.
Quality control
По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.
Бъдещето на смесица от експерти
MoE се превръща в инструмент по подразбиране за гранични модели, защото отделя капацитета от разходите. Очаквайте по-фини експерти, по-интелигентно маршрутизиране, което отчита повече контекст, и по-добри техники за обслужване на огромни редки модели на ограничен хардуер. Изследванията също се занимават с проблема с паметта, тъй като всички експерти трябва да бъдат заредени, въпреки че малцина работят, чрез експертно разтоварване и квантуване. Тъй като отворените модели като Mixtral и DeepSeek-MoE стават зрели, редките архитектури вероятно ще захранват по-ефективни асистенти при по-малки бюджети за GPU.
Внедряване в реалния свят
Mixtral 8x7B използва 8 експерта и активира 2 на токен, като дава приблизително 47B общи параметри, но само ~13B активни на токен за по-бързи и по-евтини изводи.
DeepSeek и Qwen доставят големи езикови модели на MoE, които съответстват на плътни модели на бенчмаркове, като същевременно работят с по-ниско изчисление за токен.
Облачните LLM доставчици използват MoE, така че един огромен модел може да обслужва много потребители достъпно, тъй като всяка заявка осветява само няколко експерти.
По-ранният Switch Transformer на Google е мащабиран до над трилион параметри с помощта на топ-1 маршрутизиране, за да поддържа обучаващите изчисления управляеми.
Рискове и предпазни огради
Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.
Разходите за инфраструктура и поддръжка често се подценяват.
Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.
Пътна карта за изпълнение
Определете целите за латентност, качество и разходи преди внедряването.
Бенчмарк при реалистични условия на натоварване и данни.
Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.
Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixture of Experts quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Смес от LoRA експерти
Frequently asked questions
What is Mixture of Experts?
Смес от експерти (MoE) е дизайн на модел, който разделя мрежата на много специализирани подмрежи и активира само няколко на вход. Той позволява на моделите да притежават огромни знания, като същевременно поддържа всяка прогноза бърза и евтина.
Какво решава кои експерти да обработват даден токен в слой смесени експерти?
Малка стробираща мрежа се научава да оценява всеки експерт за токена и го насочва към тези с най-висок резултат. Маршрутизирането се научава, не е фиксирано или произволно.
Защо един модел на MoE може да има много повече общи параметри от плътен модел без съответстващо увеличение на цената на токен?
Тъй като само най-добрите k експерти се задействат на токен, активните изчисления остават приблизително постоянни, дори когато общият брой на параметрите нараства чрез добавяне на повече експерти.
Какъв проблем адресира загубата при балансиране на натоварването (спомагателна) по време на обучението на MoE?
Без да балансира, рутерът предпочита шепа експерти. Спомагателната загуба наказва неравномерното използване, така че всички експерти да бъдат обучени.
Mixtral 8x7B активира 2 от своите 8 експерти на токен. Какво означава това за неговите изчисления спрямо неговия размер?
При само 2 от 8 активни експерта, активните параметри на токен (~13B) са много по-малки от общо ~47B, което намалява разходите за изводи.
Кой е истинският недостатък на моделите на MoE в сравнение с еднакво способните плътни модели?
Въпреки че само няколко експерти изчисляват за токен, теглата на всеки експерт трябва да бъдат заредени в паметта, което прави моделите на MoE гладни за памет за обслужване.