Смесь экспертов
Смесь экспертов (MoE) — это модельный дизайн, который разбивает сеть на множество специализированных подсетей и активирует только несколько из них на каждый вход.
Обзор
It lets models hold enormous knowledge while keeping each prediction fast and cheap.
Глубокое погружение
Стандартный преобразователь пропускает все входные данные через одни и те же плотные слои, поэтому повышение «умности» модели обычно означает увеличение затрат на каждое вычисление. Смесь экспертов разрывает эту связь. Он заменяет большой уровень прямой связи множеством более мелких «экспертных» сетей плюс небольшой «маршрутизатор», который решает, какие эксперты обрабатывают каждый токен. Обычно работают только 1 или 2 лучших эксперта, поэтому модель может иметь сотни миллиардов общих параметров, но активировать лишь небольшую часть на каждый токен. Вот почему такие модели, как Mixtral 8x7B и, по слухам, архитектура GPT-4, достигают высокого качества без пропорционально высоких затрат на вывод. Компромисс заключается в сложности: все эксперты по-прежнему должны помещаться в памяти, а маршрутизатор может неправильно маршрутизировать или перегрузить некоторых экспертов, поэтому обучение требует тщательной балансировки.
Техническая информация
Сердцем MoE является шлюзовая сеть, небольшой обучаемый уровень, который оценивает каждого эксперта по входящему токену и направляет токен к топ-k, набравшим наибольшее количество баллов (часто k = 1 или 2). Чтобы маршрутизатор не отправлял всю информацию нескольким избранным экспертам, при обучении добавляются вспомогательные «потери балансировки нагрузки», которые наказывают за неравномерное использование. Поскольку на каждый токен работает только k экспертов, объем вычислений (FLOP) остается примерно постоянным, даже если вы добавляете больше экспертов, поэтому общие параметры и стоимость токена масштабируются независимо.
Стратегическое воздействие
Стоимость и бюджет
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Более четкие решения
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Контроль качества
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
Будущее смеси экспертов
MoE становится инструментом по умолчанию для моделей передового масштаба, поскольку он отделяет мощность от затрат. Ожидайте более детальных экспертов, более разумной маршрутизации, учитывающей больше контекста, и более эффективных методов обслуживания огромных разреженных моделей на ограниченном оборудовании. Исследования также решают проблему памяти, поскольку все эксперты должны быть загружены, даже если работают лишь немногие, посредством экспертной разгрузки и квантования. По мере развития открытых моделей, таких как Mixtral и DeepSeek-MoE, разреженная архитектура, вероятно, позволит создавать более эффективных помощников при меньшем бюджете графических процессоров.
Реальная реализация
Mixtral 8x7B использует 8 экспертов и активирует по 2 на каждый токен, что дает примерно 47 миллиардов параметров, но только ~ 13 миллиардов активных на токен для более быстрого и дешевого вывода.
DeepSeek и Qwen поставляют большие языковые модели MoE, которые соответствуют плотным моделям в тестах и при этом работают с меньшими вычислениями на токен.
Поставщики облачного LLM используют MoE, поэтому одна огромная модель может обслуживать множество пользователей по доступной цене, поскольку каждый запрос привлекает только несколько экспертов.
Предыдущий Switch Transformer компании Google масштабировался до более чем триллиона параметров с использованием маршрутизации top-1, чтобы обеспечить управляемость обучающих вычислений.
Риски и ограничения
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Дорожная карта реализации
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixture of Experts quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Смесь экспертов LoRA
Часто задаваемые вопросы
What is Mixture of Experts?
Смесь экспертов (MoE) — это модельный дизайн, который разбивает сеть на множество специализированных подсетей и активирует только несколько из них на каждый вход. Это позволяет моделям хранить огромные знания, сохраняя при этом каждый прогноз быстрым и дешевым.
Что определяет, какие эксперты обрабатывают тот или иной токен на уровне «Смешанные эксперты»?
Небольшая шлюзовая сеть учится оценивать каждого эксперта по токену и направляет его к экспертам с наибольшим количеством баллов. Маршрутизация изучается, а не является фиксированной или случайной.
Почему модель MoE может иметь гораздо больше общих параметров, чем плотная модель, без соответствующего увеличения стоимости токена?
Поскольку на каждый токен активируются только лучшие эксперты, активные вычисления остаются примерно постоянными, даже если общее количество параметров увеличивается за счет добавления новых экспертов.
Какую проблему решает потеря балансировки нагрузки (вспомогательной) во время обучения MoE?
Без балансировки маршрутизатор склонен отдавать предпочтение горстке экспертов. Вспомогательные потери наказывают за неравномерное использование, поэтому все специалисты проходят обучение.
Mixtral 8x7B активирует 2 из 8 своих экспертов за один токен. Что это означает в отношении его вычислительной мощности по сравнению с его размером?
Поскольку активны только 2 из 8 экспертов, активные параметры на один токен (~ 13 миллиардов) намного меньше, чем общее количество ~ 47 миллиардов, что снижает стоимость вывода.
В чем заключается настоящий недостаток моделей MoE по сравнению с моделями с такой же функциональностью и плотностью?
Несмотря на то, что только несколько экспертов вычисляют каждый токен, веса каждого эксперта должны быть загружены в память, что приводит к тому, что модели MoE требуют много памяти для обслуживания.