Техническое РУКОВОДСТВО

Микстральные и разреженные модели

Mixtral — это открытая модель Mistral AI, объединяющая экспертов, которая обеспечивает качество больших моделей при скорости малых моделей.

2 минуты чтенияПоследнее обновление

Обзор

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

Глубокое погружение

Mixtral 8x7B, выпущенный Mistral AI в конце 2023 года, популяризировал подход разреженной смеси экспертов (MoE) в открытых моделях. Он содержит восемь отдельных «экспертных» сетей прямой связи на каждом уровне с общим количеством параметров около 47 миллиардов, но легкий маршрутизатор выбирает только двух экспертов для каждого токена. В результате на каждый токен активны только примерно 13 миллиардов параметров, поэтому вывод выполняется примерно так же быстро, как модель с плотностью 13B, при этом достигая качества, сравнимого с гораздо более крупными моделями. Mixtral соответствовал или превосходил GPT-3.5 и Llama 2 70B во многих тестах, будучи быстрее и дешевле в обслуживании. Позже Mistral выпустила Mixtral 8x22B. Модель открыта под лицензией Apache 2.0, что способствует ее быстрому внедрению и доработке в сообществе разработчиков ПО с открытым исходным кодом.

Техническая информация

На разреженном слое MoE плотный блок прямой связи заменяется N экспертными сетями плюс небольшой шлюзовой сетью (маршрутизатором). Для каждого токена маршрутизатор подсчитывает баллы и выбирает топ-k экспертов (топ-2 в Mixtral), направляя токен только через них. Их результаты взвешиваются и суммируются. Поскольку большинство экспертов бездействуют в расчете на токен, модель хранит в памяти множество параметров, но выполняет гораздо меньше вычислений. Компромисс: все эксперты должны быть загружены в VRAM, даже если запускаются только некоторые.

Стратегическое воздействие

Стоимость и бюджет

Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.

Более четкие решения

Техническое образование помогает командам выбрать правильный стек, а не только самый новый.

Контроль качества

Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.

Будущее микстральных и разреженных моделей

Разреженные МО теперь играют центральную роль в передовом искусственном интеллекте. Ожидайте большего количества открытых выпусков MoE, более детальной маршрутизации с участием множества мелких экспертов, а также совместных или гибридных экспертных проектов, которые еще больше повысят эффективность. Поскольку модели масштабируются до триллионов общих параметров, разреженность становится основным рычагом, позволяющим сделать выводы доступными. Исследования направлены на устранение слабых мест MoE, балансировку нагрузки между экспертами, нагрузку на память и стабильность обучения, в то время как аппаратное обеспечение и обслуживающие стеки все чаще оптимизируются специально для маршрутизации экспертов.

Реальная реализация

Обслуживание высококачественного чат-бота по цене и скорости гораздо меньшей плотной модели.

Самостоятельное размещение лицензионной модели Apache-2.0 для коммерческих продуктов без платы за использование.

Точная настройка индивидуального поведения на Mixtral для кодирования, обобщения или многоязычных задач.

Выполнение быстрого вывода на одном сервере с несколькими графическими процессорами, где модель с плотностью 70 байт будет слишком медленной.

Риски и ограничения

Оптимизация одного теста может скрыть более широкие недостатки системы.

Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.

Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.

Дорожная карта реализации

1

Определите целевые показатели задержки, качества и стоимости перед внедрением.

2

Тестирование при реалистичной нагрузке и условиях данных.

3

Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.

4

Перед масштабированием подготовьте пути отката и реагирования на инциденты.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Параллелизм модели и конвейера

Часто задаваемые вопросы

What is Mixtral and Sparse Models?

Mixtral — это открытая модель Mistral AI, объединяющая экспертов, которая обеспечивает качество больших моделей при скорости малых моделей. Разреженные модели, подобные этой, активируют только часть своих параметров на токен, сокращая вычислительные ресурсы без ущерба для возможностей.

Сколько экспертов обрабатывают каждый отдельный токен в Mixtral 8x7B?

Mixtral использует маршрутизацию топ-2: маршрутизатор выбирает двух из восьми экспертов для обработки каждого токена.

Какой компонент решает, каким экспертам будет отправлен токен?

Небольшая шлюзовая сеть, называемая маршрутизатором, оценивает экспертов и выбирает, какие из них будут обрабатывать каждый токен.

Хотя Mixtral 8x7B имеет около 47B параметров, сколько примерно активных параметров приходится на один токен?

Поскольку на каждый токен работают только два эксперта, активно около 13 миллиардов параметров, что обеспечивает скорость гораздо меньшей модели.

В чем состоит ключевой компромисс редких моделей MoE, таких как Mixtral?

MoE экономит вычислительные ресурсы на каждый токен, но по-прежнему требует, чтобы все эксперты хранились в VRAM, что увеличивает потребности в памяти.

Под какой лицензией Mistral AI выпустила Mixtral, что способствовало открытому внедрению?

Mixtral был выпущен под разрешительной лицензией Apache 2.0, позволяющей бесплатное коммерческое использование и тонкую настройку.