技术指南

混合模型和稀疏模型

Mixtral 是 Mistral AI 的开放式专家混合模型,能够以小模型速度提供大模型质量。

阅读时间:2分钟最后更新

概述

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

深入探讨

Mistral AI 于 2023 年末发布的 Mixtral 8x7B 推广了开放模型中的稀疏专家混合 (MoE) 方法。它每层包含八个独立的“专家”前馈网络,总参数约为 470 亿个,但轻量级路由器仅为每个令牌选择两名专家。因此,每个令牌只有大约 130 亿个参数处于活动状态,因此推理运行速度与 13B 密集模型一样快,同时达到与更大模型相当的质量。 Mixtral 在许多基准测试中匹配或击败了 GPT-3.5 和 Llama 2 70B,同时服务速度更快、成本更低。 Mistral 后来发布了 Mixtral 8x22B。该模型在 Apache 2.0 下公开许可,促进了开源社区的快速采用和微调。

技术洞察

在稀疏 MoE 层中,密集前馈块被 N 个专家网络加上一个小型门控网络(路由器)取代。对于每个令牌,路由器计算分数并选择前 k 个专家(Mixtral 中的前 2 个),仅通过这些专家路由令牌。它们的输出被加权并求和。由于大多数专家在每个令牌上都处于空闲状态,因此该模型在内存中保存了许多参数,但计算量却少得多。权衡:所有专家都必须加载到 VRAM 中,即使只有一些专家运行。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

混合模型和稀疏模型的未来

稀疏 MoE 现在是前沿人工智能的核心。预计会有更多开放的 MoE 版本、与许多小型专家一起进行更细粒度的路由,以及可进一步提高效率的共享或混合专家设计。随着模型扩展到数万亿个总参数,稀疏性是保持推理负担得起的主要杠杆。研究正在解决 MoE 的弱点、专家之间的负载平衡、内存开销和训练稳定性,而硬件和服务堆栈越来越多地专门针对专家路由进行优化。

现实世界的实施

以更小的密集模型的成本和速度提供高质量的聊天机器人

自托管商业产品的 Apache-2.0 许可模型,无需使用费

微调 Mixtral 上的个人行为以进行编码、摘要或多语言任务

在单个多 GPU 服务器上运行快速推理,其中 70B 密集模型会太慢

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

模型和管道并行性

常见问题

What is Mixtral and Sparse Models?

Mixtral 是 Mistral AI 的开放式专家混合模型,能够以小模型速度提供大模型质量。像它这样的稀疏模型只激活每个令牌的一小部分参数,在不牺牲能力的情况下减少计算量。

在 Mixtral 8x7B 中,有多少专家处理每个单独的令牌?

Mixtral 使用 top-2 路由:路由器选择八个专家中的两个来处理每个令牌。

哪个组件决定将令牌发送给哪些专家?

一个称为路由器的小型门控网络对专家进行评分并选择处理每个令牌的专家。

尽管 Mixtral 8x7B 总共有大约 47B 个参数,但每个代币大约有多少个活跃参数?

因为每个代币只有两名专家运行,所以大约有 130 亿个参数处于活动状态,这使其速度比一个小得多的模型要快。

像 Mixtral 这样的稀疏 MoE 模型的关键权衡是什么?

MoE 节省了每个代币的计算量,但仍然要求所有专家都保存在 VRAM 中,从而增加了内存需求。

Mistral AI 在哪个许可下发布了 Mixtral,推动了开放采用?

Mixtral 是在宽松的 Apache 2.0 许可证下发布的,允许免费商业使用和微调。