发生了什么
据《科技时报》报道,HUMAIN 于 9 月 3 日在利雅得举行的 LEAP 2026 上推出了 humain-m3。据报道,该模型包含 4280 亿个参数的专家混合模型,基于 MiniMax M3 开放权重,并在超过 1 万亿个阿拉伯原生代币上进行了进一步训练。 HUMAIN 声称在七个阿拉伯语基准中的平均分达到 89.37%,但结果尚未提交给独立的开放阿拉伯语 LLM 排行榜。
据《科技时报》报道,沙特公共投资基金支持的人工智能公司 HUMAIN 在利雅得举行的 LEAP 2026 上推出了 humain-m3。该报告将其描述为基于 MiniMax M3 的 4280 亿参数混合专家模型,而不是在沙特阿拉伯从头开始构建和训练的模型。据报道,MiniMax 提供了阿拉伯语版本,之后 HUMAIN 继续对超过一万亿个阿拉伯语原生内容进行预训练。
该报告称,humain-m3 每个 token 激活大约 230 亿个参数,并针对长上下文使用 MiniMax 的稀疏注意力方法。据报道,HUMAIN 声称 AlGhafa、ArabicMMLU、Arabic EXAMS、MadinahQA、AraTrust、ALRAGE 和 Translated MMLU 的平均加权平均率为 89.37%。 《科技时报》表示,这些分数是在 HUMAIN 的基础设施上产生的,尚未提交给开放阿拉伯语 LLM 排行榜,因此所声称的结果尚未得到独立证实。
Tech Times 报道称,现在可以通过 HUMAIN Node 开发者平台为开发者和企业提供研究预览。消息来源不提供定价。 HUMAIN 的目标是在 MiniMax 社区许可证下于 2026 年 10 月发布模型权重,并为创收部署提供单独的商业条款。因此,一般自托管可用性尚未得到确认。
为什么这很重要
这次发布展示了一种务实且具有地缘政治意义的主权人工智能方法:沙特阿拉伯正在当地基础设施上部署以阿拉伯语为重点的模型,同时依赖中国 MiniMax 开发的架构和权重。如果独立复制,所报告的分数可能会极大地改变阿拉伯语人工智能的竞争格局。但目前,由于评估环境不同,无法将声称的领先优势与公开排名的区域模型直接进行比较。
据报道,此次发布对于阿拉伯语应用程序来说可能非常重要,因为 HUMAIN 表示,除了书面阿拉伯语之外,该模型还涵盖沙特语、马格里布语、埃及语和黎凡特语族方言。据 Tech Times 报道,该消息来源并未独立测试这些功能,因此方言性能的广度和质量仍然是 HUMAIN 声称的。
模型的出处也很重要。据《科技时报》报道,通过 HUMAIN Node 进行的推理运行在沙特基础设施上,而不是 MiniMax 托管的中国服务器上,这改变了用户的直接数据路由问题。它并没有消除对许可、技术支持、模型权重来源或依赖中国开发的基金会的法律和治理影响等更广泛的担忧。
互动机制:它实际上是如何运作的
以交互方式探索这一发展背后的基础技术。
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
接下来看什么
关键的验证事件是 HUMAIN 计划于 2026 年 10 月在 MiniMax 社区许可证下发布 humain-m3 权重。然后,研究人员可以通过 OALL 管道测试该模型,并评估方言性能、安全性、许可限制,以及报告的基准优势是否能够通过独立评估。
独立评估是未解决的核心问题。 Tech Times 报道称,评估后端之间的差异可能会改变阿拉伯语基准分数,并且 HUMAIN 的结果尚不能直接与 Falcon-H1 阿拉伯语、Fanar 或阿拉伯语-DeepSeek-R1 的 OALL 分数进行比较。十月份的权重发布将允许对公共基础设施进行可重复的测试。
开发人员应在将 humain-m3 视为普遍可用之前验证实际发布日期、模型卡文档、安全评估、支持的方言、硬件要求和许可条款。消息来源报告了当前的 HUMAIN Node 预览版,但没有给出价格,也没有确定模型权重或商业部署权现在是否可用。