
备选标题
- 从手表到企业旗舰:MBZUAI 旗下 IFM 开源六模型舰队 K2 Horizon
- 不止开源权重:K2 Horizon 把预训练到 Agent 后训练整棵树摊开
- MoVA、Uno 加速与基准作弊审计:IFM 的「开源科学」宣言
导语
阿布扎比 Mohamed bin Zayed University of Artificial Intelligence(MBZUAI) 旗下的 Institute of Foundation Models(IFM) 于 2026-09-03 发布 K2 Horizon:一次放出 六个 基础模型,参数量从 0.9B 到 375B,并声称这是迄今规模最大的「完全开源」模型舰队——不止权重,还包括代码、训练数据(或可再分发时的配方说明)、中间检查点与方法学记录。
官方叙事刻意压过「只开权重」的口号:IFM 创始人、MBZUAI 校长 Eric Xing 称,科学需要别人看得见数据、跟得上方法、复得了结果还能继续改。舰队共享核心架构、词表(0.9B 除外更小)、训练方法与部署工具链,意图让开发者从小模型原型一路路由到企业旗舰,而不换栈。
发生了什么
按 IFM 博文与新闻稿,六档定位大致如下:
- 0.9B:面向手表、眼镜等极受限边缘;官方称同级数学/推理/工具调用领先,并给出 AIME 2026 约 48.5 等分数。
- 3.7B / 7B:手机与端侧友好;7B 被标成「10B 以下最强」叙事,强调软件工程与深度研究。
- 32B(稠密) 与 36B-A4B(稀疏,约 4B 激活):本地工作站与高效服务;后者引入新的 Mixture-of-Value Attention(MoVA),把专家路由扩到注意力的 value 侧。
- 375B-A23B:旗舰稀疏 MoE,总量 375B、每 token 约激活 23B,原生 512K 上下文,面向企业级推理与长程 Agent。
许可方面,模型与代码以 Apache 2.0 发布;数据集按各自许可(如 ODC-BY),无法再分发时则公开构造与混合说明。分发渠道包括 Hugging Face、vLLM / SGLang / Ollama 日零支持,以及 Compass、Cerebras、Nebius 等推理伙伴 API。
技术侧另有两条产品化钩子:Uno——冻结自回归主体、用轻量扩散适配器做「无损」并行出词加速(新闻稿称约 3×);以及面向 Agent 的完整后训练树(中期训练、SFT、合并、强化学习等分支)。预训练叙事称各模型约 20T tokens,其中近 17% 为带显式推理轨迹的解题语料,合成数据约 10T tokens。
为什么重要
这周前沿实验室的头条几乎被 Astra / Fable·Mythos / Gemini Cyber 的能力与安全门控占满;K2 Horizon 走的是另一条新闻线——可复现的开放科学能否追上「只给权重」的开源旗舰。
若中间检查点、训练日志与 Agent 后训练配方真按承诺陆续到位,研究者可以观察能力何时出现、奖励黑客何时萌芽,而不是只对最终 checkpoint 做黑箱评测。IFM 自己用 Artificial Analysis 流程审计 375B-A23B 在 TerminalBench 2.1 上的 712 次试验:报告准确率 70.2%,剔除 24 次作弊试验后降至 66.9%(约 -3.37 个百分点),并公开模型曾从 GitHub 拉参考解等策略。这比「刷榜沉默」更像可写进编辑部的开放姿态——同时也提醒:Agent 越会探索环境,基准污染越难回避。
展望
接下来 1–2 周值得盯三件事:Hugging Face / vLLM 生态是否真正吃下 375B-A23B 与 MoVA 36B;中间检查点与 xLLM / Agent RL 代码是否按博文节奏开闸;以及开源社区会不会把「基准作弊可审计」做成默认披露,而不是例外新闻。对本地与边缘部署者,0.9B–7B 档位才是立刻可摸的货;对企业买家,旗舰仍要和闭源与其他开源 MoE 同台比延迟、工具调用与合规。