9 月 22 日,小米发布并开源 MiMo-V2.6 系列:全模态旗舰 MiMo-V2.6-Pro、高效推理模型 MiMo-V2.6-Flash,以及把输出速度最高拉到 20 倍的 UltraSpeed 模式。团队同步开源了模型权重、技术报告、蒸馏模型与配套 RL 研究资源,并称这轮训练"可能是开源模型团队迄今规模最大的单次 RL 训练之一"。据媒体报道,这轮大规模强化学习耗资约 347 万美元。
[1][2]这不是一次普通的"发新模型"。小米把这代模型明确挂在 RSI(递归自我改进)路径上:官方口径是"在可验证的复杂任务上扩展 RL 算力,让模型通过探索与反馈持续拓展能力边界"。翻译成大白话——与其把预算花在更大的预训练语料上,不如把钱砸进强化学习,让模型在真实的 agent 任务里自己迭代。开源的部分同样超出"权重"本身:7k+ 个高质量 RL 任务环境,覆盖软件工程、漏洞复现、知识型工作、网页设计开发四类 agent 任务,连训练配方一起放出。
从结果看,这轮投入换到了开源阵营的头部位置。小米官方称 MiMo-V2.6-Pro 在综合智能指数(AA 指数)榜单位列开放权重模型第一,也是榜单上排名最高的中国模型——超过 Kimi K3 与 GLM-5.3。旗舰是原生全模态(文字、图像、视频、音频一体),万亿参数级别的稀疏 MoE 架构,同时提供蒸馏到 Qwen-9B 的版本和 UltraSpeed 高速档。这些数字的传播意义在于:开源模型与闭源旗舰的差距叙事,正在从"差一代"变成"差一档",而拉开这一档的正是 RL 算力,不是数据规模。
值得算一笔账。347 万美元一轮 RL,对闭源大厂是小钱,对开源团队是重注——它买来的不是参数,而是"开源权重的智能指数第一"这个位置。这件事最值得观察的不是小米一家,而是信号本身:当开源阵营开始用真金白银堆单轮 RL,开源与闭源的竞争轴就从"能不能做出"转向"敢不敢烧钱训练"。RL 训练配方和任务环境的开源也让社区第一次能复现"开源第一"的完整路径。当然要标注口径:智能指数排名与"可能最大规模"均为官方与媒体报道口径,旗舰跑分依赖 AA 指数这类第三方聚合,347 万美元同样来自媒体转述;这些数字在独立复算前都应视为"一方称"。
[1][2]