Sebastian Raschka
@rasbt
MiMo-V2.6“简直”是最好的(目前)。尽管其架构设计简单,但它目前在开放权重基准测试(加权平均)中排名第一。
我所说的“简单”是指经典的分组查询注意力(GQA)和滑动窗口注意力(SWA),窗口大小很小,只有 128 个令牌。
因此,这强调了我近几个月来一直试图提出的观点之一:大部分进展仍然来自数据和训练后配方的改进。花哨的注意力变体主要是效率调整。
训练数据改进和配方改进有哪些? MiMo 团队分享了一份非常详细的技术报告。其中有很多值得仔细消化的地方,但简而言之,有一些突出的事情:
1、代理任务增加;还跨不同的安全带进行训练(在保持安全带上的平均 DeepSWE pass@1 准确率从大约 50% 提高到 66%)。
2.更好的奖励信号:他们用代理评分器取代了简单的正确性验证器,该评分器也查看执行轨迹。
3. 大型 RL 批次(1,568 个提示 × 16 次部署 = 25,088 个轨迹)和每次更新 2.7-37 亿个训练令牌(但不清楚前身使用了什么)。