Sebastian Raschka

@rasbt

MiMo-V2.6“简直”是最好的(目前)。尽管其架构设计简单,但它目前在开放权重基准测试(加权平均)中排名第一。 我所说的“简单”是指经典的分组查询注意力(GQA)和滑动窗口注意力(SWA),窗口大小很小,只有 128 个令牌。 因此,这强调了我近几个月来一直试图提出的观点之一:大部分进展仍然来自数据和训练后配方的改进。花哨的注意力变体主要是效率调整。 训练数据改进和配方改进有哪些? MiMo 团队分享了一份非常详细的技术报告。其中有很多值得仔细消化的地方,但简而言之,有一些突出的事情: 1、代理任务增加;还跨不同的安全带进行训练(在保持安全带上的平均 DeepSWE pass@1 准确率从大约 50% 提高到 66%)。 2.更好的奖励信号:他们用代理评分器取代了简单的正确性验证器,该评分器也查看执行轨迹。 3. 大型 RL 批次(1,568 个提示 × 16 次部署 = 25,088 个轨迹)和每次更新 2.7-37 亿个训练令牌(但不清楚前身使用了什么)。
打开原帖#511482
  1. 研究

    Andrew Ng:过去两周,引发对人工智能危险担忧的最响亮的声音取得了巨大进展
  2. 研究

    Jeff Dean:很自豪能与许多其他人在其中很多事情上合作
  3. 研究

    Jeff Dean:Waymo的安全数据越来越好