一篇 9 月 22 日提交的 arXiv 论文(arXiv:2609.26704,作者含 Rémi Munos、Julia Kempe 等)把矛头指向大模型推理里最常用的"笨办法":朴素重复采样——画很多次独立答案,赌其中一次是对的。论文指出这种采样只通过局部的解码噪声探索,产出的多是近似重复的尝试而不是真正不同的思路;他们提出在语义层面引导探索:先采样问题特定的概念、提示或策略,再用它们条件化答案生成,并把概念生成器训练成可学习的"搜索策略"——一个小模型经过强化学习优化,让它的概念最大化一个更大的、冻结的答案生成器的成功率。
[1][2]先说为什么这个问题值得较真。测试时算力(test-time compute)是当下推理成本的大头,各家都在加长思考链、多跑几次采样,但论文的核心观察是:重复采样花在"同一个想法"上的次数远多于"不同想法"。局部解码噪声只会让答案在细节上打转,思路空间没有被真正探索。研究者于是把问题拆成两段:答案生成之前,先决定"想哪些概念";答案生成阶段,只负责把概念兑现成推导。这等于给大模型装了一个语义层面的方向盘,而不是继续加大油门。
论文的主结果有三层。第一,在硬数学推理问题上,同一答案生成预算下,概念引导的 pass@k 显著超过朴素重复采样——同样的钱,思路对了,答案自然到。第二,训练过的小概念生成器产出的概念,胜过从大得多、未调过的模型里采样的概念——也就是说,"想什么"这项能力可以被专门训练,而训练它不需要更大的模型。第三,迁移性:这个搜索策略可以作用在它从未训练过的答案生成器上,包括跨模型家族的模型——一个小模型可以训练成另一个大模型的"搜索外脑"。这与近期"蒸馏""推理效率"方向形成呼应:当模型能力差距缩小,测试时算力的使用方法(怎么想,而不是想多久)正在成为新的竞争维度。
口径与局限:结果基于论文报告的实验(硬数学推理、pass@k 与预算配比的比较),基准与模型组合以论文为准,未独立复测;"概念"的构造与训练目标(最大化冻结答案生成器的下游成功率)是本文特有设定,其收益在真实任务上的普适性尚待验证;论文没有给出概念生成本身的额外开销核算——搜索策略也需要成本,性价比账要等独立评估。
[1][2]