一篇 9 月 22 日提交的 arXiv 论文(arXiv:2609.26704,作者含 Rémi Munos、Julia Kempe 等)把矛头指向大模型推理里最常用的"笨办法":朴素重复采样——画很多次独立答案,赌其中一次是对的。论文指出这种采样只通过局部的解码噪声探索,产出的多是近似重复的尝试而不是真正不同的思路;他们提出在语义层面引导探索:先采样问题特定的概念、提示或策略,再用它们条件化答案生成,并把概念生成器训练成可学习的"搜索策略"——一个小模型经过强化学习优化,让它的概念最大化一个更大的、冻结的答案生成器的成功率。

[1][2]

先说为什么这个问题值得较真。测试时算力(test-time compute)是当下推理成本的大头,各家都在加长思考链、多跑几次采样,但论文的核心观察是:重复采样花在"同一个想法"上的次数远多于"不同想法"。局部解码噪声只会让答案在细节上打转,思路空间没有被真正探索。研究者于是把问题拆成两段:答案生成之前,先决定"想哪些概念";答案生成阶段,只负责把概念兑现成推导。这等于给大模型装了一个语义层面的方向盘,而不是继续加大油门。

论文的主结果有三层。第一,在硬数学推理问题上,同一答案生成预算下,概念引导的 pass@k 显著超过朴素重复采样——同样的钱,思路对了,答案自然到。第二,训练过的小概念生成器产出的概念,胜过从大得多、未调过的模型里采样的概念——也就是说,"想什么"这项能力可以被专门训练,而训练它不需要更大的模型。第三,迁移性:这个搜索策略可以作用在它从未训练过的答案生成器上,包括跨模型家族的模型——一个小模型可以训练成另一个大模型的"搜索外脑"。这与近期"蒸馏""推理效率"方向形成呼应:当模型能力差距缩小,测试时算力的使用方法(怎么想,而不是想多久)正在成为新的竞争维度。

口径与局限:结果基于论文报告的实验(硬数学推理、pass@k 与预算配比的比较),基准与模型组合以论文为准,未独立复测;"概念"的构造与训练目标(最大化冻结答案生成器的下游成功率)是本文特有设定,其收益在真实任务上的普适性尚待验证;论文没有给出概念生成本身的额外开销核算——搜索策略也需要成本,性价比账要等独立评估。

[1][2]
深夜的研究实验室,一名研究员背影坐在终端前,面前大屏上是一张具象的搜索路径图:左侧一个起点节点,从它分出许多条短枝挤在一起原地打转,其中一条长枝绕到画面右侧、经过一个亮点节点后分叉成几条答案枝;研究员一手在键盘上、一手拄着下巴,台灯与屏幕冷光混合,窗外是深夜城市。画面无任何文字与数字。
绕远路,找到新想法, AI 生成插画,非新闻照片