一篇 9 月 18 日提交的 arXiv 论文(arXiv:2609.21492,LogicTrack)盯上了一个 CoT 推理的盲区:现有优化大多只看最终答案对不对,而模型完全可能"推理链是错的、答案却对了"。LogicTrack 的做法是把每一步自然语言推理自动形式化成符号表达,交给自动定理证明器逐步验证,并用求解器评分引导推理时的回溯搜索——在 8 个推理基准、7 个模型上的实验显示,中间步的有效性与最终答案通过率同时提升。
[1][2]先讲清楚它解决什么问题。CoT 让模型"把思考过程写出来",但现有的训练与评估几乎都是结果导向:答案对了就奖励,没人逐行检查中间推理。结果是模型可以靠记忆、模式匹配甚至瞎蒙凑出正确答案,而中间的"推理"是逻辑不通的。在高风险场景——医疗、金融、自动驾驶决策——"答案对但过程错"比"答案错"更难发现也更危险,因为人很难在每一条链上逐句复核。LogicTrack 的思路是给推理过程本身装一个审计器:把每一步翻译成形式逻辑,用定理证明器检验这一步是否真的从前面的步骤推出。
机制上它有两层。推理时,SBR(Solver-Based Backtracking Reward)给每一步打分,量化"逻辑健全程度",并据此引导回溯树搜索——发现某一步推不过去就回溯重试,而不是一路跑到错误答案;训练侧,研究者用回溯轨迹构造 SFT 数据,让微调后的模型把"逐步自我审计"内化成能力,而不是每次都要靠外部求解器。8 个基准、7 个模型的实验显示,最终答案通过率与推理链可验证性同时提升,消融与搜索策略变体也支持泛化性。这套"神经+符号"的组合并不新鲜(Logic-LM、Certified Deductive Reasoning 都是前驱),LogicTrack 的增量在于把验证从"事后检查"升级为"推理过程中的奖励信号"。
局限要写明:自动形式化本身可能失败或失真,复杂自然语言步骤翻译成符号时会有损耗;实验的提升幅度是相对基线(常见 CoT/自一致等)的,论文摘要没有给出全部基准的逐项数字;SBR 的回溯搜索在推理时增加计算开销,长链任务上的成本没有在摘要里量化;作者并未声称解决"形式化对了但问题理解错了"的更高层错误。整体上它补的是"过程审计"这一环,适合当作可信推理工具箱里的一件新工具,而不是推理正确性的终点。
[1][2]