Rohan Paul
@rohanpaul_ai
清华、牛津与斯坦福的新论文发现:即便关闭 thinking,LLM 仍会继续「大声推理」,尤其是在开放题上。
关闭 thinking 后,DeepSeek-V4-Flash 仍在 99.9% 的开放题答案里写出推理。缺少 think 标签或回答很短,并不能证明模型跳过了推理。
是/否题容易直接作答;选择题居中;开放题则不断把模型拉回推理。
在开放题上强制只给答案,可把 5 个模型的合规率提到约 40%,但准确率大约掉 15 个百分点。
– arxiv.org/abs/2610.11765
标题:"Thinking Inertia: LLMs Keep Thinking When Told Not To"