Rohan Paul

@rohanpaul_ai

清华、牛津与斯坦福的新论文发现:即便关闭 thinking,LLM 仍会继续「大声推理」,尤其是在开放题上。 关闭 thinking 后,DeepSeek-V4-Flash 仍在 99.9% 的开放题答案里写出推理。缺少 think 标签或回答很短,并不能证明模型跳过了推理。 是/否题容易直接作答;选择题居中;开放题则不断把模型拉回推理。 在开放题上强制只给答案,可把 5 个模型的合规率提到约 40%,但准确率大约掉 15 个百分点。 – arxiv.org/abs/2610.11765 标题:"Thinking Inertia: LLMs Keep Thinking When Told Not To"
打开原帖#511482
  1. 产业

    Elon Musk:@ID_AA_Carmack 机器人汽车互相吵架 😂
  2. 产业

    Elon Musk:@anabology SpaceX 就是 Spacing Guild(但更友好)
  3. 产业

    Rohan Paul:「我确实喜欢 SI(超级智能)这个说法,因为 artificial(人工)…