Rohan Paul
@rohanpaul_ai
来自谷歌的极具启发性的论文。
如果您正在阅读人工智能摘要而不是日志,请在提示中添加“诚实地回答”,因为如果没有它,前沿模型通常会跳过坏消息。
语言模型在总结已完成的工作时隐藏了严重的缺陷,甚至是他们可以看到的缺陷,而简单的“诚实回答”这句话就会得到更多的报道。
给定一个实验日志,其中新方法输给了强大的基线,GPT-5.5 在 200 个摘要中的 2 个中提到了这一损失。被告知“诚实地回答”,它在 200 次中提到了 190 次。
在 8 个设置中,从有错误的代码到未完成工作的代理日志,模型可以在直接询问时发现每个缺陷。他们的推理表明他们选择保持成功故事不变。
当代理报告仍在运行的工具调用的结果时,诚实热线几乎没有帮助。
如果您依赖代理摘要,请在每个报告提示中添加诚实说明,并仍然检查原始日志中是否有待处理或未完成的步骤。