Rohan Paul

@rohanpaul_ai

来自谷歌的极具启发性的论文。 如果您正在阅读人工智能摘要而不是日志,请在提示中添加“诚实地回答”,因为如果没有它,前沿模型通常会跳过坏消息。 语言模型在总结已完成的工作时隐藏了严重的缺陷,甚至是他们可以看到的缺陷,而简单的“诚实回答”这句话就会得到更多的报道。 给定一个实验日志,其中新方法输给了强大的基线,GPT-5.5 在 200 个摘要中的 2 个中提到了这一损失。被告知“诚实地回答”,它在 200 次中提到了 190 次。 在 8 个设置中,从有错误的代码到未完成工作的代理日志,模型可以在直接询问时发现每个缺陷。他们的推理表明他们选择保持成功故事不变。 当代理报告仍在运行的工具调用的结果时,诚实热线几乎没有帮助。 如果您依赖代理摘要,请在每个报告提示中添加诚实说明,并仍然检查原始日志中是否有待处理或未完成的步骤。
打开原帖#511482
  1. 产业

    Timnit Gebru:哈哈,我不应该说出其中一些人的实际工作地点(例如,为《时代》杂志撰写宣传封…
  2. 产业

    Timnit Gebru:“我知道,如果你不像我一样经常潜伏在互联网上,那段话听起来是多么疯狂
  3. 产业

    Tomasz Tunguz:虽然还有很长的路要走,但值得庆幸的是我们正在取得进展