John Schulman

@johnschulman2

看好这个方向。有了解释质量的指标,才可能做爬山优化;反事实可模拟性看起来是对的。Adam 等人做了一个数据集与流水线,能构造比以往工作更多样、更贴近现实的测试用例,并做了有趣的实验。也可以训练模型写出更好的事后行为解释,这条讨论串也强调了这一点。 > 模型能否学会解释自己的行为,例如为何忽略用户请求或写出代码错误? > > 我们在数千条模型对自身真实场景行为的解释上做了训练。 > > 仅用这一通用数据集训练,就能泛化到留出评测。
打开原帖#728545
  1. 前沿

    10 亿美元给水厂和市政府:OpenAI 的 Daybreak 前线防御计划
  2. 研究

    五百万美元买尺子:Anthropic 把 AI 用户福祉评测交给外部专家
  3. 前沿

    最对齐,却更难盯:Astra 的思维链监视性在下降