Rohan Paul@rohanpaul_ai2026年10月10日 10:08Anthropic 明确表示:模型对自己推理过程的解释,不能当作其行为原因的可信证据——这也正是他们无法干净判断每一起失败有多严重的原因。打开原帖#511482