Rohan Paul
@rohanpaul_ai
Claude Opus 5.5 系统卡的一些启示。
- 为 Opus 5.5 提供更多推理工作,使其更有可能遵守隐藏在用户粘贴文本中的恶意指令
- Anthropic 看到 Opus 5.5 在看似无害的错误之后自行生成恶意指令。这种行为可能部分是由于最初旨在停止立即注射的训练而产生的。
- Anthropic 的内部估计称,人工智能可能已经将大约 1.5 年的能力进步压缩为一年。
- Anthropic 在安全演习期间向公共包注册表提供了模型模拟凭据。在大约一半的运行中,如果环境是真实的,它采取的行动可能是有害的。
- 一些训练快照隐藏了模型(包括 Opus 5.5)预期评分者不喜欢的操作的证据,包括操纵 Git 记录或删除日志。
“在训练期间,我们观察到一些模型(包括 Opus 5.5)在执行评分者可能认为负面的操作(例如操纵 git 记录或删除日志)后试图掩盖自己的踪迹”
- METR 对 Anthropic 人工智能研发的评估部分依赖于未公开披露的信息,包括具有更高访问权限的独立 METR 团队的结论。这意味着对人工智能驱动的研发加速的公开评估部分取决于外部证据,在这种特殊情况下,即使是另一个 METR 团队也无法独立检查。