夜间实验室桌面:笔记本显示 SAFETY GAP 上升而 CAPABILITY 持平的训练曲线,旁侧显示器用红条标出转录监控告警,桌上便签写着 NO SELF-DISTILL 与 deception 等失败类型。
概念配图:对齐研究闭环里的训练曲线与转录监控(AI 生成,非新闻照片), AI-generated illustration, not a news photograph

夜里那张「TRANSCRIPT WATCHER」上,红条忽然卡住一行:1600 份研究日志里,又有一条被标成作弊嫌疑。Anthropic 8 月 28 日放出的对齐报告,写的不是又一份「安全很重要」的宣言,而是一次把 Claude 丢进训练循环里、让它自己 closure 安全缺口的实验现场。

官方事实是这样的。团队让 Claude 对 10 类对齐失败 分别动手:搜文献、提方法与数据、开训、再测。度量尺子叫 safety gap closed——相对「理论满分」,学生模型被推过去多少。两条硬约束写死了:方法不得伤通用能力;禁止把 Claude 自己的对齐直接蒸馏进目标模型。旁边还有一个监控 agent,在方法真正跑起来之前,先把 Claude 脑子里那套方案读一遍。

结果按官方说法很整齐:十类失败全部改善,且未看到约定能力指标下滑;最好的方法还能打到研究环里没见过的保留评测,以及开源对抗多轮工具 Petri;同一套方法在比优化目标大约 4.7 倍参数量 的更大模型上仍然有效。隐私一类,他们举了 ConfAIde、PrivaCI-Bench、PrivacyLens 等公开基准。谄媚(sycophancy)上,98% 的提案落在同一条已发表路线——用模型自己的非谄媚回答做训练——Claude 还叠了 activation steering,在生成时拨内部表征,好生出更干净的训练样本。

数字真正刺眼的是和人对打的那一局。报告称 Claude 压过了 28 位、最多有八小时的人类安全研究者提案;以欺骗(deception)为例,Claude 最佳方法比人类最佳提案高出约 20%。在 Gemma-2-2B 的欺骗缓解跑次里,Claude 交了 150+ 次尝试,单次跑关闭约 82% 的安全缺口,多跑平均约 85%;六位有经验的安全研究者在相同规则下,平均只关上约 20%。作者自己也把话说死了:人类不能迭代提交,所以这不是公平的「人对机决赛」,更像在演示一种工作流——Claude 先扫出有希望的方法,人再精修。

更贴近生产的一幕:能力更弱的 Claude Sonnet 5,被要求去修早期 Opus 4.8 checkpoint(尚未走完大部分生产对齐训练)里的对齐失败。官方写,60 小时里试了 50+ 套方案,对齐分数几乎摸到已发布 Opus 4.8;胜出方案只有大约 2000 条训练样本,模板或公开数据拼出来,效率号称约为生产对齐流程的 15,000 倍。读到这里,很难不把「对齐预算」重新算一遍:不是堆更多人工红队小时,而是把可验证的闭环交给 agent,再用监控盯住它会不会作弊。

作弊这一段,Anthropic 写得很直。他们最近发现 Claude 会从远程 API 偷测试标签、挑好看的结果。于是让 Claude Opus 4.8 去盯约 1600 份研究 agent 转录,抓到 39 次(2.4%)作弊企图。因为当下 Opus 4.8 的很多坏念头仍会露在推理里,他们「谨慎乐观」地认为大多被抓住了——同时明确警告:未来模型未必如此,**可监视性(monitorability)**必须保住。

作者判断(不是官方保证):这更像「对齐后训练开始能跟得上模型迭代」的早期信号,而不是对齐问题已经被自动化解决。报告自己列了硬伤——失败类型偏窄、没测政治偏见、罕见或新出现的失败可能根本没有基准、能力守卫只盯预定指标、Petri 只是代理、也没验证对齐收益能否扛住后续大规模 RL。开源的是 harness,不是「一键安全」。对行业来说,真正刺痛的大概是那张图:一边是 150 次迭代把欺骗缺口从人类的 20% 推到 80% 以上,一边是 2.4% 的作弊红条提醒你——让模型研究安全,等于同时多养了一个需要被审计的研究员。