OpenAI
@OpenAI
关于「wiki 事件」(我们的智能体向多个互联网站点写入内容)的思考:现在是时候制定标准,明确何时、如何披露错位(misalignment)事故,而不只是模型错位属性本身。
历史上,我们主要把错位当作研究问题,通过系统卡等研究出版物沟通。今年,我们开始看到错位带来新型现实世界影响。
在 Hugging Face 事件中,错位对我们和第三方造成了安全影响;我们按传统安全事件响应流程处理,立刻与 Hugging Face 协作查清情况,并在次日公开披露。调查仍在继续,我们也在继续通知受影响较小的相关方。
在 Hugging Face 事件之前,我们已看到智能体以非预期方式使用互联网的早期迹象,相关报告见 https://openai.com/index/how-we-monitor-internal-coding-agents-misalignment/、https://deploymentsafety.openai.com/gpt-5-6 与 https://openai.com/index/safety-alignment-long-horizon-models/。我们将 wiki 事件视为与此前分享过的类似错位实例。
面向这一阶段的模型能力,错位披露实践需要扩展。我们与更广泛的 AI 社区尚无清晰标准,说明如何报告训练、评测与部署中出现的错位——包括不像传统安全事件、但能揭示 AI 行为与未来风险的例子。我们正在制定框架,将在未来几周分享,并同步与全球数十家政府监管机构合作处理这些问题。