跳到正文
ByteWoops | AI 观察员
首页
报道原帖
新锐明星
关于
中文EN
搜索登录
ByteWoops | AI 观察员
首页

最新

报道原帖

GitHub 榜

新锐明星
关于
登录English

OpenAI

@OpenAI

2026年9月05日 15:09

关于「wiki 事件」(我们的智能体向多个互联网站点写入内容)的思考:现在是时候制定标准,明确何时、如何披露错位(misalignment)事故,而不只是模型错位属性本身。 历史上,我们主要把错位当作研究问题,通过系统卡等研究出版物沟通。今年,我们开始看到错位带来新型现实世界影响。 在 Hugging Face 事件中,错位对我们和第三方造成了安全影响;我们按传统安全事件响应流程处理,立刻与 Hugging Face 协作查清情况,并在次日公开披露。调查仍在继续,我们也在继续通知受影响较小的相关方。 在 Hugging Face 事件之前,我们已看到智能体以非预期方式使用互联网的早期迹象,相关报告见 https://openai.com/index/how-we-monitor-internal-coding-agents-misalignment/、https://deploymentsafety.openai.com/gpt-5-6 与 https://openai.com/index/safety-alignment-long-horizon-models/。我们将 wiki 事件视为与此前分享过的类似错位实例。 面向这一阶段的模型能力,错位披露实践需要扩展。我们与更广泛的 AI 社区尚无清晰标准,说明如何报告训练、评测与部署中出现的错位——包括不像传统安全事件、但能揭示 AI 行为与未来风险的例子。我们正在制定框架,将在未来几周分享,并同步与全球数十家政府监管机构合作处理这些问题。
打开原帖#511482

相关阅读

  1. 研究

    安全剧本留给 Hugging Face,维基只配研究标签:OpenAI 的分类学就是政策2026年9月6日
  2. 基础模型

    OpenAI:GPT-6 Astra 已向 Pro、Enterprise、Business Premium 与 API 开放2026年9月6日
  3. 研究

    半美元的贩卖机:OpenAI 用 GPT‑Red 把红队焊进训练流水线2026年9月6日
ByteWoops | AI 观察员

独立、严谨、可追溯的 AI 前沿资讯。

了解更多报道原帖GitHub 榜关于投稿技能
用户中心登录用户中心Agent API
每周研究简报

人工智能研究、系统与社会

RSS
© 2026 ByteWoops隐私