IT之家 9 月 29 日报道,OpenAI 当天通过官方新闻稿提出一套指导原则:企业在开展前沿 AI 的强化学习训练之前,要提交结构化的安全论证。本篇没有打开那篇官网稿。下面的内容是 IT之家的转述。

[1]
蛋彩:一条纸带停在三枚还没盖下的木戳前面。
纸带停在三枚未盖的木戳前。它对应训练要先经过多名高管,每个人都能否决。这是插画,不是文件照片。, AI 生成插画,不是新闻照片

安全论证要交给多名高级管理人员审查,每个人都有权否决这次训练。报道写出的把关环节包括研究部门负责人或副总裁、安全负责人和首席科学家。负责训练任务的研究部门负责人、研究副总裁,要对安全论证和事故响应承担责任,并把这些内容纳入绩效考核,用来推动训练团队做安全和对齐。

[1]

如果高优先级安全警报没有在规定时限内得到确认,受影响的训练任务应自动暂停。报道没有写出这个时限是多久。IT之家还写,这些建议已经进入落实,今后预计还会调整。训练流程应能识别未对齐模型的全部下游用途,例如用于数据生成或评分,以便在需要时消除未对齐输出的影响。

同一篇另写,OpenAI 当天早些时候暂停了最新模型的训练。那是另一件事,不是这条自动暂停规则已经生效的证据。

[1]

要点

  • 前沿强化学习训练前要提交结构化安全论证,多名高管每人都能否决。
  • 研究负责人或副总裁、安全负责人和首席科学家被写成把关环节。论证和事故响应要进入考核。
  • 高优先级警报若未在时限内确认,相关训练应自动暂停。时限本身没有写出。
  • 官网原文没有打开。当天另一次停训不被当成这项原则的结果。