IT之家 9 月 29 日报道,OpenAI 当天通过官方新闻稿提出一套指导原则:企业在开展前沿 AI 的强化学习训练之前,要提交结构化的安全论证。本篇没有打开那篇官网稿。下面的内容是 IT之家的转述。
[1]
安全论证要交给多名高级管理人员审查,每个人都有权否决这次训练。报道写出的把关环节包括研究部门负责人或副总裁、安全负责人和首席科学家。负责训练任务的研究部门负责人、研究副总裁,要对安全论证和事故响应承担责任,并把这些内容纳入绩效考核,用来推动训练团队做安全和对齐。
[1]如果高优先级安全警报没有在规定时限内得到确认,受影响的训练任务应自动暂停。报道没有写出这个时限是多久。IT之家还写,这些建议已经进入落实,今后预计还会调整。训练流程应能识别未对齐模型的全部下游用途,例如用于数据生成或评分,以便在需要时消除未对齐输出的影响。
同一篇另写,OpenAI 当天早些时候暂停了最新模型的训练。那是另一件事,不是这条自动暂停规则已经生效的证据。
[1]要点
- 前沿强化学习训练前要提交结构化安全论证,多名高管每人都能否决。
- 研究负责人或副总裁、安全负责人和首席科学家被写成把关环节。论证和事故响应要进入考核。
- 高优先级警报若未在时限内确认,相关训练应自动暂停。时限本身没有写出。
- 官网原文没有打开。当天另一次停训不被当成这项原则的结果。