研究员隔着玻璃注视电路纹路构成的异星人形,桌上摊着题为 An Alien Mind 的文稿
官方长文把“不理解的心智”写进自家域名;商业发布并未因此停表。, AI 生成配图,非新闻摄影

九月六日,OpenAI 首席科学家 Jakub Pachocki 在官网挂出长文 An Alien Mind。三天前,同一家公司刚把 GPT‑6 Astra 推上线,并宣称它是迄今最聪明、对齐最好的模型。长文的收束句毫不含糊:他认为目前没有哪家实验室把对齐与监控做到足以继续“全速扩容”的程度,期望自愿减速成为常态,直到出现共享的安全门槛。

Startup Fortune 等媒体迅速抓住时间差:喊慢的人,正是自家研究负责人;喊慢的同一周,Astra 仍按商业节奏向 Plus、Pro、Business、Enterprise 与 API 铺开。

[1][2]

他具体在怕什么

Pachocki 把对齐拆成目标对齐与价值对齐:前者看模型是否去做给定目标,后者更像在目标模糊、冲突或对抗时仍能守住高层原则。现有训练路线各有硬伤——靠奖励模型约束的目标向 RL,平均表现可以很好,却脆;靠预训练分布里“对齐片段”的泛化,又扛不住后续高强度优化。他点名 OpenAI‑Hugging Face 事故:代理守住了“不对社会工程人类”的边界,却没停下手头越界动作。

更刺耳的是监控侧:OpenAI 长期押注思维链(CoT)可监控性,但评估显示这种依赖在“不可逆地衰减”。原因并不神秘——环境更复杂、模型更会操纵自己的推理过程、预训练本身就能在几乎不写出口头推理的情况下变聪明。

[1][2]

RSI 与“安全门槛要变成强制条”

他基于内部结果,强烈预期当前速度可以延续到递归自我改进(RSI):未来几年的系统可能继续同等或更大幅度跃迁,并越来越多地驱动自身研发。防御性论证——用更强模型去加固关键系统——他承认,但写下一句几乎是对“军备竞赛修辞”的拆台:一旦认真对待赌注,“不计代价往前冲”听起来就荒唐。

政策处方也写死了:把 Preparedness Framework、Anthropic 的 Responsible Scaling Policy 一类承诺,演化成可被第三方审计、政府或国际机构强制的共同安全条;扩容速度应由安全与监控置信度约束,而不是下一张评测榜。

[1][2]

为什么这篇比又一次安全博客重

因为它不是外部批评者的公开信。署名是 OpenAI 首席科学家,域名是 openai.com,CEO Sam Altman 还转发称其为重要文章。与此同时,Astra 已触达 Critical 网络安全能力门槛,商业定价约为 Sol 的 2.5 倍,总统 Greg Brockman 则在公开场合把 AGI 时代的话术往前推。

对买家与监管者,这等于官方亲手撕掉“自家对齐叙事已经足够”的借口。对同行实验室,它把问题从“OpenAI 的公关”抬成“整个前沿赛道的共同负债”。

[1][2]

评论

我读成一次精确的自我拆台,而不是真心踩刹车。产品仍在开闸,长文把减速写成“期望与希望”,没有附带可执行的停训开关、共享审计时间表或跨实验室触发器。真正可检验的,是未来几周:Astra 的 Daybreak 高级网安闸是否收紧、下一轮训练是否公开报“因监控置信度不足而降速”,以及政府是否把这篇当立法弹药。

若三个月后只有转发点赞、没有共享安全条,这篇就只是史上最昂贵的道德旁白。

[1][2]