
核心事实
9 月 3 日,OpenAI 发布 GPT-6 Astra 的系统卡。按照 OpenAI 自己研究页面上的表述,Astra 是该公司准备框架(Preparedness Framework)下,首个在网络安全能力上达到 Critical(关键)级别的模型。
在 OpenAI 的框架设计里,模型能力按风险类别追踪,网络安全是其中之一;能力越过 High、触及 Critical,意味着触发更高等级的额外保障与部署限制。系统卡就是这些判定和缓解措施的官方载体。
节奏问题被提前承认
值得注意的是配套的时间线:8 月 18 日,OpenAI 曾发表《网络安全关键能力时代的模型开发节奏》,主题是加强前沿模型的监控、对齐与安全保障,并让这些保障措施引导模型的开发节奏。两周后,Astra 的系统卡成为这套表述的第一个具体落点。
换句话说,OpenAI 自己把一件事写进了官方文件:前沿模型的网络安全能力已经强到需要改变开发流程,而不是在发布后再补安全说明。
该追问什么
系统卡是实验室自评的文件,不是独立审计。Critical 这个标签由 OpenAI 依据自家测试给出;真正决定其分量的,是卡片里附带的缓解措施具体限制了什么——哪些部署被推迟、哪些能力被隔离、红队测试覆盖到什么程度——以及这些判定是否接受第三方复核。
当一家实验室宣布自己的模型“强到危险”,理性的读法不是恐慌,也不是照单全收,而是要求看到阈值、证据和限制条件。Astra 系统卡提供了第一份文本。接下来要看的,是外部安全研究者能否用自己的评测复现它。
[1][2]