示意:红狐机器坐在控制台前,向玻璃盾后的防守光球发射提示注入碎片,一枚碎片击中自动贩卖机、价签跌到 0.50。
配图为 AI 生成示意,非新闻现场照片。, AI 生成(非新闻照片)

办公室里那台自动贩卖机叫 Vendy。OpenAI 说,自家训练的红队模型 GPT‑Red 先在仿真里试招,再把攻击搬到真机上,一口气干成三件事:把贵货改成最低价 $0.50;再订一件 $100+ 的货同样标成半美元;还能取消别人的订单。漏洞已披露,新护栏还在测。

这不是又一篇「我们重视安全」的通稿。2026 年 9 月 3 日前后放出的 GPT‑Red 研究帖,把重点钉在一条很少被公开写透的流水线上:用专门养出来的攻击模型,在训练阶段把下一版生产模型打硬。 GPT‑5.6 Sol 被写成迄今对提示注入最硬的一款——相对四个月前最好的生产模型,最难的直接提示注入基准失败次数降到约 1/6

它实际在打什么

官方事实写得很直白:浏览器、连接应用、本地文件、工具回包,都会把第三方文本塞进模型视野。一封邮件、网页横幅、工具输出、代码仓库里,都可能埋进提示注入,诱使模型把敏感数据推到外网。

人工红队能发现案例,却撑不起「用来训练」的数据量。OpenAI 的解法是训练 仅限内部 的自动化红队模型 GPT‑Red:像人类红队一样设目标、发提示、看模型反应、再迭代。训练算力被写成「与部分最大规模 post-training 同级」——专门砸在安全上的量级,官方自称前所未有。

训练形态是 self-play 强化学习:GPT‑Red 和一群多样的防守方 LLM 同时练。攻击方靠打出有效失败得分,防守方靠扛住攻击并完成原任务得分。防守变强,攻击就被迫换招。场景库按威胁模型搭好:红队能改本地文件片段、网页横幅、邮件正文或工具输出;什么叫成功,事先写死。

训练结束时,官方称 GPT‑Red 能打穿几乎所有对阵模型,包括内部与生产模型,直到 GPT‑5.5。随后用它生成提示注入,喂进 GPT‑5.6 的训练,生产模型才变得「对 GPT‑Red 自己的招高度抵抗」。关键约束一句:GPT‑Red 不随产品下发,恶意能力留在内网,硬壳写进对外模型。

数字里看得见的硬度

在复制版 Dziemian 等人(2025)间接提示注入竞技场上(内部镜像,场景与训练目标不同),对 GPT‑5.1:人类红队约 13% 场景成功,GPT‑Red 约 84%

对 Codex CLI(底层 GPT‑5.4 mini)的 10 个留出数据外泄场景,官方称 GPT‑Red 比「直接提示的 GPT‑5.5 基线」更有效,也更省 token。

六个月里,越来越强的红队前身被写进自 GPT‑5.3 以来的连续生产训练。一例:「假思维链」(Fake Chain-of-Thought)直接注入,在 GPT‑5.1 上成功率可到 95%+,到 GPT‑5.6 Sol 掉到 10% 以下。面向开发者工具与浏览的若干间接注入基准,最新模型准确率写到 >97%。在更广的稳健性环境上,GPT‑5.6 Sol 对 GPT‑Red 直接提示注入的失败率被写成仅 0.05%

官方特意补了一刀:稳健性不是靠「更爱拒绝、更少干活」装出来的。通用能力评测与专门设计的过度拒绝任务显示,正常能力大体不动,硬度来自更会挡恶意指令,而不是默认拒绝对话。

行业在买什么故事

把能力飞轮写成「今天的模型帮明天的模型更强」已经听腻了。GPT‑Red 想卖的是对称物:安全侧的自改进飞轮——今天的攻击模型,直接参与训练,压明天的漏洞。

和 Anthropic 侧常见的「对齐研究者 Claude / 监控看它作弊」叙事对照,OpenAI 这篇更像工程账本:算力预算、self-play、把红队输出焊进 post-training、再拿办公贩卖机与 Codex CLI 做实机抽检。争议点也很具体——

  • 不透明:84%、6×、0.05%、假思维链等数字都来自自家基准与内部镜像,第三方难复核。
  • 不公开攻击者:有利于防滥用,也意味着外界无法独立复现「红队有多强」。
  • 场景偏差:训练环境再「写实」,仍可能漏掉真实企业权限图与供应链投毒的脏边角。
  • 与能力竞赛绑死:红队算力跟最大 post-training 对齐,等于承认安全预算必须跟着能力预算涨;一旦裁安全算力,飞轮会先停。

我的判断:这篇比「又发了一版更安全的模型」更值得记。它把提示注入从评测展览,改写成 可缩放的对抗训练工序——办公室贩卖机被改价,只是工序外溢到物理世界的一张收据。买方该追问的不是口号,而是:红队算力是否与旗舰训练同级保留、生产模型对内部红队的 ASR 曲线是否持续公开、以及第三方红队是否仍有独立入口。

原文:GPT‑Red: Unlocking Self-Improvement for Robustness。本文基于公开研究帖评论,不构成安全审计结论。