Boris Cherny

@bcherny

我很高兴看到 OpenAI 的新模型在提示注入风险上大致与 Gemini Flash 和 Opus 4.8 持平。干得好! 评估并点名其他实验室,原来是鼓励它们训练更对齐模型的好办法。我们会继续这样做,直到其他实验室更重视安全。这对所有人都有好处,而且还有很大提升空间! 大约两个月前,我们已在实践中为 Claude 模型解决了提示注入。但无论你用什么模型,提示注入都是重大安全风险;整个行业同样应投入更多精力,训练模型抵抗提示注入,以及其他模型对齐要素。 随着模型能力更强、更深入业务与经济,风险只会上升。我们应当认真对待,并为客户与世界做正确的事。
打开原帖#511482
  1. 产业

    Alexandr Wang:Muse 漏洞赏金最高 30 万美元
  2. 产业

    Alexandr Wang:对 Muse 安全工作印象深刻
  3. 产业

    Sam Altman:9 月 16 日旧金山庆祝 GPT-6