Google DeepMind 在 9 月 30 日的文章里宣布前沿模型 Gemini 4 Argon。它先通过 Fairwind 计划,向一批受信任的网络防御方开放。公司写明,正在参与美国政府的自愿预发布流程,扩大访问之前会继续收集早期测试反馈并调整防护。开发者、企业和消费者现在还用不了。以后的公开版本会从付费 API 客户和 Google AI Ultra 订阅用户开始。文章没有写公众可用的日期。

[1]
套色木版:一条空白长卷在右侧收成卷,卷外另有一枚朱印。
空白长卷收到右侧,朱印落在卷轴外面。对应 Argon 把单次输出拉长,但访问还封着,尚未向公众开放。这是插画,不是发布会照片。, AI 生成插画,不是新闻照片

引入期价格是每百万输入 token 2 美元、每百万输出 token 10 美元。缓存输入按输入价格的 95% 折扣计。引入期结束后,价格改为每百万输入 4 美元、每百万输出 20 美元。为了更长的任务,单次输出上限从以前的 6.4 万 token 提高到 100 万。公司的说法是,模型可以在一次轨迹里写出几十万 token,把难题一次做完。这是能力说明,不是已经对公众开放的额度。

[1]

公司给出的外部成绩都要连着测试集读。DeepSWE v1.1 衡量真实环境里的长周期软件工程,Argon 为 77.9%,公司称这是新的最好成绩。Vals Index 按对美国 GDP 的贡献给金融、编程、法律和税务加权,公司称 Argon 领先;同一段还提到 Vals Finance Agent v2 和 Harvey 的 Legal Agent Benchmark。Zapier 的 AutomationBench 衡量核心业务功能的端到端执行,Argon 以 51.3% 排第一。LVBench 衡量长视频理解,分数是 91.7%。

内部例子也是公司自述。量子计算方面,它把卡住重要应用的子程序的时空资源(量子比特乘以门)相对已发表基线降低了 40%,用时是几分钟。一组智能体分析全机群的性能遥测,在数据中心里找出并应用内存优化,铺开后释放超过 300 TiB,公司估计总节省在 500 TiB 到 1 PiB。把 C 和 C++ 迁到 Rust 的工作,从 re2、libgav1 这类数万行,做到 Fuchsia Zircon 内核 80 万行以上;因为这些系统关键,大规模改写在进生产前还要经过自动和人工审计、仿真测试和复查。libgav1 是 Google 的开源视频解码软件。智能体在已有的 Rust 移植上换掉 3.2 万行 SIMD,做出的内存安全解码器比那一版 Rust 快 2.7 倍,视频输出相同,并更接近优化过的 C++。

[1]

公司把 Argon 写成防御用的网络安全模型,称它可以自主发现、验证并修补严重软件漏洞。对受信任的防御方和 Google 自己的内部团队,这一版发布时不附加网络方面的防护限制,以便使用完整的防御能力。Wiz 已经在免费保护公共基础设施的 Scan for Good 里使用它。文章举的一次早期演示是:模型在全球医院使用的医疗软件里发现一处严重风险,会暴露敏感个人信息,而此前的前沿模型没有发现。CWE-bench v1 衡量修复安全漏洞的能力,Argon 以 68% 与第一名并列。

更广开放之前,公司列出四类防护。模型会拒绝有害请求,同时按 Frontier Safety Framework 保留正当的科研使用。间接提示注入方面,公司称 Argon 在 Gray Swan 的 IPI 基准上领先。为防止模型为了完成任务而越出用户意图,部署时会监控思维链和动作,必要时停止执行。训练期间用过类似监控,并把告警交给专门的事件响应小组;发现不会回灌进训练,以免模型学会躲开监控。高风险训练或评测开始前,沙箱会被隔离开并封上。以上都是公司的发布口径。

[1]

要点

  • Argon 先经 Fairwind 给受信任的网络防御方,并参与美国自愿预发布流程。公众还用不了。
  • 引入期每百万 token 输入 2 美元、输出 10 美元,缓存输入打九五折;之后为 4 美元和 20 美元。输出上限从 6.4 万 token 提到 100 万。
  • 公司口径:DeepSWE v1.1 为 77.9%,AutomationBench 为 51.3% 排第一,LVBench 为 91.7%。
  • 防御方和内部团队不加网络防护限制。Wiz 的早期演示涉及医院软件中的敏感个人信息。监控发现不回灌训练。