距离 Gemini 3.7 Flash 发布仅过去三周,谷歌在六周内掷出了第三张 Flash 牌:Gemini 3.8 Flash——官方称之为"迄今最强的推理与编码模型",却维持着 3.7 的速度与价格。同一份公告里还藏着第二个名字:Gemini 3.8 Flash Cyber,一个只向"受信任的防御者"开放的网络安全专用模型。

两个模型,同一副大脑。一个去干活,一个去守门。

散点图,标题 Gemini 3.8 Flash / DeepSWE V1.1:横轴为每任务平均成本(约 15 美元至 0 美元,向右递减),纵轴为任务成功率(0%–80%)。灰色点与连线为各竞争对手模型(Claude Opus 5、Claude Fable 5、Kimi K3、DeepSeek v4 Pro、Grok 4.6 等),蓝色高亮为 Gemini Flash 系列 3.5 至 3.8 的逐代轨迹,终点 Gemini 3.8 Flash 位于约 72% 成功率、每任务约 1.5 美元的位置;右上角标注 most efficient(最有效)。
封面:Google 官方发布的 DeepSWE v1.1 基准散点图。横轴为每任务平均成本(向右递减),纵轴为任务成功率;蓝色为 Gemini Flash 系列的逐代爬升轨迹——3.5、3.6、3.7、3.8 一路向右上角(高性能、低成本)移动。数据来源:Datacurve AI。, Chart: Datacurve AI, via Google official blog (Sep 2026).

一脑两用:干活的最强,守门的最快

公告把产品逻辑写得毫不掩饰:3.8 Flash 是"最聪明的驮马",面向软件工程、智能体任务和专业领域的多步推理;3.8 Flash Cyber 则是"最能打的防御模型",专攻漏洞发现与自动修补,通过全新的 Fairwind 计划提供给受信任的防御方。

值得注意的是,两者共享同一套基础智能,都由"长时间运行的智能体循环"加速——这套机制会递归地评估并反哺底层模型。谷歌直言,编码与推理能力的跃升,很大程度上来自在网络安全这个高难度领域进行的高强度训练:拿最刁钻的战场练兵,再让肌肉回到日常工位。

干活的:性价比曲线的右上角

DeepSWE v1.1(长时程软件工程基准)是这次的主打图:3.8 Flash 在端到端自主解决复杂工程问题上超过大多数更大、更贵的前沿模型,而成本只是零头——这正是封面图想说的:约 72% 的成功率,落在每任务约 1.5 美元的区间,比它贵 8 倍的模型没有明显更准。

专业领域同样能打:在需要高级分析与报告的量化金融(Vals Finance Agent V2)和法律(Harvey's Legal Agent Benchmark)基准上,3.8 Flash 超越 3.7 Flash 与其他前沿模型;HLE-Verified 拿到 54.9%,覆盖 STEM、人文与职业领域的多步推理。

演示环节展示了这副大脑的玩具面:在 Google Antigravity 里,3.8 Flash 凭一条循环指令提示写出了带谜题与环境叙事的巫师城堡 3D 游戏(贴图由 Nano Banana 生成);用单条提示复刻了一个可以真正游玩的 DOS 版谷歌地图,含定位、导航与街景;还基于美国地质调查局的真实数据集搭出了地形剖面交互图。

它凭什么:更努力,而不是更大

官方给出的核心设计选择出人意料地直白——"3.8 Flash works harder"。面对复杂任务,它会执行更多推理步骤、迭代调用工具,有时会消耗更多 token 来换取性能,尤其是在高努力档位下。

这是一次坦诚的能力披露,也是一次定价的艺术:谷歌同时告诉开发者,如果算力效率才是首要约束,可以调低努力档位压缩 token 开销,或者继续用仍获完整支持的 3.7 Flash——新旧两代被明确分工为"性能优先"与"效率优先"。

守门的:专攻漏洞的"体检医生"

Cyber 版的成绩单分为三段。

其一,自主漏洞发现:在行业标准基准 CyberGym 上达到前沿水平,超越 3.5 Flash Cyber 以及明显更大的前沿模型。在谷歌内部的复杂基准上(覆盖 20 种编程语言的大型代码库),成功率超过 70%,相对前代是"令人印象深刻的跃升"。

其二,自动修补:在 Collinear 运营的 CWE-Bench 上,3.8 Flash Cyber 的 pass@1 达到 47.2%,对比某领先前沿模型的 47.8%——差距不到一个百分点,成本却显著更低,稳稳站上帕累托前沿。谷歌特别强调了一个立场:从一开始就投资"修",优先于"攻"——先把防御者的工具箱填满,而不是 exploitation。

其三,也是最有说服力的一段——谷歌自己已经在用:Chrome 安全团队发现,它为 Chrome 漏洞产出的正确补丁数量是更大商用模型的 2.6 倍;Wiz 的内部渗透测试基准上,召回率高出 7.5–9.7 个百分点,成本低 2.3–5.2 倍;谷歌云漏洞研究团队用它不到 2 小时就找到了一个关键的基础级漏洞——同类漏洞的研究与发现通常需要数月。

HLE-Verified

数值: 54.9% 说明: 多步推理,覆盖 STEM、人文与职业领域

内部漏洞基准(20 种语言)

数值: >70% 说明: 3.8 Flash Cyber 自主漏洞发现成功率

CWE-Bench pass@1

数值: 47.2% 说明: 对照领先前沿模型 47.8%,成本显著更低

Chrome 漏洞补丁产量

数值: 2.6 倍 说明: 正确补丁数,对照更大的最佳商用模型

Wiz 渗透测试召回率

数值: +7.5–9.7% 说明: 同时成本低 2.3–5.2 倍

入门价(输入/输出,每百万 token)

数值: $0.75 / $3.75 说明: 2027-01-01 起恢复为 $1.50 / $7.50

2 小时以内关键漏洞发现用时谷歌云漏洞研究团队用 Gemini 3.8 Flash Cyber 找到一个关键的基础级漏洞用时不到 2 小时;同类漏洞的研究与发现通常需要数月。

安全设计:普通版收紧,Cyber 版定向放宽

按 Frontier Safety Framework,3.8 Flash 内置了针对 CBRN(化学、生物、放射、核)与网络攻击滥用的防护;Cyber 版则刻意放宽了网络安全相关的缓解措施——代价是只向需要完整网络能力的受信任防御者开放。这个结构值得玩味:能力不再只由价格门槛把守,而是由信任门槛把守。此外,以 Gray Swan 衡量的提示注入鲁棒性也有显著跃升。

价格与获取

入门价为每百万输入 token 0.75 美元、输出 3.75 美元——与 3.7 Flash 持平。注意脚注里的期限:该价格到 2026 年 12 月 31 日截止,2027 年起恢复为 1.50 / 7.50 美元。半价窗口期,恰好覆盖一个完整的采购评估周期。

开发者可在 Google Antigravity、Gemini API(AI Studio / Android Studio)、Stitch 中使用;企业走 Gemini Enterprise;消费者面向 Google AI Pro 与 Ultra 订阅用户,覆盖 Gemini 应用、搜索 AI Mode 与 Google Sheets;网络安全用户通过 Fairwind 计划申请——面向政府机构、关键基础设施运营方与软件维护者,提供优先访问。

Flash 周期开启

谷歌开始在六周内密集发布 Flash 系列——官方称 3.8 为"六周内第三次 Flash 发布"

Gemini 3.7 Flash 发布

发布于 3.8 之前约三周;官方称 3.8 以同样的速度与价格提供显著更强的能力,3.7 继续服务效率优先负载

Gemini 3.8 Flash 与 3.8 Flash Cyber 发布

"迄今最强推理编码模型"同价发布;Cyber 版与 Fairwind 计划同步亮相,面向受信任防御者

3.8 Flash works harder——在复杂任务上,它表现出更强的勤奋:执行额外的推理步骤,迭代调用工具。
Google 官方博客《Introducing Gemini 3.8 Flash and 3.8 Flash Cyber》(2026-09-02)

观点:三件事值得记下

"更努力"是坦白,也是一门生意。用更多 token 换更高的分,等于把算力成本转写成了 API 账单——但努力档位和 3.7 的继续在售,把选择权(和账单)留给了开发者。诚实的代价模型,好过含糊的魔法。

信任门槛正在变成新的定价维度。Cyber 版便宜、更强、更"放权",却不卖给所有人。当能力分配从"谁付得起"转向"谁被信任",行业需要开始讨论信任本身的发放与审计机制——Fairwind 计划就是这个问题的第一份公开答卷。

六周三发,Flash 已经是"月抛型"商品。当一个型号的生命周期只有几周,基准榜单的意义就从"谁最强"变成了"谁迭代得动"。3.8 Flash 用同价更强的曲线把"性价比"焊死在自己的位置上,而对手们的应对方式,将决定接下来一年模型市场的形态。