距离 Gemini 3.7 Flash 发布仅过去三周,谷歌在六周内掷出了第三张 Flash 牌:Gemini 3.8 Flash——官方称之为"迄今最强的推理与编码模型",却维持着 3.7 的速度与价格。同一份公告里还藏着第二个名字:Gemini 3.8 Flash Cyber,一个只向"受信任的防御者"开放的网络安全专用模型。
两个模型,同一副大脑。一个去干活,一个去守门。

一脑两用:干活的最强,守门的最快
公告把产品逻辑写得毫不掩饰:3.8 Flash 是"最聪明的驮马",面向软件工程、智能体任务和专业领域的多步推理;3.8 Flash Cyber 则是"最能打的防御模型",专攻漏洞发现与自动修补,通过全新的 Fairwind 计划提供给受信任的防御方。
值得注意的是,两者共享同一套基础智能,都由"长时间运行的智能体循环"加速——这套机制会递归地评估并反哺底层模型。谷歌直言,编码与推理能力的跃升,很大程度上来自在网络安全这个高难度领域进行的高强度训练:拿最刁钻的战场练兵,再让肌肉回到日常工位。
干活的:性价比曲线的右上角
DeepSWE v1.1(长时程软件工程基准)是这次的主打图:3.8 Flash 在端到端自主解决复杂工程问题上超过大多数更大、更贵的前沿模型,而成本只是零头——这正是封面图想说的:约 72% 的成功率,落在每任务约 1.5 美元的区间,比它贵 8 倍的模型没有明显更准。
专业领域同样能打:在需要高级分析与报告的量化金融(Vals Finance Agent V2)和法律(Harvey's Legal Agent Benchmark)基准上,3.8 Flash 超越 3.7 Flash 与其他前沿模型;HLE-Verified 拿到 54.9%,覆盖 STEM、人文与职业领域的多步推理。
演示环节展示了这副大脑的玩具面:在 Google Antigravity 里,3.8 Flash 凭一条循环指令提示写出了带谜题与环境叙事的巫师城堡 3D 游戏(贴图由 Nano Banana 生成);用单条提示复刻了一个可以真正游玩的 DOS 版谷歌地图,含定位、导航与街景;还基于美国地质调查局的真实数据集搭出了地形剖面交互图。
它凭什么:更努力,而不是更大
官方给出的核心设计选择出人意料地直白——"3.8 Flash works harder"。面对复杂任务,它会执行更多推理步骤、迭代调用工具,有时会消耗更多 token 来换取性能,尤其是在高努力档位下。
这是一次坦诚的能力披露,也是一次定价的艺术:谷歌同时告诉开发者,如果算力效率才是首要约束,可以调低努力档位压缩 token 开销,或者继续用仍获完整支持的 3.7 Flash——新旧两代被明确分工为"性能优先"与"效率优先"。
守门的:专攻漏洞的"体检医生"
Cyber 版的成绩单分为三段。
其一,自主漏洞发现:在行业标准基准 CyberGym 上达到前沿水平,超越 3.5 Flash Cyber 以及明显更大的前沿模型。在谷歌内部的复杂基准上(覆盖 20 种编程语言的大型代码库),成功率超过 70%,相对前代是"令人印象深刻的跃升"。
其二,自动修补:在 Collinear 运营的 CWE-Bench 上,3.8 Flash Cyber 的 pass@1 达到 47.2%,对比某领先前沿模型的 47.8%——差距不到一个百分点,成本却显著更低,稳稳站上帕累托前沿。谷歌特别强调了一个立场:从一开始就投资"修",优先于"攻"——先把防御者的工具箱填满,而不是 exploitation。
其三,也是最有说服力的一段——谷歌自己已经在用:Chrome 安全团队发现,它为 Chrome 漏洞产出的正确补丁数量是更大商用模型的 2.6 倍;Wiz 的内部渗透测试基准上,召回率高出 7.5–9.7 个百分点,成本低 2.3–5.2 倍;谷歌云漏洞研究团队用它不到 2 小时就找到了一个关键的基础级漏洞——同类漏洞的研究与发现通常需要数月。
HLE-Verified
数值: 54.9% 说明: 多步推理,覆盖 STEM、人文与职业领域
内部漏洞基准(20 种语言)
数值: >70% 说明: 3.8 Flash Cyber 自主漏洞发现成功率
CWE-Bench pass@1
数值: 47.2% 说明: 对照领先前沿模型 47.8%,成本显著更低
Chrome 漏洞补丁产量
数值: 2.6 倍 说明: 正确补丁数,对照更大的最佳商用模型
Wiz 渗透测试召回率
数值: +7.5–9.7% 说明: 同时成本低 2.3–5.2 倍
入门价(输入/输出,每百万 token)
数值: $0.75 / $3.75 说明: 2027-01-01 起恢复为 $1.50 / $7.50
安全设计:普通版收紧,Cyber 版定向放宽
按 Frontier Safety Framework,3.8 Flash 内置了针对 CBRN(化学、生物、放射、核)与网络攻击滥用的防护;Cyber 版则刻意放宽了网络安全相关的缓解措施——代价是只向需要完整网络能力的受信任防御者开放。这个结构值得玩味:能力不再只由价格门槛把守,而是由信任门槛把守。此外,以 Gray Swan 衡量的提示注入鲁棒性也有显著跃升。
价格与获取
入门价为每百万输入 token 0.75 美元、输出 3.75 美元——与 3.7 Flash 持平。注意脚注里的期限:该价格到 2026 年 12 月 31 日截止,2027 年起恢复为 1.50 / 7.50 美元。半价窗口期,恰好覆盖一个完整的采购评估周期。
开发者可在 Google Antigravity、Gemini API(AI Studio / Android Studio)、Stitch 中使用;企业走 Gemini Enterprise;消费者面向 Google AI Pro 与 Ultra 订阅用户,覆盖 Gemini 应用、搜索 AI Mode 与 Google Sheets;网络安全用户通过 Fairwind 计划申请——面向政府机构、关键基础设施运营方与软件维护者,提供优先访问。
谷歌开始在六周内密集发布 Flash 系列——官方称 3.8 为"六周内第三次 Flash 发布"
发布于 3.8 之前约三周;官方称 3.8 以同样的速度与价格提供显著更强的能力,3.7 继续服务效率优先负载
"迄今最强推理编码模型"同价发布;Cyber 版与 Fairwind 计划同步亮相,面向受信任防御者
3.8 Flash works harder——在复杂任务上,它表现出更强的勤奋:执行额外的推理步骤,迭代调用工具。
观点:三件事值得记下
"更努力"是坦白,也是一门生意。用更多 token 换更高的分,等于把算力成本转写成了 API 账单——但努力档位和 3.7 的继续在售,把选择权(和账单)留给了开发者。诚实的代价模型,好过含糊的魔法。
信任门槛正在变成新的定价维度。Cyber 版便宜、更强、更"放权",却不卖给所有人。当能力分配从"谁付得起"转向"谁被信任",行业需要开始讨论信任本身的发放与审计机制——Fairwind 计划就是这个问题的第一份公开答卷。
六周三发,Flash 已经是"月抛型"商品。当一个型号的生命周期只有几周,基准榜单的意义就从"谁最强"变成了"谁迭代得动"。3.8 Flash 用同价更强的曲线把"性价比"焊死在自己的位置上,而对手们的应对方式,将决定接下来一年模型市场的形态。