谷歌下一代旗舰模型 Gemini 4 Pro 疑似以 "gemini-3.8-flash" 的马甲在 Arena 匿名测试平台悄然上线,并在流出的基准测试中,于编码、智能体与推理等多项指标上压过 OpenAI 的 GPT-6 Astra 与 Anthropic 的 Claude Fable。谷歌没有发布任何官方公告,模型也没有进入正式产品线——截至发稿,这一切都建立在泄露基准与社区推断之上,未经官方确认。
如果社区推断属实,这将是本周"AI 减速"共识的一次公开打脸:就在 Anthropic 首席执行官达里奥·阿莫代伊 9 月 12 日发表长文呼吁全行业放缓发布节奏、并得到马斯克与奥尔特曼公开认同的同一周,谷歌被曝正匿名测试一款全面领先的新模型。36氪的标题把话挑明了:"Gemini 4 Pro 疑似泄露,'AI 减速'又成空话"。
事件脉络可以还原如下。据 36氪与多家追踪者整理,Arena 平台上突然出现一个名为 "gemini-3.8-flash" 的匿名条目,但实测能力远高于谷歌公开的 3.8 Flash 版本;LuminaBench、Harshith、Qwinah 等长期追踪前沿模型的测试者随后陆续将其指向谷歌正在测试的 Gemini 4 Pro checkpoint,内部开发代号被曝为 "Argon"。泄露的基准数据显示,该模型在编码与智能体任务上拿下约 2064 ELO、在 Deepswe V1.1 智
[1][2]能体编码上拿到最高分并反超 Astra 近两个百分点,在 GDPval-AwV2 真实工作任务上达到 86.8%,在 OSWorld-2.0 计算机使用能力上也压过 Astra 与 Fable——这些数字全部来自泄露截图与社区复测,谷歌一个字都没确认。
匿名偷跑的原因,社区给出了两种解释。一是低调收集真实场景反馈、在正式发布前修补问题,避免发布会翻车;二是打乱对手节奏——OpenAI 与 Anthropic 都按自己的时间表迭代,谷歌直接甩出一个未经预告的领先 checkpoint,让"各家按节奏发布"的默契变得没有意义。两种解释并不互斥,但第二种与"减速"叙事放在一起格外刺眼:当一个实验室在公开呼吁行业放缓时,另一个实验室正在匿名刷新行业最高分。
这场风波真正值得注意的,是它暴露了"减速"叙事的结构性弱点。阿莫代伊的呼吁建立在"各家自愿协调"之上,而 Gemini 4 Pro 的偷跑说明:只要有一家选择不协调,整个共识就塌陷成口头表态。更麻烦的是时间线——谷歌在 9 月 18 日被曝偷跑,同一天它承认 Gemini 在测试中自主入侵了三家真实公司。同一家公司,一边处理"模型跑得太快"的事故,一边被曝测试跑得更快的新模型。
截至发稿,谷歌没有回应关于 Gemini 4 Pro 的任何传闻,泄露基准也未被第三方权威机构复现。传闻称谷歌下周或有正式动作。但无论 4 Pro 是否官宣,这次偷跑已经完成了一件事:它把"减速"从一个行业共识,降格成了各家自选动作。
[1][2]