9 月 21 日下午,xAI(现已以 SpaceXAI 品牌运营)发布 Grok 4.7,官方定位是"史上最强 Grok,专为编程和知识工作而生"。价格与 Grok 4.6 完全一致:输入每百万 token 2 美元、输出 6 美元。但底层基座模型比 4.6 更大,强化学习周期明显延长——这一代的战场被明确设定在"长任务"。
[1][2]nut graf:Grok 4.7 是一台"价格不动、跑分中位"的机器。它在编程与知识工作基准上几乎盖过 GPT-5.6 Sol Max、直追 Fable 5.1 Max,但在 Artificial Analysis 综合智能指数上只拿到 46 分,落后 Claude Fable 5.1 与 GPT-6 的 53 分一档。同价升级加中部突围,才是理解这代 Grok 的正确坐标:xAI 选择把扩大的基座和更长的 RL 周期折算成"不加价的长任务能力",而不是追平全能榜单。
几个数字值得拆开。Decrypt 报道称 Grok 4.7 运行在约 2.1 万亿参数上,并用 SpaceX 工程数据做了补充训练——这是 xAI 独有的数据资产,也是它和"纯互联网文本"训练的对手在数据构成上最明显的差异点。具体基准上,据官方公布与媒体转述,DeepSWE 71.0%、CursorBench 4.0 46.3%、Terminal-Bench 38.0%、EEBench 66.0%,这些都落在"知识工作与编程"这一组。马斯克在 X 上给出的自我评价是"在智能水平、运行速度和成本之间取得了很有竞争力的平衡",并补充说 Grok 4.8 也已经训完——一句话同时完成了定价辩护和下一代预告。
跑分令人失望的批评同样成立。36氪的报道标题直接写"价格杀疯,跑分令人失望":在综合智能这个最宽口径上,46 分让它停在第一梯队的中游,没有撼动 Claude 与 GPT-6 的头部位置。而"长任务"叙事恰恰是扬长避短的产物——让模型在持续数小时的任务里少走弯路、交出可直接使用的结果,这比单题智力测试更接近 xAI 想要的开发者市场。问题在于:长任务能力目前缺乏一个像 AA 指数那样被广泛接受的标准化度量,xAI 的"长任务最强"很难被第三方独立验证,这也是这一代模型争论最集中的地方。
[1][2]