编辑插画:左边一台庞大昂贵的工业印刷机缓慢印出一张网页设计稿,右边一台小巧的机器飞快地印出一摞几乎相同的设计稿,中间展架上两张成品并排,看上去几乎一样。
1.5 分的质量差距在多数日常任务里几乎不可见,70 倍的价格差距在每份采购合同里都清晰可见。, AI 生成插画,非新闻照片

设计基准站 OpenDesign Arena 本周让 13 个 AI 模型完成了同一批设计任务——搭建网页应用、仪表盘、移动端界面和落地页。得分最高的是 9 月 3 日刚发布的 OpenAI GPT-6 Astra,平均 82.7 分。紧随其后的 DeepSeek V4.1 Flash 拿到 81.2 分,差距 1.5 分。

价格差是另一个量级。据 Decrypt 报道的榜单数据,Astra 每完成一件设计平均花费 1.61 美元、耗时 11.1 分钟;V4.1 Flash 花费 0.023 美元、耗时 5.3 分钟。Anthropic 的 Claude Fable 5.1 得 80.3 分,耗时 12.8 分钟,单件成本 3.66 美元——是三甲里最贵的一个。

在其余受测模型中——包括 Grok 4.6、Qwen 3.8-Max、Kimi K3、GLM-5.3 Flash 和 Gemini 3.8 Flash——每一个得分都低于 DeepSeek,运行成本都高于 DeepSeek。13 个模型里,只有 GPT-6 Astra 得分更高,而且只高 1.5 分。

[1]

这个榜单测的是什么

OpenDesign Arena 采用百分制:30 分考察产出是否真正满足需求说明,70 分考察布局、层级、色彩和风格契合度。它只给能正常渲染成网页的产出打分——空白、破损或截断的结果记零分,且不重测。

这意味着它测量的是「稳定可交付的日常设计产出」,不是通用推理或编程能力。运营方 OpenDesign 是一家公司而非学术机构,榜单属于自报数据,未经第三方复现。它要回答的问题比大多数排行榜窄得多:一个做网页的设计师,明天该用哪个模型。

值得注意的是另一组数字。榜单的「交付率」——无需修改即可直接交付的产出占比——Astra 为 60%,V4.1 Flash 为 57.7%,Fable 5.1 为 56.7%。也就是说,一个实际用模型的设计师体感到的差距,是 2.3 个百分点的交付率,而不是 70 倍的价格。价格差距震撼,质量差距微妙,两个数字都是真的。

[1]

便宜从哪来

DeepSeek 的技术报告解释了成本结构。据 VentureBeat 分析,V4.1 Flash 主干共 5520 亿参数,但读取提示词时每个 token 只激活 80 亿,生成回答时激活 160 亿——DeepSeek 称之为因果编码器-解码器(Causal Encoder-Decoder)架构,40 层 Transformer 被拆成 20 层编码器和 20 层解码器。配合 Compressed Sparse Attention 2 稀疏注意力和 FP4 KV 缓存,全局 KV 缓存降到每 token 890 字节,约为上一代 V4-Flash 的四分之一。

但「Flash」已经不再意味着小。上一代 V4-Flash 主干为 2840 亿参数,这一代涨到 5520 亿,增幅约 94%;技术报告还单独列出了 1960 亿参数的 Engram 条件记忆模块。Hacker News 上有开发者质疑「这还叫 Flash 吗」——稀疏激活和缓存设计降低了服务成本,但权重总量接近翻倍,让本地部署的硬件门槛明显抬高,尽管这些权重以 MIT 许可开放。

DeepSeek 自己也留了保留条款。技术报告明确写道,新架构存在「尚未完全刻画」的鲁棒性边界:稀疏选择错误和 SWA Bounded Replay 的近似状态重建,可能在未经测试的边缘场景导致能力下降——尤其是超长上下文的稀疏检索和缓存恢复边界。这是发布方自己的话,不是批评者的推测。

[2]

一个正在重复的模式

这不是 DeepSeek 第一次用零头价格逼近旗舰。数周前,V4 Pro 在另一项基准对比中追到 Claude Fable 5 的 5% 以内,价格只有对方的零头。V4.1 Flash 还在成为 DeepSeek API 的新重心:官方文档显示,旧的 V4 Flash 请求已由新模型承接,9 月 14 日之后 V4 Pro 也将路由到 V4.1 Flash,直到未来的 V4.1 Pro 出现。与此同时,DeepSeek 正在北京招聘工程师自研 Code Harness,目标是不只提供底层模型,而是握住整个智能体技术栈。

[1][2]

买家真正在乎什么

便宜改变议价结构,但不一定改变采购排序。VentureBeat 的 Pulse 调查显示,只有 31% 的受访企业把「每百万 token 成本」列为首要基础设施成功指标,51% 选择了正常运行时间与可靠性,39% 选择开发者生产力。

真正的压力因此落在按高价出售企业级产品的人身上。就在同一周,OpenAI 正向金融机构和财富 500 强推销定制的 ChatGPT——金融版和数据分析智能体的卖点都不是 token 单价,而是数据许可、权限和工作流。开源权重加激进定价的组合,不会立刻抢走这些合同,但会出现在每一次续约谈判的桌上。

OpenDesign 的榜单回答了一个窄问题:明天做网页设计该用谁。它回答不了的,是 DeepSeek 自己在技术报告里标注的那片未知——边缘场景里,这套为省钱而设计的架构会坏成什么样。1.5 分的质量差距在多数日常任务里几乎不可见,70 倍的价格差距在每份采购合同里都清晰可见,而鲁棒性的账单总是最后才寄到。

[2]