深夜数据中心机房走廊,工程师背影提着手电行走,走廊尽头大屏上一道金色曲线陡峭上扬,两侧机柜指示灯如星点
中国大模型在OpenRouter上的周调用量已连续20周超过美国,成本与性价比成为开发者迁移的主因。, AI生成插画,非新闻照片

API聚合平台OpenRouter的最新周报把中国模型的市场地位摆到了明面上:9月7日至13日当周,全球大模型总调用量达127万亿token,其中中国模型约61.2万亿、环比增长7.9%,美国模型约21.8万亿、环比增长31.6%。这是中国大模型周调用量连续第20周超过美国,稳居全球首位。

调用量前十名中,中国模型占据至少7席,合计占比超过70%;而一年前,这个榜单里只有2个中国模型。腾讯混元Hy4 preview以16.8万亿token位列第二,智谱GLM 5.3 Flash以11.9万亿排第三,DeepSeek V4 Flash以11.6万亿排第四。9月10日才发布的DeepSeek V4.1 Flash上线三天便以4.94万亿token升至第六——OpenRouter称该模型发布后24小时内处理了约1万亿token,约90%的调用来自缓存读取,按市场定价每百万token成本约0.006美元,比GLM 5.3 Flash等相近模型低约80%。

“价格屠夫”的称号不是全部解释。瑞银证券中国互联网行业分析师熊玮对第一财经表示,在AI大规模落地过程中,企业与用户的关注点正从能力转向更高的投入产出比,“Token ROI”成为2026年下半年行业讨论的关键词。上半年流行的是“token-maxxing”——大厂鼓励员工尽可能多地使用AI,但随后发现这既推高AI账单,又难以衡量经济价值;从年中起,企业开始强调“token optimization”,对AI账单提出更严格的投入产出要求。开源项目xiaobei的开发者对第一财经称,他今年5月起已把工作流全部切换为国产模型:“大多数应用层的工作,国内模型已经能胜任,用不上最顶尖的海外旗舰模型。”

值得注意的对照是能力榜。据AI基准机构Artificial Analysis,智能指数前五名仍全部是海外模型:Anthropic的Claude Fable 5.1第一,OpenAI的GPT-6 Astra第二,Meta的Muse Spark 1.3第四,xAI的Grok 4.6第八;中国模型排名最高的是智谱GLM-5.3,以45分位列第七。也就是说,中国模型没有在技术能力上领先,却在开发者“用脚投票”的市场里赢下了流量。

成本结构支撑了这种迁移。瑞银调研发现,中国模型厂商的API业务毛利率大多在20%至40%区间,并非贴钱换采纳,而是靠模型架构创新、优化训练与推理效率在盈利和性价比之间取得平衡。OpenRouter的整体数据也在放大这种趋势:平台每周处理的token量从2025年9月的4.92万亿增长到2026年9月的127万亿,一年增长约25倍;份额上,DeepSeek以25.4%升至第一,中国厂商整体份额超过45%,美国厂商约43%。

需要给数据划边界:OpenRouter只统计经由平台路由的流量,厂商自有API、云平台、私有化部署和直接面向消费者的应用都不在内,因此不能等同于全球市场份额。但趋势本身足够清晰——低价不是护城河,中国厂商也还不能宣布赢下竞赛;只是在一个越来越在意投入产出比的市场里,它们已经靠成本优势抢到了座位,并在争夺默认入口。

[1][2]