
OpenAI 在 8 月 25 日丢出一组很「硬」的数字:自家第一颗推理专用芯片 Jalapeño,在 SemiAnalysis 的公开基准 InferenceX 上,对着市面上能买到的顶尖加速器,同时把「每瓦干多少活」和「用户等到回复要多久」推到了同一条帕累托前沿上。
官方事实先摆清楚。测试覆盖三款公开权重模型——GPT‑OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T。按峰值吞吐口径,Jalapeño 在单位功耗上能多交付约 1.5 到 1.9 倍的有效推理工作;端到端延迟大约低 1.7 到 3.6 倍;在强调交互的场景里,性能优势还能拉到约 2.1 到 4.1 倍。最大的公开模型 Kimi 上,峰值每瓦性能大约高 1.5 倍,端到端延迟大约低 3.4 倍。芯片标称封装功耗 700 瓦,而实测持续功耗被压在 550 瓦及以下;对照系统一边是 GB200 的 1,200 瓦,一边是 GB300 的 1,400 瓦。附录里那些更刺眼的对照——比如 GPT‑OSS 上 0.69 ms 对 1.87 ms 的 token 间隔、1,459 对 535 的每用户每秒 token,或 DeepSeek 上每千瓦 12,258 对 118 的混合吞吐——都写在同一张官方计分板上。
这不是又一次「我们造了颗更快的芯片」的新闻稿口气。它把问题改写成:如果芯片的主业就是伺候现代语言模型、尤其是要连着点好几步的交互式 Agent,硬件该长成什么样。官方叙述里,Jalapeño 从一开始就按「少搬数据、把 KV cache 钉在近处、按推理阶段调度算力/内存/网络」来画架构;它不是把旧 AI 加速器改个名,而是空白页上为 LLM 推理重画的一版。
更值得盯的是那条飞轮。OpenAI 说,更早几代模型帮他们在九个月内从设计走到 tape-out;上线后,团队又用 Codex 搭 GPT‑Astra,把三款原本不在量产计划里的开源权重模型,在两个月内推到高性能状态。芯片在喂模型,模型又在反过来写内核、排程、验证——这比「自研硅」四个字更刺。它意味着推理栈的迭代速度,开始像软件发版,而不像传统 ASIC 那种以年为单位的慢镜头。
行业冲击也写在字缝里。英伟达不会被一纸基准踢出局:OpenAI 明文表示,训练和推理仍会继续大规模采购英伟达及其他伙伴的加速器。Jalapeño 计划今年年底起进入自家基础设施,第二代已在深水区,第三代轮廓也出来了。对云厂商和芯片供应商来说,真正刺痛的不是某一颗 700 瓦器件,而是客户开始用「匹配用户体验的每瓦有效工作」这把尺子重新量货架——延迟和吞吐不再被迫二选一。
争议点同样直白。数字来自官方在 InferenceX 上的自测与归一化(按公布的芯片功耗额定值),第三方完整复跑、跨机柜系统损耗、以及非 OpenAI 工作负载上的普适性,都还没被独立实验室钉死。附录里对照的是「领先商用系统」,不是某一个公开 SKU 的全机柜 TCO。作者判断:把 Jalapeño 读成「英伟达末日」是偷懒;把它读成「推理成为产品差异化的物理层」才贴着原文。Agent 时代每多一跳工具调用,延迟就会在任务链上复利——谁能在同一瓦特预算里多吐几步、少让人干等几秒,谁就更接近把 Agent 卖成日常用品,而不是演示录像。
六月那份与 Broadcom、Celestica 联手的发布,是这条线的开工仪式;八月的第一批结果,才是把仪式换成计分板。接下来要看的不是口号,而是年底内部部署能不能把附录里的毫秒和每千瓦吞吐,变成 ChatGPT 与 Codex 里摸得着的排队缩短。