英伟达 10 月 1 日的博客写,GPT-6 Astra Ultrafast 跑在 NVIDIA Blackwell GPU 上,现在可以通过 OpenAI API 使用,也向符合条件的 ChatGPT Work 和 Codex 用户开放。加速来自 OpenAI 模型在 Blackwell 上做的推理优化。博客说,相对 Astra 标准档,token 生成最快可以到 8 倍。这篇没有写出测的是哪类提示、多长上下文、多大批量,也没有给出「最快」之外的典型速度。

[1]
银针:上面一条短纸只有一截粗黑笔画,下面一条长纸拉着一道淡线。
上面那条纸又短又窄,只有一截粗黑的笔画。下面那条纸很长,上面是一道又长又淡的线。对应同一类生成,极速档更早停住。这是插画,不是测速图。, AI 生成插画,不是新闻照片

博客把更快的生成放在会重复的流程里:智能体写代码,调用工具,看结果,再决定下一步。它说极速档把 Astra 的能力放进这些在意时间的循环,可以缩短编程智能体里修改、测试、排错的来回,减少两次工具调用之间等回复的时间。这是用途说明,不是一份公开的任务计时。

OpenAI 推理负责人 Philippe Tillet 说,英伟达在工具和文档上的投入,让他们的模型特别擅长为 Blackwell 和 Rubin GPU 写程序;Astra 能把这些知识变成高性能内核,覆盖延迟、吞吐和成本。这句话里的 Rubin 是他们会去编程的硬件,博客写 Ultrafast 正在跑的是 Blackwell,没有写它已经跑在 Rubin 上。

[1]

博客写,性能不会在模型部署之后停住。OpenAI 在用自己的模型改进跑在英伟达 GPU 上的推理软件,利用平台可编程这一点去试改动。计算首席技术官 Uday Ruddarraju 说,他们用内部模型优化了英伟达 GPU 上的推理,可编程性帮助他们做出 Ultrafast 背后的加速。这是双方对已经做的事的说法。博客没有给出下一轮还能再快多少。

可编程平台让同一套基础设施可以在训练、推理和强化学习之间转用,需求变化时改派计算,提高利用率,免得每种负载都按峰值多备机器。这是博客对平台的描述,没有附上利用率数字。

开发者今天可以通过 API 使用 GPT-6 Astra Ultrafast。访问方式、价格和接法在一篇 Ultrafast 指南里。这篇博客没有写下价格。

[1]

要点

  • GPT-6 Astra Ultrafast 已在 OpenAI API 提供,也向符合条件的 ChatGPT Work 和 Codex 用户开放,跑在 Blackwell 上。
  • 相对 Astra 标准档,token 生成称最快到 8 倍。博客没有给出任务、上下文长度和批量。
  • Tillet 提到为 Blackwell 和 Rubin 写内核。博客写正在跑的是 Blackwell,没有写已经跑在 Rubin 上。
  • 价格和接法在另一份指南里。这篇没有写价格,也没有写下一轮还能再快多少。