Dylan Patel
@dylan522p
我们很高兴把谷歌 TPU 的首个开放基准测评带到全球:
每天跑、覆盖多种模型与场景;
按 $/token 计量,表现优于 B200 与 B300。
向 Google @inferact 以及 SemiAnalysis 的 InferenceX 团队致谢——这项工作历时数月。
引用:TPU 推理外溢加速(InferenceX);单位美元性能最高可提升约 50%;TPU 栈加速对外开放;Ironwood、TPUv8i,削弱 CUDA 护城河。https://newsletter.semianalysis.com/p/tpu-inferencex-full-steam