Rohan Paul
@rohanpaul_ai
Cerebras 联合创始人兼首席执行官 Andrew Feldman 给出了为什么 Cerebras 晶圆级架构在 LLM 推理过程中比 GPU 快 2,500 倍的最佳解释。
在推理过程中,有 2 个阶段:
- 预填充,模型首先处理用户的提示,以及
- 解码,按顺序一次生成答案 1 个标记。
在顺序解码阶段,在计算每个标记之前,必须将模型权重从内存移至计算中。
在 GPU 上,这些权重从 HBM 移出,而 Cerebras 将它们保存在分布在其非常大的晶圆级处理器上的更快的 SRAM 中,因此每个代币必须发生的内存到计算的移动大约快 2,500 倍
----
来自 Matt Turck 和 Cerebras YouTube 频道的 MAD 播客(评论中的链接)