Rohan Paul

@rohanpaul_ai

Cerebras 联合创始人兼首席执行官 Andrew Feldman 给出了为什么 Cerebras 晶圆级架构在 LLM 推理过程中比 GPU 快 2,500 倍的最佳解释。 在推理过程中,有 2 个阶段: - 预填充,模型首先处理用户的提示,以及 - 解码,按顺序一次生成答案 1 个标记。 在顺序解码阶段,在计算每个标记之前,必须将模型权重从内存移至计算中。 在 GPU 上,这些权重从 HBM 移出,而 Cerebras 将它们保存在分布在其非常大的晶圆级处理器上的更快的 SRAM 中,因此每个代币必须发生的内存到计算的移动大约快 2,500 倍 ---- 来自 Matt Turck 和 Cerebras YouTube 频道的 MAD 播客(评论中的链接)
打开原帖#511482
  1. 产业

    Rohan Paul:谷歌双子座副总裁与 Swami Sarvapriyananda 坐在一起,…
  2. 产业

    Rohan Paul:“在毕马威,使用人工智能不是一种选择
  3. 产业

    Rohan Paul:Meta 发布了 Muse Gadgets,这是一个开源程序,任何人都可以…