Rohan Paul

@rohanpaul_ai

弗吉尼亚理工的新论文展示了如何把较早的 token 缓存为注意力可直接读取的紧凑向量,从而让循环式(looped)LLM 每块 GPU 能容纳 4.0 到 8.8 倍的请求,而准确率损失很小。 循环模型会让每个 token 多次经过同一组层,每一轮都会增加 KV 缓存,因此一块 GPU 能容纳的请求就更少。 混合潜在注意力(Hybrid Latent Attention)保留最近 128 个 token 的精确表示,把更早的 token 压缩成小向量,每一轮循环都能直接读取,无需重建任何东西。 在 Ouro 模型上,16K token 时吞吐量最高提升 7.4 倍,而在数学、知识和推理任务上的准确率保持在原模型的 97% 以上。 上下文越长,收益越大。你只需训练新增的部分,就能改造现有的循环模型检查点。 – arxiv. org/abs/2610.07940 标题:《Hybrid Latent Attention for Looped Language Models》(面向循环语言模型的混合潜在注意力)
打开原帖#511482
  1. 产业

    Rohan Paul:– https://arxiv.org/abs/2610.08144 标题…
  2. 产业

    Rohan Paul:一篇新论文表明,当 AI 把一个数学证明翻译成 Lean 时,通过 Lea…
  3. 产业

    Rohan Paul:Emad Mostaque:AI 模型“基本上已经达到了人脑的效率”