Rohan Paul
@rohanpaul_ai
弗吉尼亚理工的新论文展示了如何把较早的 token 缓存为注意力可直接读取的紧凑向量,从而让循环式(looped)LLM 每块 GPU 能容纳 4.0 到 8.8 倍的请求,而准确率损失很小。
循环模型会让每个 token 多次经过同一组层,每一轮都会增加 KV 缓存,因此一块 GPU 能容纳的请求就更少。
混合潜在注意力(Hybrid Latent Attention)保留最近 128 个 token 的精确表示,把更早的 token 压缩成小向量,每一轮循环都能直接读取,无需重建任何东西。
在 Ouro 模型上,16K token 时吞吐量最高提升 7.4 倍,而在数学、知识和推理任务上的准确率保持在原模型的 97% 以上。
上下文越长,收益越大。你只需训练新增的部分,就能改造现有的循环模型检查点。
– arxiv. org/abs/2610.07940
标题:《Hybrid Latent Attention for Looped Language Models》(面向循环语言模型的混合潜在注意力)