Rohan Paul

@rohanpaul_ai

模型的上下文窗口不必是代理的工作空间限制。 KVMEM 通过对旧的 KV 状态进行分页,降低召回成本,同时在任务成功方面击败压缩,从而使百万代币代理内存变得实用。 长期运行的代理最终会填充它们的上下文。如今,他们通常将旧历史压缩成摘要或再次获取旧文本。总结可能会忘记细节。获取文本使模型再次处理相同的历史记录。 KVMEM 保留模型已经完成的工作。旧上下文作为可重用的 KV 缓存保留在 GPU 内存、RAM 或 NVMe 中,并且系统仅拉回当前步骤所需的部分。 在采用 Qwen3.8-27B 的 DeepSWE 上,与仅压缩相比,Pass@1 从 43.8% 上升到 48.4%。在受控基准测试中,恢复速度比 Compact+RAG 快 11.4–53.8 倍。 在具有 24 GB RTX 5090 GPU 的笔记本电脑上,KVMEM 以大约 50 个令牌/秒的速度支持 1M 令牌工作区。 这不是 1M 令牌主动提示。每一步仍然只能看到一个有界的切片。
打开原帖#511482
  1. 产业

    Qwen:感谢@arena的认可! 🏆 Qwen-Image-2.1 现在是图像编辑…
  2. 产业

    Tencent Hy:ComfyUI ✖️ Hy Image3.5 预览
  3. 产业

    Rohan Paul:– https://arxiv.org/abs/2608.24961 标题…