Rohan Paul

@rohanpaul_ai

Uno 展示了一种在不改变其输出分布的情况下加速现有 LLM 的简单方法:保持原始模型负责,并仅使用扩散来并行起草多个令牌。 保留自回归模型以确保质量并添加扩散以实现平行绘图 在 Qwen3-8B 上,Uno 在最大测试批量大小下,每个请求吞吐量提高了 2.5 倍,系统吞吐量提高了 1.6 倍。 正常的自回归 LLM 一次生成 1 个令牌,这使得长响应、代理和 RL 推出速度变慢。 Uno 添加了轻量级扩散适配器,可以同时提出多个未来代币,而原始模型则验证它们。 这避免了单独的草稿模型并保留了基本模型的采样行为。 在报告的运行中,它还将端到端 RL 训练速度提高了 40%。
打开原帖#511482
  1. 产业

    Timnit Gebru:了解底层动态有助于工程师自信地构建可靠的系统。
  2. 产业

    Charles Frye:/goal 从此代码库中删除溢出内容
  3. 研究

    Garry Tan:是的,这个结果花费了数百万美元。