Rohan Paul
@rohanpaul_ai
Uno 展示了一种在不改变其输出分布的情况下加速现有 LLM 的简单方法:保持原始模型负责,并仅使用扩散来并行起草多个令牌。
保留自回归模型以确保质量并添加扩散以实现平行绘图
在 Qwen3-8B 上,Uno 在最大测试批量大小下,每个请求吞吐量提高了 2.5 倍,系统吞吐量提高了 1.6 倍。
正常的自回归 LLM 一次生成 1 个令牌,这使得长响应、代理和 RL 推出速度变慢。
Uno 添加了轻量级扩散适配器,可以同时提出多个未来代币,而原始模型则验证它们。
这避免了单独的草稿模型并保留了基本模型的采样行为。
在报告的运行中,它还将端到端 RL 训练速度提高了 40%。