Rohan Paul
@rohanpaul_ai
清华大学新论文提出 TokenRouter:按 token 在小模型与大模型之间路由的服务系统,吞吐量最高可达现有方案的 64.15 倍。
当前主流服务框架(如 vLLM、SGLang)通常每个请求跑一个模型,因此当两个模型共同生成回答时,每一步都要等较慢的那个。
TokenRouter 给每个模型独立服务器,并让它们来回交接工作:在模型间传递半成品回答,同时保留截至目前的文本记忆(KV cache),并短暂积攒请求,让每个模型能打更大 batch。
在 5 种路由方法上,吞吐量相对更强的现有方案提升了 2.01–64.15 倍。
– arxiv.org/abs/2610.12242
标题:"TokenRouter: Efficient Serving System for Token-Level LLM Routing"