Rohan Paul

@rohanpaul_ai

清华大学新论文提出 TokenRouter:按 token 在小模型与大模型之间路由的服务系统,吞吐量最高可达现有方案的 64.15 倍。 当前主流服务框架(如 vLLM、SGLang)通常每个请求跑一个模型,因此当两个模型共同生成回答时,每一步都要等较慢的那个。 TokenRouter 给每个模型独立服务器,并让它们来回交接工作:在模型间传递半成品回答,同时保留截至目前的文本记忆(KV cache),并短暂积攒请求,让每个模型能打更大 batch。 在 5 种路由方法上,吞吐量相对更强的现有方案提升了 2.01–64.15 倍。 – arxiv.org/abs/2610.12242 标题:"TokenRouter: Efficient Serving System for Token-Level LLM Routing"
打开原帖#511482
  1. 研究

    Yann LeCun:@ Helios_Hua做得好
  2. 产业

    Mustafa Suleyman:超级智能必须被约束……今天,这是一个工程与治理挑战。而且并不新鲜。我们曾对…
  3. 产业

    Databricks:管理员现在可以配置编码代理在一个地方与统一网关