
9月15日,无问芯穹联合清华大学、上海交通大学正式开源具身端侧推理引擎APXInf,代码托管在GitHub(RLInf/APXInf-robo)。这个项目的定位很具体:让具身模型在真实机器人本体上不仅“跑起来”,还要在有限算力、功耗与成本下“跑得够快、够稳、够容易接入”。
官方公布的核心数字是:π0.5(Pi 0.5)FP8在Jetson AGX Thor上的端到端推理延迟从278毫秒降至26毫秒以内,对应约38.46Hz推理频率,满足机器人多场景实时控制对响应延迟的要求。10.7倍的延迟下降,对机器人意味着“感知—决策—动作”闭环被实质性压缩。需要说明的是,这些数字来自项目方自报,未经第三方独立复测;社区实测(Datawhale 9月17日)在RTX 4090上复测π0.5,BF16单步推理31.38毫秒、INT8为25.99毫秒,与官方口径接近但设备不同,不可直接类比。
技术上的做法值得单独说明。APXInf针对每个模型把内存分配与算子执行安排在明确的静态路径中,用CUDA Graph捕获计算流程并复用预分配的缓冲区,减少每次推理的重复开销;底层以Rust构建极简运行时,强调内存安全、可核查可验证,上层保留Python接口以便开发者沿用原有习惯。更特别的是项目把Agentic Engineering纳入设计:模型移植、性能优化与部署验证中的专家经验被整理成Coding Agent可执行的Workflow与Skills(如skills/model-port-workflow),让AI参与新模型的接入与优化——这与多数推理框架依赖纯人工适配的路线形成差异,也是项目自称“Agentic native”的原因。
在任务表现上,官方LIBERO-10评测中,π0.5在Jetson AGX Thor上FP8任务成功率为92.2%、BF16为92.8%,参考实现为92.4%,提速过程中保持了原有任务完成表现。APXInf目前首发支持π0.5与WALL-OSS两款具身模型,覆盖Jetson Orin、Jetson Thor与RTX 4090三类平台;路线图包括Qwen、Groot等更多模型,nvfp4精度极致优化,以及国产芯片算力后端、国产机器人操作系统与AMD等行业生态方向。
背景链条值得交代:2025年9月,无问芯穹联合清华大学等开源了RLinf——全球首个面向具身智能的大规模强化学习训练框架。APXInf正是RLinf生态中端侧推理项目的首发,把“模型训练—效果验证—本体部署”连成一条完整链路。
具身智能的工程共识是:云端聊天机器人可以容忍几百毫秒延迟,机器人不行——持续感知、连续决策与实时控制下,几百毫秒意味着动作迟滞、轨迹不连贯甚至任务失败。APXInf瞄准的正是这个规模化落地绕不开的“最后一公里”。
但边界也要写清:开源与SOTA数字不构成规模化落地的证明。真实机器人上能否长期稳定运行、扛住延迟抖动与内存消耗、在不同本体上可移植,这些问题只能由物理世界给出答案。项目是否真的“补上关键一环”,要等开发者社区用实际部署投票。
[1][2]