最终,这种全栈优化可带来效率的巨大提升。Orin 上的优化阶梯可以说明这一点:baseline 为 1300ms,经 torch.compile、Pipeline、Graph、Kernel、Pruning 逐级下探,最终落到 119ms,整体提升超过 10.9 倍。Thor 上也同样如此。
[图片: https://n.sinaimg.cn/spider20260929/164/w1032h732/20260929/aebc-dc67845252868e98f0c113faaeba7925.png]
效果上,官方的评测协议是 LIBERO-10 全部 10 个任务各 50 个 episode,seed 固定为 7,replan 步长为 5,共 500 次 rollout。Thor FP8 成功率 92.2%,Thor BF16 92.8%,Orin BF16 92.0%,作为参照的 π0.5 参考实现是 92.4%。
[图片: https://n.sinaimg.cn/spider20260929/35/w623h212/20260929/85c6-c648e75f51cd7cba1d891c6ab36bd129.png]
跑得快之外,还要跑得稳。APXInf 底层聚焦高性能算子,实现性能的极致压榨;推理框架的主体部分则选择使用Rust 语言开发,作为一种系统语言,Rust 能够提供低成本、细粒度的系统运行时控制,实现更优的调度与并发管理。同时,Rust 的强制 RAII 特性与所有权系统,极大地收束了内存问题的风险面,支持更加安全鲁棒的资源生命周期管理,unsafe 收口被严格限制在固定的 FFI 边界。中间这一层的系统级价值,是让野指针、数据竞争这类隐蔽故障尽量在上线前就被消灭;对一台要连续工作的机器人来说,这不只需要能「跑到 38Hz」,更是能「连续跑八小时之后还是 38Hz」。
特化路径带来了性能,也带来了新问题:为每个模型族手写一条路径,意味着模型一更新、硬件一换代,这条路径就要重做一次。如果这部分工作仍然依赖少数专家手工完成,那永远也跟不上具身模型的迭代。
[图片: https://n.sinaimg.cn/spider20260929/63/w1080h583/20260929/2c29-09677595a19bc09c032701f74336dd74.jpg]
APXInf 的解法是把这套工程能力本身产品化:把原本散落在少数专家经验里的模型接入、前后处理、本体适配、性能调优与部署验证,沉淀为代码 Agent 可以理解、调用和持续迭代的工程流程。
在这种全新的工作流中,人机分工呈现出一种颠覆性的模式:
Agent 负责跑流程:读取 PyTorch Reference,生成执行 Ledger,实现模型的静态路径,逐算子对拍与回归,最后完成 Autotune、文档与迭代。
人负责定标准:架构边界与模块职责、Kernel 契约与安全规范,精度、性能与任务的验收线,以及决定何时把共性抽取为共享抽象。
[图片: https://n.sinaimg.cn/spider20260929/630/w1080h350/20260929/a8ff-e2fa389db746a5cec6150af67247ee46.png]
交给 Agent 的不再是简单的辅助工作,而是最消耗专家时间的实现部分,人则进化为把控全局的「判据」与「决策者」。
也正因为实现可以交给 Agent,验证体系严谨性成为了新的核心护城河。APXInf 建立了三重保障:
全链路分层验证:从单算子、Layer 到完整模型,配合 Eager 与 Graph 路径的交叉对拍,确保每一步都精准可控。
Fail-closed(故障封闭)原则:不支持的参数或硬件直接报错,绝不静默输出错误结果。
模型族隔离:共享能力仅在 Kernel 层下沉,任何变更必须经过严格的分层回归,从而锁死风险。
对具身企业而言,它把推理优化从一次性项目变成了可持续的工程能力。自研模型改一版,不必重新排队等专家;换一款芯片,不必把上一轮的调优经验推倒重来;团队规模不再是接入速度的硬约束。更重要的是,专家经验从个人手感变成了团队可复用的资产。
对于行业,它提供了一种新的基础设施建设方式。过去衡量一个推理框架,看的是支持多少模型、适配多少硬件、算子库有多全,这些指标背后的假设是接入成本固定,所以覆盖面越广越好。而当接入成本本身开始下降,真正值得看的就变成了:接入一个新模型、上一款新本体需要多少时间。这衡量的是一家具身公司把新模型变成实际产能的速度。
从 Mizar 到 APXInf
端侧推理技术栈向物理世界延伸
APXInf 并非一个从零开始的实验性项目,而是无问芯穹在端侧推理领域长期积累的必然结果。
APXInf 的技术基因直接承袭自面向智能终端的推理加速引擎 Mizar。早在 Mizar 阶段,无问芯穹围绕 AI PC、AI 盒子和一体机等终端,已逐步形成异构硬件适配、本地模型部署、推理加速、内存优化与低功耗运行等核心能力。这套技术栈不仅支撑本地模型规模数倍提升、推理性能翻倍,还在相同算力资源下带来了 18% 的智能水平提升。
更重要的是,这一技术路线已走过实验阶段,并通过了严苛的量产检验。2025 年 2 月,无问芯穹与联想达成深度合作,将 Mizar 引擎植入联想新一代 AI PC,并于同年 11 月达成超千万台 AI PC 的预装合作。APXInf 正是在此基础上的再次进化。
AI PC 与具身端侧的负载并不相同,但两者面对的约束是一致的:在有限的算力、内存和功耗条件下,达到可用的推理速度。
针对具身场景提出的全新挑战,APXInf 进行了技术延展:无论是面对更复杂的 VLA 模型多模态执行链路,还是应对机器人毫秒级的实时控制需求,APXInf 都能通过底层的极致优化,充分释放硬件性能。同时,面对模型的高速迭代,它又引入了面向 Agent 开发的工程流程。这不仅实现了原有端侧能力的「无缝平移」,更完成了针对具身行业的「深度适配」。
生态布局的另一重考量,是「工程闭环」的无缝衔接。APXInf 选择在RLinf 开源生态中首发,是因为模型训练与本体推理本就是同一条工程链路上的两个环节。
RLinf 覆盖强化学习训练、评测与真实机器人工作流,而训练完成的具身模型要真正进入本体,还需要一套针对小 batch、低时延和有限功耗设计的推理引擎。APXInf 接的正是这一棒,把 RLinf 的能力从训练与评测延伸到端侧推理与部署,让开发者能在同一套生态里走完从训练、验证到本体运行的全程。
就在今天,APXInf 已同步完成π0-fast、GR00T 与 Qwen Drive 的适配,模型支持进一步覆盖机器人操作、移动智能体等不同具身场景。
硬件侧,AMD 与国产芯片后端也已进入路线规划。未来将支持更多具身模型在不同端侧设备上高效、稳定运行。
具身智能要真正走进物理世界,模型、本体和中间这层基础设施缺一不可。面对庞大的接入和验证工程,这也是 APXInf 选择开源共建的初衷。
如果你正在把 π0.5 这类具身模型部署到机器人上,手上有 RTX 4090、Jetson Thor 或 Orin,或者希望为 APXInf 接入新的模型、芯片乃至参与模型接入 Skill 与 Agentic 部署流程本身的建设,都欢迎上手体验、提交 Issue 或贡献 PR。
