无问芯穹联合清华与上交开源具身端侧推理引擎APXInf,专为机器人本体实时控制设计。该引擎将PI 0.5模型端到端延迟降至26ms以内,频率提升至38.46Hz,补齐具身智能规模化落地的端侧算力短板。
对于需要连续感知与实时决策的机器人而言,云端几十毫秒的延迟在端侧可能直接导致动作迟滞、轨迹不连贯甚至任务失败。具身智能要从概念验证走向规模化应用,核心难点在于端侧的实时闭环与算力功耗控制。
针对这一痛点,无问芯穹联合清华大学、上海交通大学正式开源具身智能端侧推理引擎 APXInf。该引擎覆盖从模型开发、效果验证到机器人本体部署的完整链路,支持 NVIDIA RTX 4090、Jetson Orin 与 Jetson Thor 等主流计算平台。

在基准测试中,APXInf 展现了亮眼的性能:

具身智能落地面临双重诉求:本体端需要低延迟、低功耗与高稳定性;开发者端则需要模型快速适配与低成本扩展。APXInf 通过系统级架构创新兼顾了这两大维度:
1. 端到端性能极致优化
APXInf 并不单抓特定算子的峰值算力,而是针对机器人感知-决策-控制链路进行全流程优化。系统结合流水线调度、计算图优化、低比特量化(如 FP8)以及融合算子生成技术(Agent4Kernel),压榨有限算力,实现毫秒级响应闭环。

2. 采用 Rust 运行时保证长效稳定
机器人端侧推理需要应对长时间复杂并发环境,偶尔出现的系统抖动或内存泄漏都可能造成硬件失控。APXInf 底层选用兼具内存安全性与零成本抽象的 Rust 语言构建运行时,大幅规避潜在的内存溢出与并发风险,同时通过顶层 Python 接口封装,保留了开发者的易用性体验。

3. 面向 Agentic 工程演进
随着多模态大模型与 VLA(视觉-语言-动作)架构的快速更新,传统编译器方案在适配新模型时耗时费力。APXInf 从架构之初引入面向智能体辅助工程(Agentic Engineering)的设计思路,通过模块化隔离与标准化工具链,让新模型的算子适配与迁移流程更加敏捷。
此前,无问芯穹与清华等团队曾联合发布具身大模型强化学习后训练框架 RLinf。随着 APXInf 的开源,RLinf 生态正式延伸至机器人本体推理端,形成了从“模型训练与策略评测”到“端侧推理与本体部署”的完整开源工具链。
APXInf 首发支持 PI 0.5 与 WALL-OSS 两款模型,后续将持续拓展对 Groot、Qwen 系列 VLA/VLM 架构以及国产计算芯片、国产机器人操作系统的适配支持。
项目开源代码与快速上手指南已在 GitHub 开放:APXinf-robo 代码仓库。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断