一个模型同时占据四个能力子榜单的榜首,在具身智能领域十分罕见。
由智元机器人联合高校、科研机构及行业力量发起的评测平台 RoboColiseum,将评估拆解为四个维度:指令跟随、空间理解、扰动适应与通用操作。只要模型在任何一个环节存在结构性短板,排名就会下滑。原力灵机的通用具身基础模型 DM0.5 在这四个子榜上全部位列第一,成为目前唯一实现全项登顶的模型。

一把可信的具身标尺
具身模型越是层出不穷,行业就越需要细颗粒度、可信赖的公共标尺。传统具身评测长期存在三大痛点:
- 仿真表现高、真机落地差:仿真环境中的物理渲染与现实差异巨大。RoboColiseum 借助空间智能技术与激光雷达高保真重建环境,并校准动静摩擦力、机器人相机内外参等物理参数,使仿真与真机的表现一致性达到 89.5%,单项任务成功率差异收窄至 10% 以内。
- 评测基准易被刷穿:部分评测在推出半年后即被过度拟合。RoboColiseum 包含 78 个任务与超过 3000 个泛化测试用例,严格隔离训练集与评测集,彻底杜绝轨迹回放等投机策略。
- 单点能力脱离实际:真实场景往往要求复合能力。工厂分拣机器人需要同时理解调度、感知包裹三维位置、抗干扰并流畅组合动作。RoboColiseum 的四个维度分别对应语义基础、认知、鲁棒性与落地执行,构成了完整的考核链条。

为什么四榜第一远难于单项冠军?
在四个子榜上,DM0.5 的成绩分别为:指令跟随 0.8444、空间理解 0.6146、扰动适应 0.7344、通用操作 0.6370。四项能力考查模型不同层级的机制,短板无法被其他维度的优势掩盖。DM0.5 能全面领跑,得益于针对性的底层架构:
- 指令跟随:在预训练阶段引入具身思维链(Embodied Chain-of-Thought),动作生成前先完成内部推理(目标定位、动作衔接与自检),掌握“指令-本体-环境”的深层关联,具备零样本(Zero-shot)泛化能力。
- 空间理解:预训练阶段吸收了 10 万小时的第一视角(Egocentric)视频数据,支持毫米级 3D 标注生成。相关论文《GeoVLA》将显式三维几何表征引入 VLA(视觉-语言-动作)决策,入选 IROS 最佳论文提名。
- 扰动适应:通过工程优化将模型延迟压减 9.29 倍至 57.49 毫秒,响应速度超越人眼眨眼时间,干扰出现的瞬间便能完成重感知与重决策;同时搭载 60 秒原生记忆,受扰后可无缝续接任务。
- 通用操作:在复合技能组合上表现稳定。物流分拣中无需预设脚本,纯靠视觉实时决策实现超 99% 的准确率;亚毫米积木拼装出现失误时可在半秒内自主纠错;还能驱动 58 个自由度的灵巧手完成削切果蔬等非刚性柔性物体操作。

检验通用底座真实水平
值得注意的是,DM0.5 在 RoboColiseum 评测中未进行定向刷榜优化,而是直接依赖通用的预训练底座,仅通过常规监督微调(SFT)适配任务与机型构型。这最大程度反映了底座模型的真实泛化能力,避免了传统任务特化带来的分布外失效问题。

这一表现在多个权威考场得到了交叉印证:
- 在港大、UC 伯克利等发起的 RoboDojo 评测中,DM0.5 夺得榜首,尤其在记忆维度取得 47.74 分与 47.44% 成功率,大幅领先第二名(13.37 分/12.11%)。
- 在真机与仿真基准 LIBERO 上取得 99.0% 综合成功率;在 RoboChallenge Table30 V2 真机评测中,面对 ARX5、UR5、ALOHA 等 4 种异构机型与 30 个复杂任务,以 43.0% 成功率位列第一。
- 海外前沿机构 Physical Intelligence(π)在发布 MEM 记忆架构论文及旗舰产品 π0.7 时,均引用了原力灵机的 MemoryVLA 作为学术参照。

推理提速、全面开源与产业落地
目前原力灵机围绕 DM0.5 推进了三项关键进展:
- 控制进入实时窗口:结合 TensorRT、FlexAttention、FP8 与 Triton 算子融合等底层优化,模型核心延迟降至 57.49 毫秒,API 端到端响应在 70 毫秒以内,大模型算力首次完全契合机器人实时硬件控制节拍。
- 全面开源生态:模型权重、训练框架以及从下游基准到真机 SO101 的完整流程已在 GitHub 和 Hugging Face 开放,并回馈 LeRobot 社区。原力灵机也当选国际电联(ITU)具身智能焦点组开源生态工作组组长。
- 真机产业验证:DM0.5 已进驻大型国际零售商仓储与 3C 制造工厂,执行混流协同搬运、分拣、包装及产线物料回收等长流程任务。