清华系具身智能公司星动纪元自研的世界动作模型VPP2登顶RoboDojo榜单,在综合成功率与平均得分上超越GPT与英伟达同类模型。该模型通过解耦视频预测与动作学习,实现了泛化能力向物理真机的迁移。
在世界动作模型(WAM)赛道,清华大学持股的具身智能企业星动纪元近期取得突破。其自研的世界动作模型VPP2在具身智能基准RoboDojo仿真榜单中取得综合平均成功率32.26%、综合平均得分39.26分,位居榜首,超越了GPT-6-Astra、Physical Intelligence的π0.5以及NVIDIA GR00T-N1.7等模型。

RoboDojo由香港大学MMLab联合全球近20所学术机构建立,包含42项双臂操作任务,覆盖泛化、精准操作、长程任务、记忆及开放词汇指令理解五个维度。VPP2在未添加额外数据或外挂增强策略的情况下,基于标准数据集完成了训练,并在泛化能力、精细操作与记忆能力三个单项维度同样排名第一。

在基准测试中,GPT-6-Astra的平均成功率为22.48%,得分为28.97分,VPP2分别超出9.78个百分点和10.29分。除仿真环境外,星动纪元将VPP2部署至真实的ALOHA双臂机器人上,针对抓取、放置、堆叠、折叠、倾倒等10类零样本操作任务进行实机测试,取得了58.5%的平均成功率,高于π0.5的40%,并在其中9类任务中取得最优成绩。
传统世界动作模型的核心痛点在于:视频预测虽逼真,但不符合物理规律或无法转化为有效动作,直接联合训练又容易破坏模型的泛化能力。针对“预测误差导致动作错误”的问题,星动纪元提出了视频预测与动作学习分阶段训练的方案:

在LIBERO-Pro环境与布局泛化测试中,VPP2取得45.0%的成功率(基线最高为11.0%);在考察未见任务组合的LIBERO-OOD测试中,成功率达到63.9%。
星动纪元还探索了“通用认知+通用物理执行”的协作模式:由高层视觉语言模型(VLM)负责语义理解、记忆与步骤规划,底层VPP2负责物理变化预测与动作生成。实验表明,在长程任务测试中引入VLM子任务规划后,任务平均成功率由27.6%提升至57.6%。
目前,星动纪元正加速推进全栈软硬件布局,其具身方案已在部分物流中心落地验证。该团队已将VPP2开源,开放代码与模型主页供学术界与工业界复现:
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断