权威世界模型基准评测WorldArena 2.0结果揭晓。评测全面引入在线强化学习与真实机器人闭环验证,JEPA与空间智能路线正面交锋,推动世界模型从单纯视频生成迈向实际机器人任务落地。
世界模型的竞技重心,正在从生成高质量预测视频,转向能否在真实机器人系统中稳定落地。如果模型无法准确推演动作执行后的物理变化、无法支撑闭环策略训练,生成画面再逼真也难以转化为机器人的通用操作能力。
由清华大学团队联合多所海内外高校与科研机构发起的 WorldArena,是目前世界模型领域最权威的评测基准之一。在 1.0 版本中,评测主要聚焦在纯视觉输入、仿真环境及离线任务;而在最新的 WorldArena 2.0 中,评测体系全面升级,模态拓展至视触觉融合,功能延伸到在线强化学习(MB-RL),平台也直接引入真实机器人执行。

WorldArena 2.0 针对世界模型的具身落地难点,设立了三条独立赛道:

全球终榜揭晓后,各大技术路线在不同维度展现出鲜明的性能特征:
在 Track 1 中,主打隐空间表征学习的视启未来凭 WorldIncept 模型夺得第一(72.33分),并在物理遵循性、3D 准确性和语义对齐三项分项指标中拔得头筹。同济大学空间智能团队的 BWM-Turbo 模型以 71.49 分位列第二,该方案基于 DiT 架构并结合动态记忆,在背景一致性和表征相似度上表现突出。

在 Track 2 在线交互赛道中,北京中关村学院的 MW2 以 72.93 分夺冠。晨昏线科技的目标因果世界模型 TTWM 以 72.40 分紧随其后。数据显示,利用该世界模型作为强化学习环境训练后,基线 VLA 模型的下游任务成功率从 55.46% 跃升至 72.40%,展现了动作因果推演对策略学习的直接推动作用。

在 Track 3 真机操作赛道中,小米机器人团队的 ViTacX 夺得综合冠军,并在纯视觉子榜中以 85.00 分大幅领先,在擦桌、倒水等多项常规任务中达成 100% 成功率。而在接触密集的视触觉子榜中,长期深耕触觉感知与机械操作的上海科技大学 OmniFlow 团队表现更为稳健,在纯视觉和视触觉双榜均位居前二。

从赛事结果来看,学院派与产业派呈现出互补态势:高校团队在新型网络拓扑与目标函数探索上更为敏捷,而企业团队在工程部署、数据清洗与系统稳定性上更具优势。
据主办方清华团队介绍,虽然领先模型在受控单任务中已能呈现因果响应,但真实机器人落地仍面临多重物理瓶颈:在接触密集的任务中,模型仍难以精确建模非线性力反馈;长时推演中的误差级联,以及硬件毫秒级通信延迟,也极易造成策略执行漂移。
未来的评测基准将进一步拓展更高频的双向闭环交互、执行失误后的自主纠错,以及触觉多模态深度融合能力,推动世界模型真正从“生成画面”转向“驱动物理实体”。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断