World Labs发布全球首个多模态世界模型Atlas。早在3月,国内团队影溯已开源同类模型,其InSpatio-Curious以66.11分登顶WorldArena 2.0。
20多年前,计算神经学家杰夫·霍金斯写道:“智能不只是模式识别,更是对世界的建模。”现在,世界模型正密集迎来自己的里程碑时刻。
9月2日,由李飞飞创办的World Labs发布全球首个多模态世界模型Atlas。它把文字、图像、视频和3D信息放入统一的空间上下文,不只是生成合理的二维画面,还能在三维空间中理解并维持场景结构。只需一张或几张图片,就能重建三维场景、生成新视角,并让相机沿指定轨迹移动,同时保证空间一致性。


Atlas发布后好评如潮。不少网友认为这是空间智能的重要突破,李飞飞本人也称这一刻为“里程碑”。


有趣的是,早在今年3月,国内空间智能团队影溯已开源类似世界模型InSpatio-World,并透露升级版即将发布、继续保持开源。输入一段普通视频,InSpatio-World会尝试从有限的时空观测中,构建一个可以继续探索的动态4D场景;它同样允许用户改变原始相机轨迹,绕到没拍过的位置观察。

与Atlas不同的是,InSpatio-World还把时间视为需要显式处理的维度。用户能在已有事件范围内改变观察时刻,从新的视角重新观察同一段动态过程。

如果简单区分:Atlas从图像出发,把相机位置变成访问3D世界的坐标,像一座可随意选择机位的AI虚拟片场;InSpatio-World从视频出发,把时间也纳入动态世界的建模与探索,目标是让现实录像变成可驱动世界,给物理AI当陪练。
影溯最近一项出圈成绩,是登顶世界模型权威榜单WorldArena 2.0。截至8月27日,影溯的InSpatio-Curious以66.11分排在第一,共有77个模型参评。除了总分第一,它还在Physics Adherence、Trajectory Accuracy、JEPA Similarity和Depth Accuracy四项指标上排名第一。


具体来看,Trajectory Accuracy得分64.89,领先第二名3.02分;Depth Accuracy达99.29分;JEPA Similarity为98.36分,说明生成结果在时空表征上与真实世界高度接近;Physics Adherence则以73.24分登顶。
需要注意的是,InSpatio-Curious的Image Quality只有60.64分,比综合排名第二的模型低了近9分,却仍拿下总分第一。这或许说明,它赢在轨迹、深度、时空表征和交互一致性这些更底层的维度,而不是靠把画面打磨得更漂亮。

WorldArena由清华、上交、港大等高校联合发起,2.0版更像是为具身世界模型准备的“机器人考场”。它不只看画面是否清晰,还会检查机械臂运动轨迹是否准确、场景深度与空间关系是否稳定,以及物体受力后是否符合物理逻辑。对具身智能而言,轨迹不准、空间关系错乱甚至不遵守物理规律,画面再漂亮也难用于机器人训练。
当然,WorldArena 2.0目前的评测仍以标准化仿真环境和机器人操作任务为主,对工厂、家庭、城市和户外等长尾场景覆盖有限。Track 1的总分主要由生成与视觉代理指标构成,能判断碰撞在视觉上“合不合理”,却不直接测量真实世界中的力、摩擦、质量和惯性。也就是说,在固定题库里拿高分,不等于换场景、换机器人后仍能稳定发挥。它是有诊断价值的工具,但还不是通用空间智能的“毕业证”。
也正因如此,影溯把目光投向更上游。8月29日,在第二届中国空间智能大会上,影溯联合20余家高校团队和行业机构,启动大规模空间智能3D数据开放计划SIDO。

SIDO覆盖数据生产、模型训练到应用反馈的完整链路,参与方包括高校、激光雷达、机器人、3D生成、数字空间与产业应用等。未来两年,它计划建设百万级3D/4D场景数据底座,同步推进评测基准建设,围绕3D重建与生成、场景理解、空间推理、动态预测和具身规划等任务建立统一标准。
模型负责学习世界,数据负责提供足够丰富的世界,评测基准负责判断模型究竟学会了多少。当模型开始触及现有数据与评测体系的边界,下一阶段的竞争便不只是算法优化,还包括把数据、任务和评价标准一起向前推进。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断