李飞飞创办的 World Labs 推出多模态世界模型 Atlas,仅凭少量日常照片即可完成高保真 3D 重建与精准机位调度。Atlas 攻克了几何一致性难关,为具身智能打通了低成本仿真训练的关键路径。
“世界即所发生的一切。”
路德维希·维特根斯坦在百年前写下的名言,如今成为 AI 理解现实空间的注脚。由计算机视觉先驱李飞飞联合创办的 World Labs,近日推出了新一代多模态世界模型 Atlas。官方将其定义为能够同时理解文本、图像、视频和 3D 的世界模型。
在演示中,Atlas 展现了惊人的场景生成能力:仅需输入两三张不同视角的普通照片,模型就能重建出完整的立体场景,并允许虚拟镜头在未曾拍摄过的空间任意穿梭。
长期以来,传统 3D 重建严重依赖高密度的全景拍摄。采集人员必须围绕目标区域进行数百次多角度取样,耗时费力且成本居高不下,3D 内容因此迟迟难以规模化生产。Atlas 打破了这一瓶颈,借助大模型的空间先验能力,几张手机随手拍下的画面即可生成高保真三维模型,海量静态影像资产被赋予了重新激活的可能。
更关键的跃迁在于,Atlas 正在将 AI 生成技术从单纯的影视娱乐“看个逼真”,推向机器人与具身智能所需的“真实到仿真”(Real-to-Sim)。

生成的不再是静态图片,而是能被操作、推演与验证的数字环境。机器人可以在虚拟空间中低成本试错、预判动作结果,随后将学到的策略迁移到现实世界。
过去两年,主流视频生成模型对镜头轨迹的控制大多如同“玄学抽卡”。用户写下提示词,相机轨迹与视角完全依赖模型的随机发散,每次生成都充满不确定性。
Atlas 从底层重构了这一逻辑:它将相机位姿参数作为原生输入,直接引入三维坐标系。World Labs 将其称为“空间上下文”机制。输入模型的每一张照片,都会被锚定在三维空间的精确坐标上,其视角深度也一并参与计算。模型处理的不再是一张张离散像素图,而是一张带有三维骨架的世界草图。
用户由此获得了对虚拟相机的绝对控制权。在官方展示中,仅用几部普通手机同步拍摄,模型便能冻结时间,将视角环绕滑入牛奶飞溅的核心瞬间。

同样,在斯坦福大学主方庭的重建测试中,Atlas 仅根据 2 至 25 张游客随手拍摄的地面视角照片,就补齐了高空俯瞰视角下的三维全景。

很多人看到震撼的生成效果,下意识认为 AI 已经真正掌握了物理世界的运行法则。然而,空间几何与真实物理是两码事。
几何回答的是“物体在哪、形状如何、换个角度是否保持结构一致”;物理回答的则是“推它一下会否倒下、摩擦力有多大、捏多紧会破碎”。Atlas 当前的突破几乎全部集中在空间几何一致性上,对于真正的碰撞、流体形变等物理动态,演示中鲜有涉及。
World Labs 对此十分清醒。团队曾将世界模型分为三类:纯粹输出视觉画面的“渲染器”、生成物理状态的“模拟器”、直接输出行为策略的“规划器”。

按这个标尺衡量,Atlas 正从“渲染器”迈向“模拟器”,但距离理解复杂物理还相去甚远。
随着具身智能基准的演进,行业评测已发生质变。在聚焦具身智能的 WorldArena 评测中,“轨迹精度”与“时空一致性”成为决定性指标。此前影溯的 InSpatio-Curious 尽管视觉打分偏低,却凭借轨迹与深度精度登顶榜首,证明“画得好看”正让位于“算得准确”。

而在 UCLA、耶鲁等机构发布的 WorldBench 物理交互评测中,现有绝大多数生成模型甚至未达合格线。Atlas 展现了无与伦比的视角控制能力,但尚未在公开的物理交互测试中完成大考。
即便尚未完全通晓物理,攻克几何控制依旧对具身智能具有决定性意义。
李飞飞曾坦言,当前机器人发展最大的瓶颈不是算力,而是训练数据。互联网上无穷无尽的图文素材对机器人毫无用处,机器人需要带有物理受力反馈和动作因果关系的高维数据,而真实采集成本极其昂贵。

把真实世界迅速“搬进”虚拟空间,再结合环境随机化让机器人在模拟器中疯狂试错,已经成为行业共识。当年航空工业用飞行模拟器训练飞行员,自动驾驶用仿真引擎累积百亿公里里程,如今具身智能正在复刻相同的工程路径。
Atlas 的意义在于,它大幅压低了构建数字虚拟环境的时间与人力门槛。当构建一个高保真环境仅需几张照片时,“仿真优先、真机验证”的开发范式就能真正普及。
世界模型的终局竞争,正从“谁的画面更像现实”,彻底转向“谁的状态推演更经得起计算”。Atlas 或许还没推开通向真正物理世界的整扇大门,但它推开的这条几何缝隙,已足够让具身智能跨过最沉重的冷启动门槛。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断