李飞飞团队创立的 World Labs 发布全球首个多模态世界模型 Atlas。只需一张图,Atlas 就能生成像素级相机控制的 1440p 视频,重建 3D 空间,并能为机器人模拟训练提供逼真的 RGB 与深度数据。
一张图补全 3D 世界,还能给机器人造训练场。李飞飞创立的 World Labs 发布新一代世界模型 Atlas,官方称其为「全球首个」多模态世界模型,口号是「建模世界,移动相机,模拟空间和时间」。

与之前只是生成可互动视频的模型不同,Atlas 能以像素级精度控制相机来生成图像和视频帧,同时完成 3D 重建,并理解空间与时间。李飞飞本人将其视为 World Labs 的里程碑成果:
Atlas 为从视觉特效到机器人的众多应用场景打开了大门。

英伟达机器人主管 Jim Fan 也评价,这是机器人领域 Real-to-Sim 的一大步。
Atlas 是一个多模态自回归扩散 Transformer(全能模型),核心能力包括:

机器人模拟方面,只需给 Atlas 几张照片,它就能生成逼真的 RGB 和深度数据,让机器人在更多模拟空间里训练和测试。
Atlas 的特别之处在于「全能模型」(omni model)设计:在一个统一架构中处理多种任务、多种输入和输出。空间控制是整个模型的核心。
团队设计了一套全新的基础架构——多模态自回归扩散 Transformer。文本、图像、视频、3D 数据等输入都会被锚定在三维空间中,形成空间上下文,Atlas 再据此生成多模态输出。比如把两张毫无关系的参考图片放进同一上下文,分别指定它们在 3D 空间中的位置,就能缝合出一个空间自然、连续的世界。

具体而言:
Atlas 实际上融合了大语言模型和视频模型中的大量思想。它既能用 KV Cache、缓存感知路由、解耦式服务等 LLM 推理加速技术,又像现代图像和视频生成模型一样,可以在潜空间执行扩散生成,支持扩散蒸馏、无分类器引导、移位噪声调度,并引入更先进的 VAE 架构。
研究团队在相机控制生成和 3D 重建两个关键任务上做了定量评估。结果显示:相机轨迹越复杂,Atlas 相对 SOTA 视频模型的优势越大;在稀疏视角 3D 重建中,Atlas 同样超过表现最好的专业开源 3D 重建模型。


团队还表示,Atlas 从设计之初就为 Scaling 做好准备,已有证据表明其能力会随规模扩大继续提高。目前 Atlas 已向部分合作伙伴开放早期访问,也可在官网申请权限。

今年 6 月,李飞飞曾将世界模型分为渲染器、模拟器、规划器,并强调最关键的是模拟器。7 月,World Labs 收购机器人仿真公司 SceniX,随后公开 Real-to-Sim-to-Real 系统,指出机器人最大的瓶颈是缺乏廉价、可控、可扩展的训练经验。
Atlas 的出现,打通了从真实照片/视频到 3D 空间、再到机器人传感器视图和可变化模拟环境的路径。World Labs 表示,Atlas 将成为未来版 Marble 以及其他产品的底层模型。
更多技术细节可查看 World Labs 官方博客。
免费获取企业 AI 成熟度诊断报告,发现转型机会
原文链接:量子位
本文由前途科技编辑整理
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断