香港科技大学谭平教授在ECCV上提出,视觉大模型具备强大的局部先验,但跨视角与长距离生成仍面临全局不一致瓶颈。通过将前馈神经网络与经典3D几何约束结合,团队有效提升了大规模场景重建与生成的稳定性。
在生成式 AI 的快速发展中,Sora 等视频和图像扩散模型展现出惊人的视觉生成能力。大规模 2D 数据赋予模型丰富的视觉与语义先验,但在需要多视角、长距离 3D 一致性的复杂任务中,仅靠数据驱动的局部先验仍然面临巨大挑战。
现有视觉大模型在生成 3D 场景时,常常出现跨视角结构错乱、物体数量反常或建筑结构扭曲等问题。例如,提示词包含“卧室”时可能生成多张床,虚拟相机长距离漫游时背景也会逐渐变形。香港科技大学谭平教授指出,这表明模型欠缺全局 3D 结构的约束,而显式引入 3D 几何,可以为局部预测提供稳定的跨视角骨架。

在 ECCV 演讲中,谭平团队展示了如何将深度学习强大的表达能力与经典多视图几何、全局优化深度融合。
以 VGGSfM 和 DUSt3R 为代表的 Transformer 架构虽然在局部 3D 重建上表现亮眼,但面临严峻的计算瓶颈。实验表明,在消费级 GPU 上,这类网络通常难以一次性处理超过 100 张图像。
借鉴传统视觉 SLAM 中分离建图与追踪的思想,团队提出了基于神经场景表示的大规模 SfM 流程:

在 Tanks and Temples 数据集测试中,约 70% 的样本相对旋转和平移误差控制在 5 度以内,伪影和重影明显减少,基于该位姿训练的 NeRF 渲染质量甚至优于传统 COLMAP。
为了进一步抑制超大场景中的误差累积,团队推出了 Global 3R 框架,将前馈预测与全局运动恢复结构(SfM)优化深度融合。

系统首先利用滑动窗口内的匹配网络估计相对运动,自适应选取局部关键帧进行特征对齐并计算置信度;随后构建位姿图,进行旋转与平移平均,并最终执行严谨的集束调整(Bundle Adjustment, BA)。
实验数据显示,BA 优化起到了决定性作用:相对旋转误差(1 度阈值内)达标率从初始前馈预测的 70% 跃升至 90% 以上;相对平移误差的精度则由 35% 直接翻倍至 70% 以上,显著消除了物体重复重建等重影缺陷。
在 3D 场景生成领域,团队针对扩散模型缺乏全局约束的问题,递进式推进了三项工作:

谭平教授表示,3D 几何并非要与深度学习对立,而是连接重建与生成的“脚手架”:学习算法提供极具表现力的局部先验,而几何法则负责构建全局一致的世界体系。
免费获取企业 AI 成熟度诊断报告,发现转型机会

关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断