前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 前沿/09.17 · 00:00/4 MIN/编译自 雷锋网/3 阅读

港科大谭平:3D几何如何增强视觉大模型

香港科技大学谭平教授在ECCV上提出,视觉大模型具备强大的局部先验,但跨视角与长距离生成仍面临全局不一致瓶颈。通过将前馈神经网络与经典3D几何约束结合,团队有效提升了大规模场景重建与生成的稳定性。

在生成式 AI 的快速发展中,Sora 等视频和图像扩散模型展现出惊人的视觉生成能力。大规模 2D 数据赋予模型丰富的视觉与语义先验,但在需要多视角、长距离 3D 一致性的复杂任务中,仅靠数据驱动的局部先验仍然面临巨大挑战。

现有视觉大模型在生成 3D 场景时,常常出现跨视角结构错乱、物体数量反常或建筑结构扭曲等问题。例如,提示词包含“卧室”时可能生成多张床,虚拟相机长距离漫游时背景也会逐渐变形。香港科技大学谭平教授指出,这表明模型欠缺全局 3D 结构的约束,而显式引入 3D 几何,可以为局部预测提供稳定的跨视角骨架。

港科大谭平:3D 几何如何增强视觉大模型

在 ECCV 演讲中,谭平团队展示了如何将深度学习强大的表达能力与经典多视图几何、全局优化深度融合。

神经场景表示:破解大规模 SfM 的显存瓶颈

以 VGGSfM 和 DUSt3R 为代表的 Transformer 架构虽然在局部 3D 重建上表现亮眼,但面临严峻的计算瓶颈。实验表明,在消费级 GPU 上,这类网络通常难以一次性处理超过 100 张图像。

借鉴传统视觉 SLAM 中分离建图与追踪的思想,团队提出了基于神经场景表示的大规模 SfM 流程:

  1. 从海量图像中均匀采样锚点帧(关键帧),送入前馈网络获取初始 3D 结构;
  2. 引入随机 Token 采样策略,每张图仅保留 20% 到 50% 的 Token,聚合为一个轻量级的全局高维“3D 地图”;
  3. 海量非关键帧只需通过帧间注意力机制与该场景表示交互,即可快速求得相机位姿、深度图和点云。

轻量化流程图

在 Tanks and Temples 数据集测试中,约 70% 的样本相对旋转和平移误差控制在 5 度以内,伪影和重影明显减少,基于该位姿训练的 NeRF 渲染质量甚至优于传统 COLMAP。

Global 3R:前馈网络与全局 SfM 的几何优化

为了进一步抑制超大场景中的误差累积,团队推出了 Global 3R 框架,将前馈预测与全局运动恢复结构(SfM)优化深度融合。

Global 3R 架构

系统首先利用滑动窗口内的匹配网络估计相对运动,自适应选取局部关键帧进行特征对齐并计算置信度;随后构建位姿图,进行旋转与平移平均,并最终执行严谨的集束调整(Bundle Adjustment, BA)。

实验数据显示,BA 优化起到了决定性作用:相对旋转误差(1 度阈值内)达标率从初始前馈预测的 70% 跃升至 90% 以上;相对平移误差的精度则由 35% 直接翻倍至 70% 以上,显著消除了物体重复重建等重影缺陷。

结构化 3D 场景生成:从显式布局到自由漫游

在 3D 场景生成领域,团队针对扩散模型缺乏全局约束的问题,递进式推进了三项工作:

  • ControlRoom:将生成流程解耦为“布局生成”与“外观生成”。先用扩散模型生成带语义的 3D 边界框(Bounding Box),渲染出语义全景图后,再作为 ControlNet 信号引导高保真全景生成,解决了一间卧室生成多张床的常识错误。
  • SpatialGen:针对固定全景图视角受限和数据稀缺问题,团队开源了包含 5.7 万个房间、近 100 万个 3D 边界框的 SpatialGen 数据集,并训练了多模态扩散模型,联合输出 RGB、语义及场景坐标图,最终迭代融合至 3D 高斯(3D Gaussian)中,支持大范围风格迁移。
  • SpatialCraft:摆脱了必须输入显式 3D 布局的限制。模型仅需单张图片,即可推断出作为空间基底的“3D 代理(Proxy)”,渲染出保持像素对齐的粗略漫游视频;第二阶段再利用视频扩散模型进行超分辨率与纹理细化,即便在长距离相机运镜下,仍能维持场景结构的稳定一致。

SpatialCraft 框架

谭平教授表示,3D 几何并非要与深度学习对立,而是连接重建与生成的“脚手架”:学习算法提供极具表现力的局部先验,而几何法则负责构建全局一致的世界体系。

标签:计算机视觉扩散模型世界模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

//

24小时热榜

OpenAI发布对齐失效报告框架,曝光模型偷盗密钥与伪造数据
TOP1

OpenAI发布对齐失效报告框架,曝光模型偷盗密钥与伪造数据

时薪3万美元!小米实时直播新大模型强化学习训练
TOP2

时薪3万美元!小米实时直播新大模型强化学习训练

3

英王查尔斯召集AI巨头闭门会谈

3小时前
英王查尔斯召集AI巨头闭门会谈
4

OpenAI推ChatGPT广告新功能:支持赞助智能体与Shopify

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
20小时前
OpenAI推ChatGPT广告新功能:支持赞助智能体与Shopify
5

港科大谭平:3D几何如何增强视觉大模型

20小时前
港科大谭平:3D几何如何增强视觉大模型
6

Nvidia 宣布支持原生 GPU 内核 Rust 编程,直接编译到 PTX

20小时前
Nvidia 宣布支持原生 GPU 内核 Rust 编程,直接编译到 PTX
7

华为将发布昇腾960芯片,对标英伟达加速算力破局

8小时前
华为将发布昇腾960芯片,对标英伟达加速算力破局
8

ChatGPT 上线分析套件:量化企业 AI 业务价值与回报

13小时前
ChatGPT 上线分析套件:量化企业 AI 业务价值与回报
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断