前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 前沿/09.14 · 00:00/5 MIN/编译自 雷锋网/3 阅读

TUM教授Angela Dai:以逆向自监督重构3D空间智能

慕尼黑工业大学教授 Angela Dai 提出全新 3D 场景重建路线,摒弃对完美数据的执念,将物理遮挡机制直接转化为结构先验,结合几何骨架与 3D 高斯溅射,推动空间智能从被动重构迈向主动感知。

大模型在文本与 2D 图像上的爆发,很大程度上依赖于互联网海量的清洗数据。但当 AI 试图跨越屏幕理解物理世界时,传统的经验法则迅速失效。

真实的 3D 扫描数据充满噪点与视角盲区,物理遮挡造成的几何缺失既非随机产生,也无法用常规的去噪算法抹平。人工合成数据虽有完整几何,却难以跨越虚实差距的鸿沟。慕尼黑工业大学(TUM)Angela Dai 教授在 ECCV 分享中提出了一种逆向思路:不必执着于消除数据的不完整,而是将真实的物理遮挡机制直接转化为算法的结构先验。

TUM 教授 Angela Dai 演讲

这项研究打破了 3D 场景重建中长期的“均值模糊”瓶颈,勾勒出空间智能(Spatial AI)从静态 3D 重建演进至具身智能大脑的技术路径。

为什么 2D 扩散范式在 3D 空间失效?

2D 图像生成依赖标准的“加噪-去噪”扩散范式,但物理世界的 3D 扫描具有特殊的几何约束。深度传感器在观测现实时,物体相互遮挡带来的视角盲区并不符合常规的统计分布。

物理遮挡问题

面对这种天然残缺,强行让网络去预测完全未知的盲区,很容易导致模型陷入均值收敛,生成模糊的块状结构或大面积留空。破局的关键在于引入物理观测机制,让 AI 利用已知的空无与遮挡关系,在残缺的观测中主动推演完整的几何。

技术支柱一:将物理遮挡转化为逆向自监督

深度传感器观测场景时,会天然界定出三类空间状态:

  1. 已知空域:传感器与物体表面之间的确定开放空间;
  2. 已观测表面:直接被光线捕捉到的几何表面;
  3. 未观测区域:被物体表面阻挡的未知盲区。

三状态编码机制

传统方法试图预测场景中的每一个点,容易盲目补全未观测区域。Angela Dai 团队提出了逆向自监督算法(SG-NN):故意从多帧融合扫描中剔除部分观测帧,构建“更残缺的输入”与“相对完整的标靶”。

训练中,损失函数通过掩码显式忽略所有未观测的未知空间,仅对人工挖空的区域进行监督。网络在第一层将场景编码为稀疏 TSDF 体素,借助稀疏卷积在表面区域进行高效计算;在瓶颈层预测需生成的新几何位置,逐层过滤空域,最终输出紧凑且完整的几何模型。

几何重构流程

技术支柱二:几何骨架结合 3DGS 破解均值模糊

回归模型在局部小盲区表现良好,但在大面积遮挡下仍容易失效。团队引入了可见性引导的流匹配(Seen2Scene)生成模型,将已知表面、已知空域和未知体素分别映射为潜在编码。

长场景生成

通过将场景按局部切片(如 1.5×2 米)进行窗口化计算,模型不仅能在浴室、马桶等高难度盲区合理补全结构,还能无缝拓展至任意尺寸的环境。

在此基础上,团队将底层稳固的几何“骨架”与 2D 扩散模型的“皮肉”渲染能力结合:

  1. 先生成基础几何网格;
  2. 利用成熟的 2D 图像生成模型跨视角合成高纹理画面;
  3. 将生成的像素映射回网格,并采用 3D 高斯溅射(3DGS)进行全局优化。

这种分层解耦的方案解决了传统神经辐射场或全景生成离开中心视角后容易“漂移崩溃”的缺陷,使连贯生成的尺度拉伸到了七至八个房间的环境级空间。

多房间长距离渲染

技术支柱三:从合成反哺重构到具身主动感知

除了真实数据的自监督,团队还探索了利用干净合成数据集(如 SAGE)训练通用几何先验,再反向注入真实场景重构(GenRecon)。模型将多视角图像、相机姿态和稀疏点云在统一空间聚合,即便面对超出合成分布的复杂杂物,依然能准确补全盲区。

更具前瞻性的方向在于具身智能的“主动感知”。当 AI 不再是被动处理已有图像的生成器,而是能利用物理可见性预判未观测空间时,空间智能体便可以自主规划最佳移动路线,探索未知区域,实现环境理解的最优路径闭环。

主动感知推演

技术落地的边界与权衡

针对学术界关心的工程落地问题,Angela Dai 指出,当前三平面(Triplane)等表达的核心限制在于分辨率上限,而非理论架构问题;只要相机位姿与数据分布合理,合成到现实的迁移完全可行。

目前稀疏体素回归模型已具备极高的前向推理速度,满足多数实时需求;而高保真度的扩散生成因多步采样开销,仍存在延迟门槛。通过局部包围盒(Bounding Box)切分计算,可以在精度与计算负载之间找到平衡,为大范围物理空间的实时数字化提供了可行解法。

标签:具身智能自监督学习

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

你的 Agent 一次跑对下次还行吗:Pass^k 把一致性差距砍到一半
置顶

你的 Agent 一次跑对下次还行吗:Pass^k 把一致性差距砍到一半

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄
置顶

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
置顶

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

//

24小时热榜

OpenAI推ChatGPT广告新功能:支持赞助智能体与Shopify
TOP1

OpenAI推ChatGPT广告新功能:支持赞助智能体与Shopify

英美荷联手曝光伊朗间谍软件:专盯异见人士与记者
TOP2

英美荷联手曝光伊朗间谍软件:专盯异见人士与记者

3

12分钟跑完5亿元地产投资模型:Claude 颠覆了什么

20小时前
12分钟跑完5亿元地产投资模型:Claude 颠覆了什么
4

别等想清楚再动手:用AI拆解庞大任务的“最小第一步”

20小时前
别等想清楚再动手:用AI拆解庞大任务的“最小第一步”
5

AI竞争的终局不是做大模型,而是争夺基建与权力

20小时前
AI竞争的终局不是做大模型,而是争夺基建与权力
6

AI在狂飙,但人类习惯走得很慢

20小时前
AI在狂飙,但人类习惯走得很慢
7

逃去超市当收银员后,我算出了自己被机器人淘汰的倒计时

20小时前
逃去超市当收银员后,我算出了自己被机器人淘汰的倒计时
8

软件正在吃掉自己:当所有专业都被冠上“产品”前缀

20小时前
软件正在吃掉自己:当所有专业都被冠上“产品”前缀
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断