慕尼黑工业大学教授 Angela Dai 提出全新 3D 场景重建路线,摒弃对完美数据的执念,将物理遮挡机制直接转化为结构先验,结合几何骨架与 3D 高斯溅射,推动空间智能从被动重构迈向主动感知。
大模型在文本与 2D 图像上的爆发,很大程度上依赖于互联网海量的清洗数据。但当 AI 试图跨越屏幕理解物理世界时,传统的经验法则迅速失效。
真实的 3D 扫描数据充满噪点与视角盲区,物理遮挡造成的几何缺失既非随机产生,也无法用常规的去噪算法抹平。人工合成数据虽有完整几何,却难以跨越虚实差距的鸿沟。慕尼黑工业大学(TUM)Angela Dai 教授在 ECCV 分享中提出了一种逆向思路:不必执着于消除数据的不完整,而是将真实的物理遮挡机制直接转化为算法的结构先验。

这项研究打破了 3D 场景重建中长期的“均值模糊”瓶颈,勾勒出空间智能(Spatial AI)从静态 3D 重建演进至具身智能大脑的技术路径。
2D 图像生成依赖标准的“加噪-去噪”扩散范式,但物理世界的 3D 扫描具有特殊的几何约束。深度传感器在观测现实时,物体相互遮挡带来的视角盲区并不符合常规的统计分布。

面对这种天然残缺,强行让网络去预测完全未知的盲区,很容易导致模型陷入均值收敛,生成模糊的块状结构或大面积留空。破局的关键在于引入物理观测机制,让 AI 利用已知的空无与遮挡关系,在残缺的观测中主动推演完整的几何。
深度传感器观测场景时,会天然界定出三类空间状态:

传统方法试图预测场景中的每一个点,容易盲目补全未观测区域。Angela Dai 团队提出了逆向自监督算法(SG-NN):故意从多帧融合扫描中剔除部分观测帧,构建“更残缺的输入”与“相对完整的标靶”。
训练中,损失函数通过掩码显式忽略所有未观测的未知空间,仅对人工挖空的区域进行监督。网络在第一层将场景编码为稀疏 TSDF 体素,借助稀疏卷积在表面区域进行高效计算;在瓶颈层预测需生成的新几何位置,逐层过滤空域,最终输出紧凑且完整的几何模型。

回归模型在局部小盲区表现良好,但在大面积遮挡下仍容易失效。团队引入了可见性引导的流匹配(Seen2Scene)生成模型,将已知表面、已知空域和未知体素分别映射为潜在编码。

通过将场景按局部切片(如 1.5×2 米)进行窗口化计算,模型不仅能在浴室、马桶等高难度盲区合理补全结构,还能无缝拓展至任意尺寸的环境。
在此基础上,团队将底层稳固的几何“骨架”与 2D 扩散模型的“皮肉”渲染能力结合:
这种分层解耦的方案解决了传统神经辐射场或全景生成离开中心视角后容易“漂移崩溃”的缺陷,使连贯生成的尺度拉伸到了七至八个房间的环境级空间。

除了真实数据的自监督,团队还探索了利用干净合成数据集(如 SAGE)训练通用几何先验,再反向注入真实场景重构(GenRecon)。模型将多视角图像、相机姿态和稀疏点云在统一空间聚合,即便面对超出合成分布的复杂杂物,依然能准确补全盲区。
更具前瞻性的方向在于具身智能的“主动感知”。当 AI 不再是被动处理已有图像的生成器,而是能利用物理可见性预判未观测空间时,空间智能体便可以自主规划最佳移动路线,探索未知区域,实现环境理解的最优路径闭环。

针对学术界关心的工程落地问题,Angela Dai 指出,当前三平面(Triplane)等表达的核心限制在于分辨率上限,而非理论架构问题;只要相机位姿与数据分布合理,合成到现实的迁移完全可行。
目前稀疏体素回归模型已具备极高的前向推理速度,满足多数实时需求;而高保真度的扩散生成因多步采样开销,仍存在延迟门槛。通过局部包围盒(Bounding Box)切分计算,可以在精度与计算负载之间找到平衡,为大范围物理空间的实时数字化提供了可行解法。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断