ECCV 2026显示,三维视觉不再局限于静态几何重建,正全面融入视频生成、具身智能与世界模型。从4D时空表示、长程记忆到未来状态预测与动作执行,空间智能正成为AI理解并交互物理世界的共同主线。

AI 已经越来越擅长生成“看起来真实”的图像与视频,却依然难以真正理解并行动于物理世界。物体处于何种相对空间位置?遮挡后内部结构如何?一个动作发出后,环境会产生怎样的演变?这些核心问题的求解,共同汇聚到了“空间智能”。
在计算机视觉顶级会议 ECCV 2026 上,这一趋势表现得极为清晰。大会数据显示,本届共收到 10,473 篇投稿,接收 2,834 篇。虽然从分类上看,图像与视频合成、视觉语言推理位列前二,3D 主题退居第三,但 3D 绝非退潮,而是其底层几何、物理一致性与动态建模能力正在全面渗透到世界模型与具身智能领域。

本届最佳论文《Heat Kernel Textures — the Geodesic Gaussians That Do Not Splat》由帝国理工学院团队斩获。该研究从离散黎曼几何出发,使用各向异性热核直接在曲面的测地空间表达纹理,彻底避开了传统二维 UV 贴图展开带来的拉伸、接缝与分辨率不均问题,重塑了三维曲面表示的基础逻辑。

最佳论文荣誉提名同样聚焦于 3D 重建与几何感知:Meta Reality Labs 团队提出的 LSRM 通过扩展 Transformer 上下文窗口并引入 3D 感知路由,实现了高保真前馈三维重建;纽约州立大学石溪分校团队则利用偏振光编码表面朝向,有效解决了高光反射场景下的法线估计难题。
海报展示环节也印证了这一变化:3D 高斯泼溅(3DGS)与神经渲染已不仅用于静态新视角合成,而是大量延伸到动态重建、长序列建图以及人机交互等 4D 时空建模场景中。
物理世界中的智能体在移动时,视角会不断切换,物体会被遮挡并重新出现。如果模型仅能处理单帧,就无法形成对环境的稳定认知。
群核科技与浙江大学等机构推出了交互式空间智能评测基准 WalkerBench,要求模型仅凭第一视角 RGB 画面在复杂城市中自主导航。测试发现,主流视觉语言模型(VLM)在长距离下极易迷失方向。为此,团队提出 Spatial-IDE 框架,利用显式拓扑记忆动态维护空间地图,将 9 个主流 VLM 智能体的导航表现提升了 104.97%,并在宇树 G1 人形机器人上完成了开放街区的千米级自主导航。

腾讯混元与清华大学、南洋理工大学联合提出的 Spatial-TTT 则选择将空间记忆内化,通过在推理时动态更新“快权重”,避免长视频上下文堆叠引发的算力激增与空间信息丢失。
图灵奖得主 Yann LeCun 在特邀报告中再次强调:“模型根本不应该去预测底层像素。”他认为,模型的核心应当是在抽象隐空间中预测未来状态,进而评估动作后果来完成规划。

从主会发表的成果来看,研究正沿着三个梯度深化:首先是 DreamWorld 这类工作,通过引入几何先验保证跨视角生成的空间结构一致性;其次是处理动态手物交互的 4D 建模;最终演进到多智能体动力学基准,评估世界模型是否真正符合物理定律。
在行动落地层面,德克萨斯大学奥斯汀分校教授 Kristen Grauman 指出,AI 必须从“理解”走向“赋能”,明确什么样的动作能够引导环境状态转移。

为了达成这一目标,北航、北大、智源研究院等联合研发的 RoboTracer 将语言指令转化为带有绝对深度的多步 3D 轨迹,可直接适配不同机器人本体;主会入选论文 FEEL 则通过 300 万帧数据将第一视角视频与手部触觉受力同步,补全了物理交互中的力学信息;虚幻引擎驱动的仿真平台 SPEAR 也为复杂物理交互提供了高精度的虚拟演练场。
关于空间表示的讨论仍在持续:究竟是依赖纯数据驱动的视频隐式表达,还是坚持点云、网格等显式 3D 表示?学术界尚未完全收敛。但共识在于,无论底层架构如何演化,具备几何一致性、状态预测能力与长程记忆的空间智能,已经成为具身智能与物理 AI(Physical AI)不可或缺的基座。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断