前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
具身智能/09.30 · 14:24/5 MIN/编译自 雷锋网/1 阅读

空间智能为何成物理AI核心基座?ECCV复盘

ECCV 2026显示,三维视觉不再局限于静态几何重建,正全面融入视频生成、具身智能与世界模型。从4D时空表示、长程记忆到未来状态预测与动作执行,空间智能正成为AI理解并交互物理世界的共同主线。

从三维视觉到世界模型

AI 已经越来越擅长生成“看起来真实”的图像与视频,却依然难以真正理解并行动于物理世界。物体处于何种相对空间位置?遮挡后内部结构如何?一个动作发出后,环境会产生怎样的演变?这些核心问题的求解,共同汇聚到了“空间智能”。

在计算机视觉顶级会议 ECCV 2026 上,这一趋势表现得极为清晰。大会数据显示,本届共收到 10,473 篇投稿,接收 2,834 篇。虽然从分类上看,图像与视频合成、视觉语言推理位列前二,3D 主题退居第三,但 3D 绝非退潮,而是其底层几何、物理一致性与动态建模能力正在全面渗透到世界模型与具身智能领域。

ECCV投稿与研究方向分布

从静态几何走向动态 4D 与交互场景

本届最佳论文《Heat Kernel Textures — the Geodesic Gaussians That Do Not Splat》由帝国理工学院团队斩获。该研究从离散黎曼几何出发,使用各向异性热核直接在曲面的测地空间表达纹理,彻底避开了传统二维 UV 贴图展开带来的拉伸、接缝与分辨率不均问题,重塑了三维曲面表示的基础逻辑。

Heat Kernel Textures论文示意

最佳论文荣誉提名同样聚焦于 3D 重建与几何感知:Meta Reality Labs 团队提出的 LSRM 通过扩展 Transformer 上下文窗口并引入 3D 感知路由,实现了高保真前馈三维重建;纽约州立大学石溪分校团队则利用偏振光编码表面朝向,有效解决了高光反射场景下的法线估计难题。

海报展示环节也印证了这一变化:3D 高斯泼溅(3DGS)与神经渲染已不仅用于静态新视角合成,而是大量延伸到动态重建、长序列建图以及人机交互等 4D 时空建模场景中。

时空记忆:让智能体持续认知同一世界

物理世界中的智能体在移动时,视角会不断切换,物体会被遮挡并重新出现。如果模型仅能处理单帧,就无法形成对环境的稳定认知。

群核科技与浙江大学等机构推出了交互式空间智能评测基准 WalkerBench,要求模型仅凭第一视角 RGB 画面在复杂城市中自主导航。测试发现,主流视觉语言模型(VLM)在长距离下极易迷失方向。为此,团队提出 Spatial-IDE 框架,利用显式拓扑记忆动态维护空间地图,将 9 个主流 VLM 智能体的导航表现提升了 104.97%,并在宇树 G1 人形机器人上完成了开放街区的千米级自主导航。

WalkerBench基准与Spatial-IDE架构

腾讯混元与清华大学、南洋理工大学联合提出的 Spatial-TTT 则选择将空间记忆内化,通过在推理时动态更新“快权重”,避免长视频上下文堆叠引发的算力激增与空间信息丢失。

状态预测:世界模型的核心突破口

图灵奖得主 Yann LeCun 在特邀报告中再次强调:“模型根本不应该去预测底层像素。”他认为,模型的核心应当是在抽象隐空间中预测未来状态,进而评估动作后果来完成规划。

Yann LeCun Keynote

从主会发表的成果来看,研究正沿着三个梯度深化:首先是 DreamWorld 这类工作,通过引入几何先验保证跨视角生成的空间结构一致性;其次是处理动态手物交互的 4D 建模;最终演进到多智能体动力学基准,评估世界模型是否真正符合物理定律。

具身交互:从空间理解落地到物理执行

在行动落地层面,德克萨斯大学奥斯汀分校教授 Kristen Grauman 指出,AI 必须从“理解”走向“赋能”,明确什么样的动作能够引导环境状态转移。

Kristen Grauman演讲

为了达成这一目标,北航、北大、智源研究院等联合研发的 RoboTracer 将语言指令转化为带有绝对深度的多步 3D 轨迹,可直接适配不同机器人本体;主会入选论文 FEEL 则通过 300 万帧数据将第一视角视频与手部触觉受力同步,补全了物理交互中的力学信息;虚幻引擎驱动的仿真平台 SPEAR 也为复杂物理交互提供了高精度的虚拟演练场。

关于空间表示的讨论仍在持续:究竟是依赖纯数据驱动的视频隐式表达,还是坚持点云、网格等显式 3D 表示?学术界尚未完全收敛。但共识在于,无论底层架构如何演化,具备几何一致性、状态预测能力与长程记忆的空间智能,已经成为具身智能与物理 AI(Physical AI)不可或缺的基座。

标签:具身智能世界模型计算机视觉机器人

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参
置顶

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的
置顶

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板
置顶

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板

//

24小时热榜

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参
TOP1

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参

TOP2

斯坦福发布HomeBody:为宇树G1打造模块化控制API

3

微软揭露俄黑客新钓鱼手法:波及超百家机构

12小时前
微软揭露俄黑客新钓鱼手法:波及超百家机构
4

阿里Qoder升级Agent平台:478天背后的AI原生实践

4小时前
阿里Qoder升级Agent平台:478天背后的AI原生实践
5

斯坦福HomeBody让宇树G1进厨房收拾杂物

4小时前
斯坦福HomeBody让宇树G1进厨房收拾杂物
6

OpenAI急刹与Meta狂飙:AI竞争走向落地与执行

4小时前
OpenAI急刹与Meta狂飙:AI竞争走向落地与执行
7

个人与企业AI智能体分化:全球格局与演进

5小时前
个人与企业AI智能体分化:全球格局与演进
8

无人机装上机械臂:空中具身智能开启高空协同作业

6小时前
无人机装上机械臂:空中具身智能开启高空协同作业
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断