在 ECCV 主会首场演讲中,计算机视觉顶尖学者 Kristen Grauman 提出 AI 需从理解走向赋能。视觉 AI 不应止步于充当旁观者,而要成为能介入现实技能学习、提供个性化可执行反馈并真正帮助人类掌握技能的 AI Guide。
过去十年,计算机视觉的主线是让机器看得更准。从目标检测、姿态估计到三维重建与视频理解,机器在基准测试中的感知能力大幅跃升。然而现实中,机器越会看,人获得的实质帮助却没有成比例增长。健身软件能识别动作,却无法指出具体该改动哪一寸;教学视频虽有标准示范,却无法察觉学习者的卡点。
在 ECCV 主会演讲中,得克萨斯大学奥斯汀分校教授、前 Meta FAIR 研究总监 Kristen Grauman 提出,视觉 AI 必须从“理解”(understanding)走向“赋能”(enabling),从被动的观察者演变为能够帮助人类掌握现实技能的“AI 指导者”(AI Guide)。

传统视频模型常将视频视作一系列二维切片并按时间聚合,但人类行为实际发生在持续存在的三维空间中。Grauman 团队依托 Ego-Exo4D 数据集,将人的活动放回真实空间,结合环境物体识别与 3D 人体姿态提取,构建出人在空间中的持续动态表征,即“4D 理解”。
在交互预测研究 FIction 中,模型不再只停留在眼前的画面,而是预测未来交互会发生在哪里(where)以及人体会呈现怎样的姿态(how)。这种在 3D 空间中预判人类可能下一步的能力,是 AI 系统在错误发生前主动介入的前提。

仅仅预测行为还不够,AI Guide 还必须理解为了达成目标需要采取哪些动作。团队为此构建了以动作为条件的世界模型(action-conditioned world model),推演不同动作序列带来的未来状态,从而选出通往目标的最优路径。
为了克服第一视角(egocentric)视频遮挡多、数据稀缺的问题,研究提出了 EgoExo-WM,以 3D 人体运动作为桥梁,将网络上庞大的第三视角(exocentric)视频转换成第一视角数据,借助“看别人做”来训练模型。

此外,个性化指导必须因材施教。团队在 SkillSight 项目中发现,第一视角记录下的视线和头部运动轨迹直接映射了技能水准。例如初学者弹琴会死盯手指,熟练者更关注乐谱。通过蒸馏模型,系统仅依靠视线轨迹便能精准判断技能层级,功耗降低约 73 倍。
当系统理解了用户当前的水平后,核心挑战变成:如何给出真正可执行的反馈?
给新手直接看顶级大师的动作往往毫无帮助,因为水平差距过大。在 ExpertAF 研究中,系统会匹配一个与学习者水平接近但细节稍优的示范,指出下一步最该修正的关键点。而在 ExpertEdit 项目中,团队更进一步,引入认知科学中的“视频自我建模”(video self-modeling)概念。

Grauman 将该算法形容为“人类技能动作的 Auto-Tune”。系统无需人工指定“抬高手臂”或“收腹”,而是自主识别关键失误节点,直接在 3D 人体骨骼上做局部微调,生成一个“动作做对时的用户自己”。用户在看到调整后的自身动作时,理解和改进的效率远高于观察他人示范。
在落地测试中,研究团队将系统集成至 Vid2Coach 平台,配合智能眼镜辅助视障用户学习烹饪新菜谱。系统能实时补充画面中未言明的视觉信息,监测安全隐患,并根据用户当前进展提供语音提示。

Grauman 指出,视觉 AI 的评测体系必须超越传统的 Benchmark 准确率,核心应当是最终的学习成果——用户在 AI 协助下到底有没有更高效、更安全地掌握技能。让昂贵稀缺的专业指导真正普惠化,是计算机视觉跨越机器感知、迈向人类技能赋能的核心目标。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断