斯坦福大学助理教授吴佳俊在IROS研讨会上发表演讲,阐述如何利用结构化表征构建物理世界智能体。他提出,结构化表征并非生硬塞入规则的终点,而是帮助具身模型泛化与推理的脚手架,正推动机器人从依赖演示走向自主交互学习。

一个盘子、一只水龙头、一小团蓝色的洗洁精。斯坦福大学计算机科学系助理教授吴佳俊以此作为开场,剖析具身智能在面对真实物理环境时的核心瓶颈。
场景很简单:有人挤了洗洁精,打开水龙头洗盘子,洗到一半临时走开,交由机器人接手。表面看,任务只是“把盘子洗干净”。但对机器人而言,它需要理解水龙头是否开着、盘子上是否有洗洁精、洗完拿开后桌面上是否还压着污渍。
输入的细微差异在物理世界中往往对应着定性区别:若没有洗洁精,直接冲洗会弄得一团糟;若盘子已经被别人洗过,重复冲洗就是多余。人类一眼就能看懂的物理常识,对机器人来说,每一次“观察后行动”都是深层推理的考验。

吴佳俊认为,在数字世界中,智能体面对的是由目录、文件与属性构成的规范结构;但在物理世界中,机器人必须直接面对千差万别的实体、材质与空间关系。如何将数字智能体的能力迁移到物理世界?答案在于让系统学会“结构化表征”。
过去几年,吴佳俊团队摸索出一套范式:一端接入原始视频或语言输入,中间利用基础模型提炼具备组合性的抽象概念,另一端输出执行策略。

在早期实现中,系统依赖类似 PDDL 的领域专用语言(DSL):由符号模块定义物体的属性、二维/三维空间关系等“谓词”,并设定“洗”这类原子动作的前置条件与执行效果。感知和控制交由扩散策略(Diffusion Policy)等神经网络处理,符号层则保障逻辑的可组合性。
但这带来了一个新问题:人工编写或固定的 DSL 并不通用。团队随后的探索方向转变为“让 DSL 自身也能被模型学会”——输入任务演示后,让基础模型自主提炼出关键属性、原子动作及前后置条件,再通过实际操作数据验证这些规则是否成立。
吴佳俊将这一过程类比为 Cursor 等编程 AI 智能体:在电脑上,智能体先拟定多步执行计划、逐项执行并通过测试验证;在物理空间中,机器人同样需要先规划、再执行,并在执行回路中完成状态验证。
面对工业产线中从未见过的专有零件等场景,公开发布的基础模型无法直接判断物体的特定状态。团队将整条执行链设计为可微结构:当模型因未知物体误判状态时,系统可以通过演示中的最终执行结果反向传播梯度,对负责谓词判定的模块进行后训练。
而在最新进展中,团队进一步将“任务规划器”从传统的符号规划系统替换为神经网络。他们将自然语言形式的谓词与图像一同作为提示词喂给多模态大模型,通过对开源权重模型进行后训练,让模型结合机器人自身的技能库输出可执行的动作序列,大幅减少了长时程任务中的人工干预。

更具前瞻性的方向在于摆脱人类演示数据。以往机器人学习技能往往依赖遥操作或人类录制的动作视频,而吴佳俊团队尝试让机器人自主推理物体的交互可能。
系统能够从单视角静止物体图像中学习交互分布。面对从未见过的水龙头,系统可采样出转动把手的轨迹;面对盒子,则能采样出开合方式。即使使用普通手机拍摄、质量粗糙的三维点云作为输入,模型依然展现出零样本泛化能力,能够推断出洗碗机、冰箱或笔记本电脑的交互方式。

为进一步受控于具体任务目标,团队引入了语言引导的四维(3D+时间)生成技术。借助视频扩散模型与分数蒸馏采样(SDS),系统能在三维场景中沿时间轴生成机器人展开布料或合上笔记本的稠密运动轨迹。这些自动生成的虚拟轨迹直接转化为机器人学习策略的监督信号,相当于获得了源源不断的“免费演示数据”。

吴佳俊总结道,结构化表征不应被理解为强行塞入机器人的死板规则,而是一座辅助系统提升学习效率的“脚手架”。机器人凭借这层中间接口,不仅能让人类读懂其决策逻辑,更能厘清复杂任务内部的依赖关系与因果影响,真正掌握物理世界的通用推理能力。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断