观行智能创始人穆尧提出具身智能终局是奖励驱动的自我进化。他认为机器人行业缺的不是人类演示数据,而是经验的规模化,主张通过虚拟空间试错与离散扩散策略,打破定制化项目制瓶颈。

在具身智能尚无成熟数据集与评测基准时,穆尧便进入该领域。他主导的仿真基准 RoboTwin 已成为行业核心评测体系之一,GitHub 获得超 2900 星标。随后,穆尧创办 SeeAct AI(观行智能),明确提出新判断:具身智能的终局,必定是从单纯模仿人类演示走向奖励驱动的自我进化。
早在 2018 年清华读硕期间,穆尧就笃信端到端策略网络与奖励驱动。当时自动驾驶多将感知、规划、控制切分,直到特斯拉 FSD 推动端到端成为主流。
转向机器人领域后,动作空间与本体类型剧增。团队先后开发了 EmbodiedGPT 与基于代码生成的 RoboCodex。当发现底层 API 手写扩展受限后,穆尧转向端到端策略基座,并与上层负责任务拆解规划的 Agent 融合,随后推出了完整具身系统 RoboClaw。

在数据规模化(Data Scaling)与模型规模化(Model Scaling)之后,穆尧提出具身智能的关键瓶颈是经验规模化(Experience Scaling)。
人类演示数据只能告诉机器“人在这种情况下怎么做”,但机器人自行操作时的动作偏差、打滑、失败以及重试,必须由机器自主经历。具身递归自我进化(Recursive Self-Improvement)的逻辑在于:能力提升后可以自主执行(Rollout)出更高质量的经验,而新经验又会继续反哺模型演进。
在系统全流程中,预训练阶段需要给策略基座注入自主纠错基因,涵盖多任务试错反馈;后训练阶段则在未知场景中,通过交互反馈快速收敛并达到可用标准。

若完全依赖真机试错,并行度与成本将难以承受。穆尧提出的核心路径是少量真机交互加上大规模虚拟空间生成数据。
面对仿真到真实的差距(Sim-to-Real Gap),穆尧认为物理引擎与世界模型构建的虚拟空间可以视作平行宇宙,模型从中学习到的结构化规律依旧有效。在实际落地中,由真实世界提供关键的物理接触反馈,虚拟空间则负责将问题展开并展开更大规模的并行探索。

为配合奖励驱动,团队研发了离散扩散视觉-语言-动作(VLA)模型。离散扩散既保留了全局视野与轨迹迭代优化的生成能力,又因其词元预测特性,能够更直接地适配 PPO、GRPO 等强化学习算法。

穆尧表示,SeeAct AI 交付的是软硬件一体的持续进化策略系统。以往机器人方案往往是驻场开发数月的定制化项目制,而具备自主纠错与自我进化的基座模型,有望让机器在新工业场景中于 48 小时左右自主适应并达标,推动具身方案转变为高毛利的标准产品形态。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断