斯坦福 TML 实验室发布人形机器人系统 HomeBody,用前沿 VLM 直接调度可组合动作技能库,跳过专用策略训练,在 Unitree G1 上完成收拾厨房、取药等此前未见环境里的长程任务。
斯坦福大学 TML 实验室的项目页显示,团队发布了一个叫 HomeBody 的人形机器人系统,卖点是砍掉了机器人控制里常见的一层专用模型,直接让通用视觉语言模型(VLM)指挥机器人干活。
传统人形机器人自主决策一般是三段式架构:一个"System 2"视觉语言模型处理视觉观察和指令、生成高层意图;一个专门训练的"System 1"视觉-语言-动作模型(VLA)把意图转成具体指令;再由"System 0"全身控制器执行协调动作。System 1 的 VLA 是需要针对具体机器人和任务单独训练的部分。项目页提出的问题是:随着 Astra 这类前沿 VLM 能力越来越强,System 2 能不能直接调度可复用的动作技能库,跳过专用策略训练?HomeBody 的做法是给前沿 VLM 配上持久化空间记忆和可组合人形动作技能,用"即插即用"的 VLM 直接调用技能库,取代原来需要额外训练的链路。
演示在一个此前从未见过的厨房里完成,由 Unitree G1 人形机器人执行,指挥它的是 GPT Astra。任务包括收拾厨房(把咖啡包收到台面中间,扔掉过期的牛奶和橙汁纸盒)和取药(药品一开始不在视野内,机器人需用记忆定位抽屉、开抽屉、取出药品交给人、再顺手扔掉坏纸盒)。整个过程没有用到针对该环境单独采集的训练数据,也没做额外策略学习。
第一步探索:机器人在环境里走一圈,采集 0.5 倍速 iPhone 视频、D435i 深度相机画面、带 SLAM 的 LiDAR 扫描、关节姿态和 Astra 选定的路径点,让系统记住"在哪见过什么",物体离开视野后也不会忘记。第二步 Real2Sim:用 Astra 作为"现实转仿真"代理,基于机器人自采数据在 Isaac Sim 里重建数字孪生,帮高层 VLM 对视野外位置进行推理。第三步接收日常任务指令,比如"收拾厨房",系统结合空间记忆自主选择动作和目标,不需要逐步脚本。
技能库目前包含导航、抓取、放置和开抽屉四类,共享统一的目标与执行结果接口,方便 VLM 部署时组合调用;局部重试和视觉反馈可纠正动作失败,比如抓取偏了或移动被挡住时,系统据反馈修正下一步。机器人能在左右手间做选择:演示里用右手开抽屉取药,再用左手丢弃纸盒。
受影响的主要是具身智能和人形机器人研发团队:这个项目提供了一条不依赖专用策略训练、直接复用前沿 VLM 推理能力的路线参考,尤其在长程、多步骤家庭场景任务里。项目页提供可交互 3D 演示,能对比 LiDAR 实测数据和仿真重建效果。接下来值得关注的是这套方法能不能扩展到厨房之外、技能库覆盖不到的场景,以及这条路线相比依赖专用 VLA 训练的传统方案,长期稳定性和成功率会不会有明显差距。
免费获取企业 AI 成熟度诊断报告,发现转型机会








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断