斯坦福大学与加州理工联合推出具身智能系统 HomeBody,通过标准化 API 将大模型接入宇树 G1 机器人。该方案打破端到端 VLA 模式,将高层语义规划与底层高频动力学解耦,在陌生环境中实现了长任务稳定执行。

斯坦福大学 The Movement Lab 与加州理工学院近日公布了一项名为 HomeBody 的具身智能研究。团队将大模型 GPT Astra 接入宇树(Unitree)G1 人形机器人,使其在完全陌生的厨房环境中自主建图探索,并连续完成寻物、取药、丢垃圾和拉开抽屉等长序列日常任务。
不同于常见的“语音助手式”外挂方案,G1 在执行任务前并不知道物体的具体存放位置。机器人必须在自主探索阶段记录环境与空间坐标,在收到任务指令后检索历史信息,自主决策移动路径并调用对应技能。

值得注意的是,大模型并不直接下发关节控制指令。导航定位、轨迹规划、碰撞规避、视觉伺服和全身控制均在本地硬件实时运行,云端大模型只负责语义理解、技能调度以及执行失败后的逻辑重试。在行业普遍追捧端到端视觉-语言-动作(VLA)模型的趋势下,HomeBody 给出了一条分层解耦的工程路线。

HomeBody 的核心突破在于重新规范了大模型与机械本体之间的交互接口。大模型完成环境认知后,通过结构化 Tool Call 调用具体技能,并传入标准参数:

这种设计刻意规避了大模型直接输出末端轨迹。大模型只需在语义层面表达操作意图,底层技能接口再将意图转化为机器人遵循的几何约束。相比于将视觉感知与底层控制紧耦合的端到端 VLA 模型,标准化接口允许导航使用传统规划器、抓取采用解析几何方法、全身控制引入强化学习。只要遵循统一通信协议,系统便可灵活扩展底层运动能力。
任务跨越多个房间时,机器人无法仅凭当前画面推理几分钟前见过的药瓶坐标。HomeBody 让 G1 在正式作业前先探索环境,实时记录 RGB 相机画面、D435i 双目深度数据、激光雷达与 SLAM 信息、关节姿态以及航点记录。
随后,系统进入 Real2Sim 流程,将物理传感器数据重建进 Isaac Sim 仿真环境中:

收到取药指令后,大模型先从语义记忆中定位药瓶视觉线索,再提取关联的空间坐标引导机器人导航前往,彻底解决了大模型缺乏物理尺度与绝对空间感的问题。
当机器人走至柜前,任务精度要求从米级导航骤升至厘米级操作。抓取模块的执行链路包含多重闭环:


为抵消底盘晃动与视角漂移引起的误差,系统借助 SAM 2.1 与 SAMURAI 维持跨帧目标追踪,配合视觉伺服(Visual Servoing)动态修正机械手逼近角度。
免费获取企业 AI 成熟度诊断报告,发现转型机会

控制系统因此形成严格的频率分层:底层手臂控制运行在 250 Hz,AMO 全身控制器以 50 Hz 周期更新,小幅视觉漂移由底层伺服实时吸收;若抓空,技能库自动在局部更换抓取候选位姿。只有当底层尝试均告失败时,错误信息才会回传给秒级响应的云端大模型,由其决定是重新定位还是调整步骤。

拉抽屉等需要上肢与躯干协作的动作,则依赖 AMO 全身控制框架。该框架结合了 Sim2Real 强化学习与轨迹优化,使机器人能在手臂后拉受限时主动后撤步态,协同躯干调整扩展作业空间。

HomeBody 目前仍面临工程限制:Real2Sim 建模增加部署前置成本,云端大模型调用产生间歇停顿,本地感知需依赖高性能移动计算平台,且大模型无法凭空泛化出技能库之外的接触动力学(如擦桌子、捏软物)。
然而,该项目验证了一种更稳健的具身智能工程架构:高层大模型专注离散任务决策,SLAM 与仿真引擎维护外部物理状态,标准化技能提供清晰接口,高频控制系统坚守底层物理稳定性。具身智能的下一阶段竞争,或许不仅取决于谁的模型参数更大,更取决于软硬件系统之间的接口定义与分层控制规范。
相关研究已在 HomeBody 项目主页 与 GitHub 开源代码仓库 正式公开。
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断