斯坦福大学团队推出HomeBody项目,将大模型与宇树G1人形机器人结合。机器人无需在新厨房额外采集数据或训练策略,就能自主建立空间记忆、调用现成技能模块完成收纳、丢垃圾和开抽屉取药等连贯家务。
机器人的大模型进化时刻,正在从桌面测试走向真实生活场景。
斯坦福大学团队在最新研究项目 HomeBody 中,将 GPT 与宇树 G1 人形机器人连接,让机器人走进此前从未见过的厨房自主干活。
在没有新环境额外训练数据的情况下,G1 能够依照人类的自然语言指令,收拾台面杂物、丢弃指定包装盒,甚至凭记忆从不在视野内的抽屉中翻出药品递给人。

此前机器人控制大多局限于桌面机械臂的抓取放置,而 HomeBody 将大模型控制机器人的范围扩展到了整个房间尺度。机器人不仅需要现场判断面前抓什么,还得记住物体的位置分布,并将导航移动、开闭抽屉和抓放操作无缝串联。
更关键的是,系统部署到新厨房时,无需采集新环境数据,也无须重新训练一套专用动作策略,展现出极强的通用泛化能力。
HomeBody 的核心逻辑非常清晰:让大模型把机器人的物理技能作为工具(Tool Call)直接调用。
大模型负责理解人类目标、规划任务步骤,底层则负责调用导航、抓取、开抽屉等现成技能。整个流程分为三个阶段:
机器人接收到的初始指令是:“你是一台厨房机器人,请探索这个空间。”

随后,大模型自主选择值得观察的点位,指引 G1 移动。机器人一边行走,一边记录相机画面、激光雷达点云,以及关节姿态和轨迹坐标。借助 SLAM(同步定位与建图)技术,机器人构建出全局地图并确定自身位姿。这些视觉与空间数据不会随转身而丢失,而是形成长期空间记忆。
大模型随后扮演 Real2Sim 智能体角色,在 Isaac Sim 仿真平台中搭建出数字孪生厨房。

系统将 SLAM 实测的几何结构同步给模型,严格约束台面高度与通道宽度,确保机器人的可行走区域和伸手距离准确无误。接着,物理世界坐标系与数字厨房坐标系完成对齐,此前拍摄的画面、物品描述和三维坐标绑定在一起。机器人后续找物品时,就能从记忆索引线索,直接导航回对应坐标。
完成准备后,用户下达复合指令,例如“把咖啡袋收拢到中间,丢掉指定的橙汁纸盒”。

大模型结合当前视角、空间地图、记忆数据以及手臂负重状态,按需调用技能库。比如用户让它“拿药”,哪怕药在视野外,大模型也能检索到此前抽屉的记录,接续调用“导航至抽屉—开抽屉—取药—递给人”这一串动作。
具身智能通常有清晰的分工层次:

HomeBody 最大的调整在于绕过了学习型 VLA:让 System 2 直接调度模块化技能库,再交由底层控制器执行。
这些技能包括导航、抓取、放置、开抽屉等,具备统一的输入输出接口:
大模型只需在画面中指定目标像素点并指派使用左手还是右手。

抓取技能内部的感知模块自动估算深度、计算物体三维坐标和抓取姿态,随后由运动规划器规划机械臂避障轨迹,最终由底层执行。大模型决定“抓什么、用哪只手”,具体“手怎么伸、怎么握紧”完全由预设技能模块完成。

每一步操作都会将结果反馈给大模型,形成闭环。下半身行走的平衡控制则由预训练的 AMO 策略承接,让下肢运动兼顾上肢操作负载。
这种解耦结构避免了为新场景反复训练专用神经网络的麻烦,但系统目前仍依赖搭载 RTX 4090 的笔记本承担边缘计算,远端模型推理亦存在延迟,同时机械硬件如手指舵机长时间工作也容易过热。机器人真正走进千家万户做家务,仍需感知、规划、算法与本体硬件的全面突破。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断