前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
具身智能/09.30 · 15:54/4 MIN/编译自 henry/1 阅读

斯坦福HomeBody让宇树G1进厨房收拾杂物

斯坦福大学团队推出HomeBody项目,将大模型与宇树G1人形机器人结合。机器人无需在新厨房额外采集数据或训练策略,就能自主建立空间记忆、调用现成技能模块完成收纳、丢垃圾和开抽屉取药等连贯家务。

机器人的大模型进化时刻,正在从桌面测试走向真实生活场景。

斯坦福大学团队在最新研究项目 HomeBody 中,将 GPT 与宇树 G1 人形机器人连接,让机器人走进此前从未见过的厨房自主干活。

在没有新环境额外训练数据的情况下,G1 能够依照人类的自然语言指令,收拾台面杂物、丢弃指定包装盒,甚至凭记忆从不在视野内的抽屉中翻出药品递给人。

机器人正在执行厨房整理任务

此前机器人控制大多局限于桌面机械臂的抓取放置,而 HomeBody 将大模型控制机器人的范围扩展到了整个房间尺度。机器人不仅需要现场判断面前抓什么,还得记住物体的位置分布,并将导航移动、开闭抽屉和抓放操作无缝串联。

更关键的是,系统部署到新厨房时,无需采集新环境数据,也无须重新训练一套专用动作策略,展现出极强的通用泛化能力。

让大模型把机器人动作当工具调用

HomeBody 的核心逻辑非常清晰:让大模型把机器人的物理技能作为工具(Tool Call)直接调用。

大模型负责理解人类目标、规划任务步骤,底层则负责调用导航、抓取、开抽屉等现成技能。整个流程分为三个阶段:

第一步:全场巡视,构建空间记忆

机器人接收到的初始指令是:“你是一台厨房机器人,请探索这个空间。”

机器人在厨房内移动探索

随后,大模型自主选择值得观察的点位,指引 G1 移动。机器人一边行走,一边记录相机画面、激光雷达点云,以及关节姿态和轨迹坐标。借助 SLAM(同步定位与建图)技术,机器人构建出全局地图并确定自身位姿。这些视觉与空间数据不会随转身而丢失,而是形成长期空间记忆。

第二步:真实映射,在仿真器中复刻厨房

大模型随后扮演 Real2Sim 智能体角色,在 Isaac Sim 仿真平台中搭建出数字孪生厨房。

在仿真器中构建数字厨房

系统将 SLAM 实测的几何结构同步给模型,严格约束台面高度与通道宽度,确保机器人的可行走区域和伸手距离准确无误。接着,物理世界坐标系与数字厨房坐标系完成对齐,此前拍摄的画面、物品描述和三维坐标绑定在一起。机器人后续找物品时,就能从记忆索引线索,直接导航回对应坐标。

第三步:自主规划,技能流水线作业

完成准备后,用户下达复合指令,例如“把咖啡袋收拢到中间,丢掉指定的橙汁纸盒”。

任务规划与执行过程

大模型结合当前视角、空间地图、记忆数据以及手臂负重状态,按需调用技能库。比如用户让它“拿药”,哪怕药在视野外,大模型也能检索到此前抽屉的记录,接续调用“导航至抽屉—开抽屉—取药—递给人”这一串动作。

解耦架构:GPT 动脑,技能库动手

具身智能通常有清晰的分工层次:

  • System 2(高层决策):视觉语言模型,负责理解场景与规划任务;
  • System 1(动作策略):视觉语言动作模型(VLA),负责把视觉转换为具体动作指令;
  • System 0(底层控制):机器人控制器,负责全身关节协调与平衡。

具身控制架构分工示意图

HomeBody 最大的调整在于绕过了学习型 VLA:让 System 2 直接调度模块化技能库,再交由底层控制器执行。

这些技能包括导航、抓取、放置、开抽屉等,具备统一的输入输出接口:

大模型只需在画面中指定目标像素点并指派使用左手还是右手。

抓取技能解析与规划

抓取技能内部的感知模块自动估算深度、计算物体三维坐标和抓取姿态,随后由运动规划器规划机械臂避障轨迹,最终由底层执行。大模型决定“抓什么、用哪只手”,具体“手怎么伸、怎么握紧”完全由预设技能模块完成。

开抽屉技能的细分流程

每一步操作都会将结果反馈给大模型,形成闭环。下半身行走的平衡控制则由预训练的 AMO 策略承接,让下肢运动兼顾上肢操作负载。

这种解耦结构避免了为新场景反复训练专用神经网络的麻烦,但系统目前仍依赖搭载 RTX 4090 的笔记本承担边缘计算,远端模型推理亦存在延迟,同时机械硬件如手指舵机长时间工作也容易过热。机器人真正走进千家万户做家务,仍需感知、规划、算法与本体硬件的全面突破。

标签:具身智能人形机器人机器人大语言模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参
置顶

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的
置顶

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板
置顶

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板

//

24小时热榜

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参
TOP1

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参

TOP2

斯坦福发布HomeBody:为宇树G1打造模块化控制API

3

微软揭露俄黑客新钓鱼手法:波及超百家机构

12小时前
微软揭露俄黑客新钓鱼手法:波及超百家机构
4

阿里Qoder升级Agent平台:478天背后的AI原生实践

4小时前
阿里Qoder升级Agent平台:478天背后的AI原生实践
5

斯坦福HomeBody让宇树G1进厨房收拾杂物

4小时前
斯坦福HomeBody让宇树G1进厨房收拾杂物
6

OpenAI急刹与Meta狂飙:AI竞争走向落地与执行

4小时前
OpenAI急刹与Meta狂飙:AI竞争走向落地与执行
7

个人与企业AI智能体分化:全球格局与演进

5小时前
个人与企业AI智能体分化:全球格局与演进
8

无人机装上机械臂:空中具身智能开启高空协同作业

6小时前
无人机装上机械臂:空中具身智能开启高空协同作业
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断