前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
具身智能/09.30 · 09:45/4 MIN/编译自 雷锋网/1 阅读

斯坦福发布HomeBody:为宇树G1打造模块化控制API

斯坦福大学与加州理工联合推出具身智能系统 HomeBody,通过标准化 API 将大模型接入宇树 G1 机器人。该方案打破端到端 VLA 模式,将高层语义规划与底层高频动力学解耦,在陌生环境中实现了长任务稳定执行。

HomeBody 让大模型接入宇树 G1 人形机器人

斯坦福大学 The Movement Lab 与加州理工学院近日公布了一项名为 HomeBody 的具身智能研究。团队将大模型 GPT Astra 接入宇树(Unitree)G1 人形机器人,使其在完全陌生的厨房环境中自主建图探索,并连续完成寻物、取药、丢垃圾和拉开抽屉等长序列日常任务。

不同于常见的“语音助手式”外挂方案,G1 在执行任务前并不知道物体的具体存放位置。机器人必须在自主探索阶段记录环境与空间坐标,在收到任务指令后检索历史信息,自主决策移动路径并调用对应技能。

G1 在陌生厨房环境中自主探索与执行任务

值得注意的是,大模型并不直接下发关节控制指令。导航定位、轨迹规划、碰撞规避、视觉伺服和全身控制均在本地硬件实时运行,云端大模型只负责语义理解、技能调度以及执行失败后的逻辑重试。在行业普遍追捧端到端视觉-语言-动作(VLA)模型的趋势下,HomeBody 给出了一条分层解耦的工程路线。

HomeBody 系统整体控制分层架构

构建标准化机器人技能 API

HomeBody 的核心突破在于重新规范了大模型与机械本体之间的交互接口。大模型完成环境认知后,通过结构化 Tool Call 调用具体技能,并传入标准参数:

  • 抓取(Pick):接收图像中归一化至 0–1000 的二维坐标点,并指定左手或右手执行;
  • 导航(Navigate):接收全局地图坐标系下的二维目标点与航向角;
  • 放置(Place):接收躯干坐标系下的三维放置点、执行手以及安全释放距离;
  • 抽屉操作(Open Drawer):将视觉对齐、扣挂把手与后退拉拽封装为一体化技能。

技能接口参数设计与坐标系映射

这种设计刻意规避了大模型直接输出末端轨迹。大模型只需在语义层面表达操作意图,底层技能接口再将意图转化为机器人遵循的几何约束。相比于将视觉感知与底层控制紧耦合的端到端 VLA 模型,标准化接口允许导航使用传统规划器、抓取采用解析几何方法、全身控制引入强化学习。只要遵循统一通信协议,系统便可灵活扩展底层运动能力。

统一空间记忆消除坐标割裂

任务跨越多个房间时,机器人无法仅凭当前画面推理几分钟前见过的药瓶坐标。HomeBody 让 G1 在正式作业前先探索环境,实时记录 RGB 相机画面、D435i 双目深度数据、激光雷达与 SLAM 信息、关节姿态以及航点记录。

随后,系统进入 Real2Sim 流程,将物理传感器数据重建进 Isaac Sim 仿真环境中:

从历史视觉线索到真实世界度量坐标的转换

  1. 双层空间记忆:一层是语义记忆(某关键帧包含哪些物体),另一层是度量几何(拍摄该画面时机器人的精确绝对位姿)。
  2. 多源数据配准:利用 Super Odometry 获取机器人在 SLAM 地图中的状态,再通过 ICP 算法将实测点云与仿真环境对齐,让二维图像像素与米制地图坐标无缝锚定。

收到取药指令后,大模型先从语义记忆中定位药瓶视觉线索,再提取关联的空间坐标引导机器人导航前往,彻底解决了大模型缺乏物理尺度与绝对空间感的问题。

从二维像素点到闭环厘米级抓取

当机器人走至柜前,任务精度要求从米级导航骤升至厘米级操作。抓取模块的执行链路包含多重闭环:

目标物体抓取与视觉深度恢复流程

  • 三维几何解算:系统以大模型给出的二维点提示分割模型切出目标,结合 Fast-FoundationStereo 双目深度估算与标定参数,将像素点云投射至三维相机坐标系,解析计算抓取位姿。
  • 连续平滑轨迹:规划器生成样条参考曲线,通过 Minimum-Jerk 时序约束消除加速度突变,在逆运动学求解中对机械臂扫过的整体包络体积进行碰撞检测。

机械臂轨迹规划与空间碰撞检测

为抵消底盘晃动与视角漂移引起的误差,系统借助 SAM 2.1 与 SAMURAI 维持跨帧目标追踪,配合视觉伺服(Visual Servoing)动态修正机械手逼近角度。

标签:具身智能人形机器人大语言模型斯坦福大学

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参
置顶

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的
置顶

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款

视觉伺服闭环与局部容错重试机制

控制系统因此形成严格的频率分层:底层手臂控制运行在 250 Hz,AMO 全身控制器以 50 Hz 周期更新,小幅视觉漂移由底层伺服实时吸收;若抓空,技能库自动在局部更换抓取候选位姿。只有当底层尝试均告失败时,错误信息才会回传给秒级响应的云端大模型,由其决定是重新定位还是调整步骤。

结合 AMO 全身控制算法开抽屉操作

拉抽屉等需要上肢与躯干协作的动作,则依赖 AMO 全身控制框架。该框架结合了 Sim2Real 强化学习与轨迹优化,使机器人能在手臂后拉受限时主动后撤步态,协同躯干调整扩展作业空间。

HomeBody 架构整体流程闭环

具身智能的模块化工程解法

HomeBody 目前仍面临工程限制:Real2Sim 建模增加部署前置成本,云端大模型调用产生间歇停顿,本地感知需依赖高性能移动计算平台,且大模型无法凭空泛化出技能库之外的接触动力学(如擦桌子、捏软物)。

然而,该项目验证了一种更稳健的具身智能工程架构:高层大模型专注离散任务决策,SLAM 与仿真引擎维护外部物理状态,标准化技能提供清晰接口,高频控制系统坚守底层物理稳定性。具身智能的下一阶段竞争,或许不仅取决于谁的模型参数更大,更取决于软硬件系统之间的接口定义与分层控制规范。

相关研究已在 HomeBody 项目主页 与 GitHub 开源代码仓库 正式公开。

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板
置顶

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板

//

24小时热榜

至知创新推出IQuest-Q1:320B参数MoE大模型实测亮相
TOP1

至知创新推出IQuest-Q1:320B参数MoE大模型实测亮相

微软揭露俄黑客新钓鱼手法:波及超百家机构
TOP2

微软揭露俄黑客新钓鱼手法:波及超百家机构

3

诺因智能累计融资超10亿 具身机器人加速走向家庭

23小时前
诺因智能累计融资超10亿 具身机器人加速走向家庭
4

礼来三靶点减重药创纪录:减重最高达30%

2小时前
礼来三靶点减重药创纪录:减重最高达30%
5

奥特曼:OpenAI 暂无上市时间表,安全优先于 IPO

2小时前
奥特曼:OpenAI 暂无上市时间表,安全优先于 IPO
6

OpenAI被曝忽视安全警告,AI智能体失控突破沙盒

2小时前
OpenAI被曝忽视安全警告,AI智能体失控突破沙盒
7

Anthropic秘密咨询宗教界:Claude是否具有意识

2小时前
Anthropic秘密咨询宗教界:Claude是否具有意识
8

OpenAI发布常驻智能体Dots,旗舰模型却因安全红线推迟

3小时前
OpenAI发布常驻智能体Dots,旗舰模型却因安全红线推迟
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断