前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
具身智能/09.30 · 14:12/4 MIN/编译自 雷锋网/1 阅读

NVIDIA李柏依:让机器人不仅学会看,还能听声辨位与灵巧操作

针对机器人训练数据短缺瓶颈,NVIDIA研究科学家李柏依展示了两项新成果:MultiGen利用生成模型为物理仿真补充对齐的声音感知;DexImit则直接从单目人类视频中重建4D交互轨迹,实现双手灵巧操作的真机零样本部署。

机器人要走进现实环境,所面对的信息远比纯视觉复杂得多。在倒水时,水流注入的声音可以帮助预判容器何时溢满;碰撞发生时,不同材质会发出独特的清脆或低沉声响;哪怕是在不同容积的房间里,空间回声也能直接指示物理距离。

然而,这些人类赖以判断的多模态感知,以及诸如削皮、切菜、叠杯等复杂的双手灵巧操作,在机器人训练阶段都面临极高的数据采集门槛——真实世界采集成本高昂,而传统物理仿真模拟器虽然能模拟逼真的几何物理运动,却往往缺失声音等辅助感知模态。

NVIDIA 李柏依线上分享

在相关学术研讨会上,NVIDIA Research 科学家、UC Berkeley 研究员李柏依(Boyi Li)分享了团队在具身智能高效多模态学习上的两项代表性工作:MultiGen 与 DexImit。她的核心解题思路可以概括为两点:模拟器里没有的声音,可以通过模型“生成”出来;机器人难以直接采集的双手操作数据,可以直接从人类单目视频中转化。


MultiGen:不只模拟物理过程,还要“生成感知”

当前的物理模拟器已经能逼真模拟倒水等流体物理过程,但画面是完全静音的。机器人如果仅依赖视觉,面对不透明容器或光照剧烈变化的环境时往往极其脆弱。

传统物理模拟器缺乏对齐的音频信号

李柏依团队的核心思路是:“Don’t just simulate physics – generate perception”(不只模拟物理过程,更要生成感知)。

MultiGen 架构流程

团队利用互联网上大量包含真实音视频的野外数据,训练了一个基于扩散模型(Diffusion Model)的音频生成模型。该模型能够输入一段无声视频,自动生成在时间维度上精准对齐的音轨。

随后,研究人员将该模型接入物理模拟器生成的流体与交互视频中,补齐了时间对齐的音频信号,由此合成出一套低成本的多模态仿真数据集。

仿真多模态数据集构建

基于该数据集训练的多模态机器人策略,在真机部署测试中展现出了显著的鲁棒性:

  • 抗视觉干扰:在倒水过程中突然关灯,纯视觉策略彻底失效导致水溢出杯外,而引入声音模态的策略依然能凭水流回响精确停止。
  • 不透明容器适应:对于无法直接观察内部液位的不透明容器,加入声音感知的策略误差大幅降低。
  • 抗噪声干扰:即便在未针对环境背景噪音做专门数据增强的情况下,策略依然能准确识别水流音高变化。

真机倒水测试对比


DexImit:从单目人类视频提取双手灵巧操作

解决感知生成的缺失后,另一个瓶颈在于动作策略:双手灵巧操作(Bimanual Dexterous Manipulation)对通用人形机器人至关重要,但真机遥操作与示范采集极其昂贵。

与稀缺的机械手操作数据相比,人类日常生活的单目操作视频近乎无穷。团队提出的 DexImit 框架,旨在直接从单目人类视频中学习高自由度的双手灵巧操作。

DexImit 任务背景

DexImit 的完整处理管线包含四个阶段:

DexImit 四阶段管线

  1. 时空交互重建:从单目视频输入出发,经过深度估计、手部姿态估计、3D 物体生成与 6D 位姿估计,将信息统一至世界坐标系,重建出人手与物体的 4D 交互轨迹。
  2. 子任务时序分解:利用视觉语言模型(VLM)将长时序任务分解为多个步骤,确定左右手协同工作的动作次序。
  3. 具身重定向与运动规划:人手结构与机械手存在形态差异。系统基于物理力闭合(Force Closure)等约束,重新求解适合机械灵巧手的抓取位姿,并利用运动规划生成无碰撞轨迹。
  4. 数据增强与质量筛查:对物体尺度、位置、视角等进行系统性增强,并借助 VLM 自动化筛除与原始意图不符的异常轨迹。

机械手轨迹规划与重定向

实验结果表明,DexImit 在切苹果、叠杯子、倒饮料等兼具长时序、强接触(contact-rich)与精细操作的任务上均能生成物理合理的轨迹,并成功完成了真机零样本部署(Zero-shot Real-world Deployment)。

标签:NVIDIA具身智能多模态扩散模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参
置顶

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的
置顶

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款

DexImit 复杂任务表现


当前局限与演进方向

在演讲与现场问答环节中,李柏依也指出了 DexImit 当前的演进瓶颈:

  • 柔性与铰接物体限制:目前的 3D 生成模块主要依赖刚体假设,处理柔性布料或铰接门把手仍有困难。
  • 移动操作建模:现有系统聚焦桌面操作,尚无法直接迁移至移动底盘与灵巧手协同的全身控制。
  • 长时序累积误差:多模块级联在超长视频中易发生误差漂移,仍需 VLM 或人工干预进行节点修正。
  • 严重遮挡的手内操作:例如手中转动小球,单目视频受严重自遮挡影响,信息恢复难度极大。

通过 MultiGen 与 DexImit 两项工作可以看出,具身智能正在经历从“纯粹模拟物理环境”向“主动生成所需感知与交互数据”的转变。将生成模型的先验与仿真环境结合,有望成为打破具身数据壁垒的关键路径。

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板
置顶

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板

//

24小时热榜

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参
TOP1

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参

TOP2

斯坦福发布HomeBody:为宇树G1打造模块化控制API

3

微软揭露俄黑客新钓鱼手法:波及超百家机构

12小时前
微软揭露俄黑客新钓鱼手法:波及超百家机构
4

阿里Qoder升级Agent平台:478天背后的AI原生实践

4小时前
阿里Qoder升级Agent平台:478天背后的AI原生实践
5

斯坦福HomeBody让宇树G1进厨房收拾杂物

4小时前
斯坦福HomeBody让宇树G1进厨房收拾杂物
6

OpenAI急刹与Meta狂飙:AI竞争走向落地与执行

4小时前
OpenAI急刹与Meta狂飙:AI竞争走向落地与执行
7

个人与企业AI智能体分化:全球格局与演进

5小时前
个人与企业AI智能体分化:全球格局与演进
8

无人机装上机械臂:空中具身智能开启高空协同作业

6小时前
无人机装上机械臂:空中具身智能开启高空协同作业
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断