银河通用与清华等机构联合提出LATENT框架,利用5小时不完美的业余人类动作数据,结合潜在动作空间与强化学习,成功让人形机器人掌握高速网球回球技能,真机正手回球成功率达90.9%。
让机器人在动态环境下完成高速竞技运动,一直是具身智能领域的难点。在顶级机器人会议上,来自银河通用团队、清华大学、北京大学、上海启智研究院与上海人工智能实验室的联合研究团队提出了一项名为 LATENT 的新框架,论文题为 Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data。该研究展示了如何仅凭业余选手的离散动作片段,让人形机器人自主学会打网球。

让机器人学习网球等高速全身运动,最直观的路径是采集职业选手的完整比赛数据。然而完整捕捉人体运动并直接映射到机器人硬件极为昂贵且低效——人体的关节自由度、肌力与骨骼比例和机器人存在本质差异,哪怕精准复刻人体轨迹,机械本体也未必能平稳执行。

LATENT 团队放弃了收集完美全流程数据的路线。他们在约 3米×5米 的紧凑区域内,仅记录了 5 名业余爱好者约 5 小时的基础动作碎片,包括正手、反手挥拍及滑步、交叉步等脚步移动。这些数据既不精准,也不连贯,但保留了人类应对网球运动时如何协调躯干、脚步和手臂的核心模式。
研究团队将这些碎片数据作为强化学习的“动作先验”,为拥有 29 个自由度的人形机器人划定合理的运动边界,让其在探索复杂策略前先建立基础的“身体直觉”。
为了避免机器人机械地照搬人类轨迹,LATENT 首先训练了一个运动追踪器,将其压缩为一个连续的潜在动作空间(Latent Action Space),构建起一本机器人的“动作词典”。高层控制策略不再需要逐一运算 29 个关节的底层力矩,而是从词典中调用动作模式并实时微调。

在设计中,研究团队特意降低了对右手腕等易受误差影响的局部关节的追踪依赖,迫使机器人学会调用腿部、髋部和躯干的协同发力完成击球动作,增强了策略在硬件误差下的鲁棒性。
同时,为防止强化学习策略为了单纯提升击球率而在不同动作间突兀跳变,团队设计了 Latent Action Barrier(LAB),通过马氏距离(Mahalanobis distance)衡量并限制高层策略偏离动作先验分布的程度。消融实验显示,加入 LAB 后,机器人的正手击球动作平滑性指标显著优化,关节力矩从 12.53 降至 7.40,大幅减少了剧烈甩动和机械停顿。

从仿真到真实世界(Sim-to-Real)的跨越,往往受阻于现实环境的噪声与不确定性。LATENT 的核心策略并非追求完美的仿真精度,而是主动向仿真环境中引入大量扰动。

团队对机器人的质量分布、关节摩擦力矩、足底摩擦系数,以及网球的恢复系数和空气阻力进行了全方位随机化,并叠加了传感器帧丢失与延迟模拟。消融实验证明,若移除网球动力学随机化,真实正手成功率会骤降至 16.67%;若去除观测噪声,真机反手击球成功率直接归零。让机器人在训练期适应“不干净的世界”,成为了策略迁移的关键。
该套系统最终部署于宇树 Unitree G1 人形机器人本体上进行了验证。在搭载 50 多台动捕相机的高精度追踪场地内,机器人展现出了高度连贯的全身运动协调能力。

在与人类对手的 20 场连续击球实验中,Unitree G1 实现了 90.90% 的正手回球成功率与 77.78% 的反手回球成功率,前场和后场回球成功率分别达到 88.89% 与 81.82%。在仿真自博弈(Self-Play)测试中,两台机器人能够连续完成多达 25 个回合的稳定对攻。

研究团队指出,目前实验系统仍高度依赖外部动作捕捉基础设施,未来将进一步引入板载主动视觉以迈向完全自主。但 LATENT 证明了一条极具前景的路径:人形机器人无需依赖昂贵无瑕的全量数据,仅凭残缺的物理先验配合合理的强化学习框架,便足以演化出高度复杂的动态全身控制能力。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断