在IROS 2026上,动易科技展示了其高动态人形机器人技术,通过分层控制架构与博弈强化学习,实现与人类连续对拉40余拍并自主捡球,核心框架仅用一周即可迁移至乒乓球和足球场景。
羽毛球是球类运动中对动态控制要求极高的项目之一。杀球初速可达两三百公里每小时,但受十六片羽毛的空气阻力影响,飞行速度剧烈衰减,轨迹呈现前段平直、后段陡降的非对称弧线。此外,羽毛球软木与羽毛的结构使得重心与压力中心分离,飞行过程中的自翻转让落点预测极具挑战。
面对这种兼顾灵敏位移与精准挥拍的高动态场景,机器人需要一套分工明确的大小脑架构。在 IROS 2026 研讨会上,动易科技(PHYBOT)团队分享了其研发进展:通过将策略博弈与全身运动执行彻底解耦,成功让一台高 1.35 米的人形机器人与人类连续对拉超过 40 拍,并支持自主捡球。

球拍类运动对机器人的感知与控制提出了极高要求。首先,目标物体体积远小于足球或篮球,控制精度要求提升约一个数量级;其次,连续多回合对抗要求机器人必须稳定、重复地击中狭窄的挥拍窗口;最后,关节处的微小误差会在拍头被放大数倍。
动易科技通过分层设计化解了这一矛盾:高层负责战术决策与技能挑选,低层专注于稳健的全身运动执行。

步法移动与挥拍发力在优化过程中容易产生冲突。团队采用退火式课程学习:在训练初期仅引入下肢位移奖励,引导稀疏击球;随着步法稳定,逐渐降低移动权重,转由击球奖励主导,最终形成协调的全身发力控制。

为丰富动作库,团队引入人类参考动作,利用对应上手、下手正手、下手反手的三个判别器分别捕获不同风格动作。随后,团队训练了一个学习型技能选择器(Q 值函数)。面对不同来球轨迹,选择器会评估各技能的任务效用,实时选出最佳击球方式。依靠这套机制,仅 1.35 米高的机器人成功覆盖了 4.4×4.4 米的半场区域,真机连续回球超 40 拍。

要从“能打”进阶到“赢球”,机器人必须掌握战术博弈。团队将高层策略建模为零和博弈问题:

在完成羽毛球算法验证后,这套控制与决策框架仅用约一周时间,便顺利迁移至乒乓球和足球运动,展现出较强的算法通用性。
在商场快闪等真实场景中,机器人除了对抗击球,还需具备自主捡球能力。由于下蹲捡球时机器人视角和身体构型剧烈变化,团队提出了 DQ-Flow 架构。

该方案将动作生成与动作执行分离。策略接收短时单目 RGB 历史和本体感知数据,通过 flow matching 生成全身参考轨迹;训练阶段加入深度查询以辅助学习几何表征,实际推理时完全无需深度相机。生成的轨迹送入混合全身控制器:平衡与抗扰要求高的下肢和躯干由强化学习控制器跟踪,上肢与夹爪则执行精确轨迹跟踪。二者异步运行,确保机器人持续移动而不因模型推理停顿。
动易科技表示,人形机器人走向竞技运动的关键在于系统工程,人类先验、博弈对抗驱动演化,以及硬件力矩和算法优化的同步迭代,是机器人走出实验室进入真实赛场的基石。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断