Google DeepMind 发布 Gemini Robotics 2,通过三个新模型(VLA、ER、设备端)实现人形机器人全身运动、手指级精细操作、多机器人协作,并能在数小时内适配新硬件,是迈向物理世界通用人工智能的关键一步。

Google DeepMind 今日发布 Gemini Robotics 2,这是其机器人智能层的重大升级。新系统赋予机器人从脚趾到指尖的全身控制能力,结合高级灵巧操作和多机器人协作,可完成复杂现实任务。
Gemini Robotics 2 包含三个高度专业化的模型:
Gemini Robotics 2 首次实现对完整人形机器人的控制。例如,在 Apptronik 的 Apollo 2 上,模型能理解“把喷壶放到底层架子的绿色箱子中”的指令,然后自主行走、抓取、放置。尽管移动速度仍有提升空间,但这标志着机器人具备了完成需要全身协调的现实任务的关键能力。
新模型在不同末端执行器上都展现了更强的灵巧性。在 Apollo 2 上,它可以控制 5 指 22 自由度的 SharpaWave 手完成系绳结、密封拉链袋等精细动作;在 Franka Duo 平台 上,它也能操作标准两指平行夹爪完成紧密包装等任务。团队正持续提升精度和速度,向人类级灵巧操作迈进。
Gemini Robotics ER 2 作为机器人的“大脑”,可处理用户指令、观察环境、规划步骤、协调 VLA 执行动作,并持续追踪进度。它能可靠执行持续数分钟、包含数百次决策的复杂任务序列,并能在失败时自我纠正。
此次更新还首次实现了多机器人协作:不同类型机器人可以通信协作,完成单台机器人无法独自完成的复杂工作流。
设备端模型 Gemini Robotics On-Device 2 专为无网络或低延迟环境设计。它继承了自 Gemini Robotics 1.5 的“运动迁移”技术,可以仅用数小时(通常少于 200 个示例)适配形状、传感器和自由度截然不同的新机器人形态,如 Dexmate、SO101、Trossen 等平台。
DeepMind 发布 ASIMOV-Agentic 新基准,用于评估具身推理智能体拒绝不安全工具调用、预判任务可行性及主动请求人工干预的能力。Gemini Robotics ER 2 在安全指令遵循和人类接近检测方面达到当前最佳水平,能够在人靠近时触发安全停停。
Gemini Robotics ER 2 现已在 Google AI Studio 上线,并在 Gemini Enterprise Agent Platform 提供预览。VLA 和设备端模型面向 早期合作伙伴 开放。更多技术细节见 安全技术报告。
Gemini Robotics 2 是迈向物理世界通用人工智能(AGI)的重要里程碑。通过构建核心智能,使 AI 能够与人类并肩解决复杂挑战。
原文链接:Google DeepMind
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断