Google DeepMind推出Gemini Robotics ER 2,其最强的具身推理模型。通过实时视频理解,机器人能追踪任务进度、自我纠错,并实现多机器人协作。该模型已通过Gemini API公开发布,为物理AI应用提供更高智能。
Google DeepMind 发布 Gemini Robotics ER 2,这是其最强大的“具身推理”模型,旨在提升机器人的视频理解、任务编排和多机器人协作能力。作为机器人的高级大脑,它能理解人类语言、感知物理世界、规划多步骤任务,并将执行指令下发给低层视觉-语言-动作(VLA)模型。该模型还能原生调用 Google 搜索等工具,且在设计上可一边执行动作一边“思考”下一步。
与上一代 Gemini Robotics ER 1.6 相比,Gemini Robotics ER 2 通过持续分析视频流,让机器人能实时追踪任务进度、在出错时自适应调整,并准确把握进入下一步的时机。同时,新引入的多机器人协作功能使不同机器人在共享空间中协同工作,完成单个机器人无法独立完成的复杂流程。
Gemini Robotics ER 2 现已通过 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform(私人预览)向开发者公开。官方还提供了 示例代码 帮助快速上手。

提升物理智能体能力
物理世界的任务往往复杂且多步。Gemini Robotics ER 2 作为物理智能体,可协调各步骤,让机器人能自我纠正并泛化到新场景。开发者可声明低层控制接口(如 VLA 模型或导航 API)作为工具,并将多模态视频、音频或文本流式输入模型。
在工具编排方面,Gemini Robotics ER 2 在三种控制模式(真实 VLA、模拟 VLA、人类远程操作)下均优于 ER 1.6。该模型集成了 Gemini Live API,利用双向流式端点优化低延迟任务,实现流畅编排,避免“停顿思考”式的等待。
为了演示效果,Google DeepMind 与 Boston Dynamics 合作,使用 Gemini Robotics ER 2 编排 Spot 机器人的 API(包括导航和机械臂移动),打造了一个能根据自然语言指令取物的交互式机器人。相关代码已发布在 GitHub 上。
解锁时间智能,确保任务完成
机器人最难的挑战之一是如何判断任务何时完成。Gemini Robotics ER 2 在视频理解和进度追踪上取得重大进步,能验证复杂任务(如拧紧灯泡、扎好垃圾袋)是否按规范完成,再切换到下一步。
具体体现在两个基础能力上:
连续进度分类:将视频帧按完成进度分为五个等级(0‑20%、20‑40% 等)。在分类任务中,Gemini Robotics ER 2 达到 57.4% 的准确率,超越前代模型及其他前沿模型。
精确时刻查找:定位关键事件发生的精确帧(如停止倒咖啡的瞬间)。该模型在此任务上达到 91.3% 的准确率和 0.96 秒的平均绝对时间差,计算成本仅为此前大型模型的一小部分,执行速度提升 4 倍,满足物理机器人所需的亚秒级延迟。
多机器人协作
没有一种机器人能胜任所有任务——轮式机器人擅长室内,人形机器人则适合复杂地形。Gemini Robotics 2 让不同种类的机器人通过共享语义理解进行沟通和任务交接。例如,Apptronik 的 Apollo 2 与 Franka F3 Duo 在该模型支持下协同工作,具体演示见 这里。
提升通用空间智能
Gemini Robotics ER 2 在核心空间推理能力上有所提升,在三个基准测试中表现优异:
在所有核心能力上,Gemini Robotics ER 2 均取得最高准确率,包括成功检测(图像/视频)、问答(ERQA)和通用仪表读数。
推进具身智能安全
Gemini Robotics ER 2 是最安全的模型,在安全指令遵循和人类接近检测基准上取得显著提升。测试表明,当人类靠近时,它能成功使人形机器人暂停,并在区域无人后自动恢复工作。为了推动物理智能体的安全研究,Google DeepMind 还引入了一个新基准,评估基础模型作为安全 VLA 编排器的能力,涵盖安全约束执行、环境监控、物理可行性评估和向人类寻求澄清。详情见 安全技术报告。
展望未来,Google DeepMind 计划将这些模型推向更复杂的任务,加速实用机器人的开发,并支持整个机器人社区。
原文链接:Google DeepMind
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断