前途科技前途科技
  • 洞察
  • 服务
  • 关于
  • AI 资讯
    • 快讯
    • 产品
    • 技术
    • 商业
    • 政策
    • 初创
  • 洞察
  • 资源中心
    • 深度研究
      • AI 前沿
      • 案例研究
      • AI 知识库
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们

Gemini Robotics ER 2发布:视频理解与多机器人协作新突破

AI 前沿2026年7月29日· 原作者:Google DeepMind· 5 分钟阅读0 阅读

Google DeepMind推出Gemini Robotics ER 2,其最强的具身推理模型。通过实时视频理解,机器人能追踪任务进度、自我纠错,并实现多机器人协作。该模型已通过Gemini API公开发布,为物理AI应用提供更高智能。

Google DeepMind 发布 Gemini Robotics ER 2,这是其最强大的“具身推理”模型,旨在提升机器人的视频理解、任务编排和多机器人协作能力。作为机器人的高级大脑,它能理解人类语言、感知物理世界、规划多步骤任务,并将执行指令下发给低层视觉-语言-动作(VLA)模型。该模型还能原生调用 Google 搜索等工具,且在设计上可一边执行动作一边“思考”下一步。

与上一代 Gemini Robotics ER 1.6 相比,Gemini Robotics ER 2 通过持续分析视频流,让机器人能实时追踪任务进度、在出错时自适应调整,并准确把握进入下一步的时机。同时,新引入的多机器人协作功能使不同机器人在共享空间中协同工作,完成单个机器人无法独立完成的复杂流程。

Gemini Robotics ER 2 现已通过 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform(私人预览)向开发者公开。官方还提供了 示例代码 帮助快速上手。

两个机器人:Duo和Apollo

提升物理智能体能力

物理世界的任务往往复杂且多步。Gemini Robotics ER 2 作为物理智能体,可协调各步骤,让机器人能自我纠正并泛化到新场景。开发者可声明低层控制接口(如 VLA 模型或导航 API)作为工具,并将多模态视频、音频或文本流式输入模型。

在工具编排方面,Gemini Robotics ER 2 在三种控制模式(真实 VLA、模拟 VLA、人类远程操作)下均优于 ER 1.6。该模型集成了 Gemini Live API,利用双向流式端点优化低延迟任务,实现流畅编排,避免“停顿思考”式的等待。

为了演示效果,Google DeepMind 与 Boston Dynamics 合作,使用 Gemini Robotics ER 2 编排 Spot 机器人的 API(包括导航和机械臂移动),打造了一个能根据自然语言指令取物的交互式机器人。相关代码已发布在 GitHub 上。

解锁时间智能,确保任务完成

机器人最难的挑战之一是如何判断任务何时完成。Gemini Robotics ER 2 在视频理解和进度追踪上取得重大进步,能验证复杂任务(如拧紧灯泡、扎好垃圾袋)是否按规范完成,再切换到下一步。

具体体现在两个基础能力上:

  • 连续进度分类:将视频帧按完成进度分为五个等级(0‑20%、20‑40% 等)。在分类任务中,Gemini Robotics ER 2 达到 57.4% 的准确率,超越前代模型及其他前沿模型。

  • 精确时刻查找:定位关键事件发生的精确帧(如停止倒咖啡的瞬间)。该模型在此任务上达到 91.3% 的准确率和 0.96 秒的平均绝对时间差,计算成本仅为此前大型模型的一小部分,执行速度提升 4 倍,满足物理机器人所需的亚秒级延迟。

多机器人协作

没有一种机器人能胜任所有任务——轮式机器人擅长室内,人形机器人则适合复杂地形。Gemini Robotics 2 让不同种类的机器人通过共享语义理解进行沟通和任务交接。例如,Apptronik 的 Apollo 2 与 Franka F3 Duo 在该模型支持下协同工作,具体演示见 这里。

提升通用空间智能

Gemini Robotics ER 2 在核心空间推理能力上有所提升,在三个基准测试中表现优异:

  • 成功/失败检测:基于原始视频流而非静态快照,捕捉执行中的失误(如液体泼溅、滑动、错位)。
  • 通用仪表读数:从圆形表盘、液位计扩展到数字显示屏、线性刻度尺、温度计等 10 种以上仪表。
  • 增强空间 VQA:借助 Gemini 多模态理解的进步,提升视觉问答能力。

在所有核心能力上,Gemini Robotics ER 2 均取得最高准确率,包括成功检测(图像/视频)、问答(ERQA)和通用仪表读数。

推进具身智能安全

Gemini Robotics ER 2 是最安全的模型,在安全指令遵循和人类接近检测基准上取得显著提升。测试表明,当人类靠近时,它能成功使人形机器人暂停,并在区域无人后自动恢复工作。为了推动物理智能体的安全研究,Google DeepMind 还引入了一个新基准,评估基础模型作为安全 VLA 编排器的能力,涵盖安全约束执行、环境监控、物理可行性评估和向人类寻求澄清。详情见 安全技术报告。

展望未来,Google DeepMind 计划将这些模型推向更复杂的任务,加速实用机器人的开发,并支持整个机器人社区。


原文链接:Google DeepMind
本文由前途科技编辑整理

标签:Google DeepMind机器人多模态

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

会打字,就能"拍"电影:ScriptTask 开放限量内测
置顶

会打字,就能"拍"电影:ScriptTask 开放限量内测

//

24小时热榜

NASA 直播8月12日日全食
TOP1

NASA 直播8月12日日全食

OpenAI 7月营收超第二季度,AI公司收入碾压麦当劳星巴克
前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
TOP2

OpenAI 7月营收超第二季度,AI公司收入碾压麦当劳星巴克

3

OpenAI 正打造“AI 设备家族”,回应苹果诉讼

22小时前
OpenAI 正打造“AI 设备家族”,回应苹果诉讼
4

ChatGPT与Roblox将受欧盟最严平台规则约束

22小时前
ChatGPT与Roblox将受欧盟最严平台规则约束
5

扎克伯格透露Meta进军云计算

22小时前
扎克伯格透露Meta进军云计算
6

Claude Opus 5 为赢测试撒谎欺骗

23小时前
Claude Opus 5 为赢测试撒谎欺骗
7

微软将部署AMD与Nvidia AI机架

22小时前
微软将部署AMD与Nvidia AI机架
8

NASA罗曼望远镜8月30日发射

22小时前
NASA罗曼望远镜8月30日发射
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断