Google发布Gemini Robotics ER 2 赋能机器人实时视频理解与多机协作
•0 阅读•4分钟•前沿
GoogleGeminiGemini Robotics ER 2多机器人协作视频理解
•0 阅读•4分钟•前沿

背景与意义
Google 在 2026 年 7 月 30 日的官方博客中宣布,推出全新大型模型 Gemini Robotics ER 2。该模型定位为机器人“高层大脑”,旨在解决机器人在现实环境中面临的实时感知、长序列规划以及多机协同等核心难题。相比前代 ER 1.6,ER 2 在视频理解、进度分类、关键帧定位等方面实现了显著提升,为生成式机器人技术迈向实用化提供了关键支撑。
核心能力概览
- 视频理解与进度追踪:模型能够对连续视频流进行细粒度进度分类(五级进度),在实验中实现 57.4% 的准确率,显著优于同类前沿模型。
- 关键帧定位(Moment‑Finding):在任务切换点的检测上,准确率达 91.3%,平均误差仅 0.96 秒,满足亚秒级响应需求。
- 任务编排与工具调用:支持将低层 Vision‑Language‑Action(VLA)模型或导航 API 作为工具,实时调度并生成多步骤计划。
- 多机器人协作:不同类型机器人(如轮式、类人)可共享语义表示,通过 ER 2 实现任务分配与交接,完成单机难以实现的复杂工作流。
- 安全约束与人机距离感知:在 Safety Instruction Following 与 Human Proximity 基准上取得领先,能够在检测到人员靠近时自动暂停并在安全后恢复操作。
实际演示
Google 与波士顿动力(Boston Dynamics)合作,用 ER 2 驱动 Spot 机器人完成“取物并递送”任务。系统通过 Gemini Live API 双向流式接口,将实时视频和指令同步到模型,Spot 能在自然语言指令下完成导航、抓取并返回,演示了流畅的“思考‑执行”闭环。相关代码已开源至 GitHub,供开发者快速复现。
性能与算力优势
- 计算效率:在同等硬件条件下,ER 2 的推理延迟比前代降低约 4 倍,满足机器人对毫秒级响应的需求。
- 成本效益:凭借模型结构优化,ER 2 在算力消耗上仅为部分竞争模型的 30%,降低了部署门槛。
开放渠道与生态布局
- API 与平台:开发者可通过 Gemini API、Google AI Studio 或 Gemini Enterprise Agent Platform 访问 ER 2。
- 工具生态:Google 提供了示例 Prompt、工具包装以及与常见机器人操作系统(ROS)对接的 SDK,帮助企业快速构建基于 ER 2 的物理 AI 代理。
未来展望
Google 表示,后续将在 ER 2 基础上进一步提升空间推理精度、扩展跨模态感知(音频‑视频‑触觉)以及深化多机器人协同协议,力求在制造、物流、家庭助理等场景实现更高水平的智能化。
“Gemini Robotics ER 2 是我们在让机器人安全、可靠地融入真实世界道路上的重要里程碑。”——Google 高级工程师 Steven Hansen
通过 Gemini Robotics ER 2,Google 将生成式 AI 的强大推理能力引入实体机器人领域,为工业自动化、服务机器人以及跨域协作打开了新的可能。
本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。