Google DeepMind发布Gemini Robotics 2实现全身控制与多机器人协作
•1 阅读•4分钟•前沿
GoogleGemini Robotics ER 2多机器人协作Gemini Robotics 2
•1 阅读•4分钟•前沿
关键发布
Google DeepMind宣布正式发布 Gemini Robotics 2,这是面向下一代通用机器人的智能层。平台提供三款模型,覆盖从高层任务规划到低层运动控制的完整链路,并首次实现 全身控制、五指灵巧以及多机器人协同。
三大模型概览
- Gemini Robotics 2 (VLA):视觉‑语言‑动作模型,能够将图像、文字指令直接映射为机器人关节动作,实现全身 humanoid 的行走、抓取与操控。
- Gemini Robotics ER 2:具身推理模型,基于 Gemini 3.5 Flash,支持多模态(文本、图像、视频、音频)输入,拥有 128k 上下文窗口,能够进行数分钟的多步任务规划并调用工具(如 Google Search)。
- Gemini Robotics On‑Device 2:本地化 VLA,基于 Gemini Robotics 1.5 与 Google Gemma,能够在机器人端离线运行,适配新机械体仅需数小时少于 200 条示例。
全身控制与灵巧操作
Gemini Robotics 2 首次让 Apollo 2 机器人实现从脚到指尖的完整动作控制。示例指令“把浇水壶放进底层绿桶”,机器人能够自行走到桌前、拾取物体、跨步至目标货架并完成放置。模型在不同机械手上的成功率如下:
- 5‑指 SharpaWave 手:打结 92%、系垃圾袋 44%、封 Ziplock 袋 40%。
- 2‑指平行夹具(Franka Duo):精确插入 89.6%、多工具装配 78.9%、普通搬运 74.2%。
多机器人协作
平台引入 跨形态协作 概念:不同机器人通过共享语义层进行任务分解与交接。例如,Apollo 2 humanoid 完成搬运后,将子任务交给 Franka Duo 的夹具完成精细装配。DeepMind 还展示了 Spot(波士顿动力)在导航与操控 API 上的协同演示,代码已开源至 robotics‑samples 仓库。
本地化适配与安全基准
On‑Device 2 采用 少量示例快速适配 方法,在几小时内即可迁移到全新双臂平台(如 Dexmate、SO101、Trossen),且在新平台上的表现可突破 50% 的成功阈值。安全方面,DeepMind 发布了 ASIMOV‑Agentic 基准,涵盖任务完成度检测、关键时刻定位(准确率 91.3%)以及工具编排评估,全部在 Hugging Face 上以 CC‑BY‑4.0 开放。
上线与可用性
- Gemini Robotics ER 2:已开放公共预览,可通过 Gemini API 与 Google AI Studio 访问。
- Gemini Robotics 2 (VLA) 与 On‑Device 2:目前仅对早期合作伙伴与受信测试者开放,模型标识为
gemini-robotics-er-2-preview。
随着模型卡片、示例代码与安全基准的同步发布,业界预计在未来 12 个月内将有更多机器人厂商加入生态,推动从实验室到生产线的全面落地。
本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。