Google Gemini Robotics 2实现单一策略驱动的行走与抓取

1 阅读3分钟前沿
Google Gemini Robotics 2实现单一策略驱动的行走与抓取

背景概述

Google DeepMind 的 Gemini 系列一直聚焦大模型与多模态交互,而 Gemini Robotics 则是该系列在实体机器人上的延伸。此前的 Gemini 机器人模型仅限于固定基座的桌面操作,行走能力完全依赖外部控制器。随着机器人需求从实验室走向商业化,单一策略统一动作的需求变得尤为迫切。

技术突破

Gemini Robotics 2 的核心创新在于“一体化策略”。

  • 统一策略模型:同一神经网络在语言指令的条件下,同时预测 locomotion(步态)和 manipulation(抓取)动作向量。
  • API 化推理:模型的推理接口以 API 形式开放,开发者可通过文本指令直接获取完整动作序列。
  • 硬件抽象层:实际的电机控制被封装在合作伙伴 Apptronik 的 Apollo 2 硬件平台中,仅通过安全网关提供调用权限,避免直接暴露底层驱动。

这种设计使得 locomotion 不再是独立的子系统,而是动作空间的一部分,彻底打破了传统“先走后抓”的流水线思路。

关键演示

Demo 中,用户指令“把花园里的浇水壶放进下层的垃圾桶”被发送至 Gemini Robotics 2。机器人先行走至桌面,使用柔性抓手拾取浇水壶,再跨步移动至垃圾桶并完成投放。整个过程仅用一次语言指令完成,展示了从感知、规划到执行的全链路闭环。

与业界的对比

  • Boston Dynamics:多年专注于硬件层面的步态控制,仍然需要手工调参的控制器。
  • Apptronik 早期模型:仅提供固定基座的抓取功能,行走能力依赖外部模块。
  • Gemini Robotics 2:在模型层面实现行走与抓取的统一,使机器人能够在更复杂的环境中执行自然语言指令。

行业意义

  1. 降低开发门槛:开发者只需编写语言指令,无需深入机器人控制算法,即可实现复杂任务。
  2. 加速商业化落地:统一策略配合 API,帮助企业快速将 AI 能力嵌入现有物流、仓储等场景。
  3. 安全合规:通过合作伙伴网关限制硬件控制,兼顾开放性与安全性,符合企业级部署要求。

前景与挑战

虽然 Gemini Robotics 2 在统一策略上取得突破,但仍面临实时性、能耗以及多环境感知的挑战。未来的工作可能包括:

  • 强化实时推理:在边缘设备上实现低延迟响应。
  • 跨模态感知融合:结合视觉、触觉等多模态信息提升鲁棒性。
  • 更广泛的合作生态:扩大硬件伙伴网络,让更多机器人平台受益于统一策略模型。

总体而言,Google 将大模型技术直接引入机器人控制体系,标志着生成式 AI 从虚拟文本走向真实物理世界的关键一步。

“当语言模型能够直接控制机器人的每一步时,‘指令’的意义将被重新定义。” — 业内分析师

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。