谷歌DeepMind发布Gemini Robotics 2:全身控制与灵巧双手
8月2日,谷歌DeepMind正式发布Gemini Robotics 2,这是其视觉-语言-动作模型的最新版本。相比上一代仅控制上半身进行桌面任务,新模型实现了三大跃升:智能全身控制、高级灵巧度和多机器人协作。
在控制Apptronik Apollo 2人形机器人时,用户发出指令后,机器人自主完成走向桌子、拿起浇水壶、走到架子前、放入桶中的完整流程。这一过程涉及全身协调的每一步决策,包括理解任务目标、规划路径、保持平衡和精确控制力度。
Gemini Robotics 2现在能够控制Apollo 2上五指22自由度的灵巧手,完成打结、密封密封袋等精细动作;在Franka Duo平台上也能操作标准双指平行夹具,执行紧密填料等复杂任务。
模型还引入了多机器人协作能力,不同类型的机器人可以通信并协同工作,解决单一机器人无法完成的复杂工作流。Gemini Robotics ER 2作为机器人的高级大脑,能识别任务开始和结束,精确定位关键事件,并在步骤失败时自我纠正。
DeepMind推出了ASIMOV-Agentic基准,衡量具身推理代理拒绝不安全工具调用的能力,以及预测任务可行性并在不确定时请求人工干预的能力。Gemini Robotics ER 2在安全约束遵循和人机接近基准测试中表现最佳,能检测附近的人并安全停下。
针对工厂、仓库等需要无网络延迟或断网运行的应用场景,DeepMind推出了Gemini Robotics On-Device 2,可在本地机器人设备上运行。该模型仅需不到200条数据和数小时适应时间,即可适配形状、传感器和自由度完全不同的双臂机器人。
从上半身控制到全身协调,从执行指令到自己判断该不该停,Gemini Robotics 2正在赋予机器人更完整、安全的大脑。22自由度灵巧手打结、密封袋的能力,让人不禁想象——当机器人能像人一样系鞋带时,它离走进日常生活又近了一步。