Google DeepMind 发布 Gemini Robotics 2 模型系列,赋能人形机器人
发布于:

Google DeepMind 发布 Gemini Robotics 2 模型系列,赋能人形机器人 - SiliconANGLE
类型:新闻转载
Alphabet Inc.旗下人工智能研究实验室今日正式发布专为驱动人形机器人优化的模型家族。Google DeepMind表示,Gemini Robotics 2系列支持多台自主机器协同作业。据该公司介绍,该系列可自动化处理包含数百个步骤的复杂任务,并具备任务智能拆分、实时进度追踪与自动纠错恢复等核心能力,将显著提升人形机器人的作业效率与多机协作水平。
正文
> 本文由新莱福 MIM转载。版权归原作者所有,请参阅文末来源。
Alphabet Inc. 旗下人工智能研究实验室今日发布了一系列专为驱动人形机器人优化的模型。Google DeepMind 表示,Gemini Robotics 2 系列可支持多台自主机器协同完成一项任务。据该公司介绍,该系列能够自动化处理包含数百个步骤的日常任务。目前许多人形机器人采用所谓的“双系统”AI架构,即使用两个AI模型来协同执行工作。
第一个模型被称为具身推理算法(embodied reasoning algorithm),负责制定执行任务的高层规划。随后,它会将该规划发送给所谓的VLA模型,由后者将指令转化为控制主机机器人电机的底层命令。Gemini Robotics 2 系列的核心亮点是一款名为 Gemini Robotics ER 2 的具身推理算法。它允许用户使用自然语言描述人形机器人应执行的任务。
据谷歌介绍,ER 2 支持包含数百个步骤、耗时数分钟的任务。该模型可将冗长的任务拆分给多台不同的机器人以加快执行速度。此外,工具调用功能使 ER 2 能够访问外部云服务。例如,它可利用谷歌搜索来澄清提示词中不理解的部分。人形机器人需要具备在首次尝试失败后重新执行任务的能力。
DeepMind 表示,其工程师为 ER 2 配备了两大功能以优化工作流程。第一项功能使模型能够利用主机机器人摄像头拍摄的画面来追踪任务进度。如果机器人出现失误,ER 2 可识别机器正确完成的最后一步,并从中断处继续执行。这免去了从头重做的需要,从而节省时间。
另一项新功能使 ER 2 在判断任务何时完成方面优于前代版本。人形机器人的AI判定任务完成的速度越快,就能越快进入下一项任务。该能力还简化了识别纠错方法等相关工作。
“通过持续观看视频流,机器人现在可以追踪自身进度,在出现问题时进行调整,并确切知道何时进入下一步。”谷歌工程师 Steven Hansen 和 Peng Xu 在今日的一篇博文中写道。在 ER 2 生成任务执行规划后,它可将指令发送给 Gemini Robotics 2 系列中的另外两款模型之一。
这两款模型均为VLA算法,能够将动作规划转化为机器人的底层控制指令。第一款名为 Gemini Robotics 2。与某些早期模型不同,它能够控制人形机器人的所有组件,而不仅仅是手部。因此,该算法可以优化主机的重心,从而最大限度地降低跌倒风险。
此外,Gemini Robotics 2 支持的机械手种类比 DeepMind 早期软件更广泛。今日发布的第二款 VLA 模型名为 Gemini Robotics On-Device 2。顾名思义,它专为直接在人形机器人的车载计算机上运行而设计。DeepMind 表示,该模型仅需数小时训练即可适配新型机器人。开发者可通过 Google Cloud、Gemini API 和 Google AI Studio 访问 ER 2。
该公司在推出该模型的同时,还发布了一项全新的具身AI安全基准测试。该测试名为 ASIMOV-Agentic Benchmark,旨在评估人形机器人避免碰撞及其他风险的能力。
资讯来源
- siliconangle.com (2026-07-30) - 原文链接:[Google DeepMind debuts Gemini Robotics 2 model series for humanoid robots - SiliconANGLE](https://siliconangle.com/2026/07/30/google-deepmind-debuts-gemini-robotics-2-model-series-humanoid-robots/)