Alphabet旗下人工智能研究实验室Google DeepMind今日正式发布Gemini Robotics 2系列模型,该系列专为驱动人形机器人优化,旨在实现多台自主机器协同完成复杂任务。据官方介绍,新模型可自动化处理包含数百个步骤的家务劳动。
突破“双系统”架构局限
现有人形机器人多采用“双系统”AI架构:由具身推理算法制定高级计划,再交由视觉-语言-动作(VLA)模型转化为电机底层命令。Gemini Robotics 2系列的核心亮点在于其具身推理模型——Gemini Robotics ER 2。
ER 2支持用户通过自然语言下达指令,能够规划并执行耗时数分钟、包含数百个步骤的长程任务。该模型具备工具调用能力,可访问外部云服务(如Google搜索)以澄清模糊指令。此外,ER 2能将冗长任务拆解并分配给多个机器人并行处理,从而显著提升执行效率。
针对任务执行中的容错需求,ER 2引入两项关键功能:一是基于摄像头画面的进度跟踪,若执行出错,模型可识别最后正确步骤并从断点继续,无需从头重来;二是更精准的任务完成判定,帮助机器人更快进入下一环节,优化纠错流程。
Google工程师Steven Hansen和Peng Xu在官方博客中表示:“通过观看连续视频流,机器人现在可以跟踪进度、实时调整,并确切知晓何时进入下一步。”
两款VLA模型协同作业
在ER 2生成执行计划后,指令将被发送至系列中的两款VLA模型之一,由其转化为机器人的底层控制信号。
首款模型为Gemini Robotics 2。与早期版本仅控制手部不同,新模型可操控人形机器人的全身组件,通过优化重心最大限度降低跌倒风险,并支持更广泛的机械手类型。
第二款模型为Gemini Robotics On-Device 2,专为在人形机器人机载计算机上直接运行而设计。DeepMind表示,该模型仅需数小时训练即可适配新型人形机器人硬件。
开发者访问与安全基准
目前,开发者可通过Google Cloud、Gemini API和Google AI Studio访问ER 2模型。伴随模型发布,DeepMind同步推出了名为ASIMOV-Agentic Benchmark的新具身AI安全基准,用于评估人形机器人在避免碰撞及其他潜在风险方面的能力。
【星途科讯 图文丨欧阳布布 首发于ZAKER科技,转载请注明出处】