谷歌DeepMind发布了一款全新的、面向机器人的人工智能模型,声称可使人形机器人能够协调全身动作。
这是谷歌将Gemini人工智能技术进一步拓展至机器人领域的最新举措,旨在让机器人具备推理能力、规划多步骤任务,并适应人类生活环境。
新系统名为Gemini Robotics 2,能够让机器人在执行任务时完成行走、下蹲、操控物体等动作,并结合推理能力自主完成任务。
谷歌表示,与此前主要控制机器人上半身动作的模型不同,Gemini Robotics 2可以实现对整个人形机器人的全身控制。
在一段预录演示中,DeepMind的新模型操控Apptronik公司的人形机器人Apollo完成了一系列动作,包括穿过房间、拿起洒水壶并将其放到架子上,同时还能避开途中障碍物。

与此同时,DeepMind还发布了另外两款机器人AI模型,它们既可以协同工作,也可以独立运行。
其中,Gemini Robotics 2负责将摄像头画面和自然语言指令转换为机器人电机控制指令;而Gemini Robotics ER 2则充当机器人的“推理系统”,负责规划多步骤任务,并协调多个机器人共同完成同一目标。
谷歌还展示了机器人灵巧性的提升。研究人员表示,在测试中,系统完成“拧下灯泡”这一任务的成功率达到92%。不过,在扎垃圾袋、封好Ziplock密封袋等更加复杂的操作中,成功率仍然相对较低。

此外,谷歌还推出了一套新的机器人安全评测基准,用于测试机器人是否能够识别不确定情况,并拒绝执行存在安全风险的指令。
谷歌表示,相较此前的模型,Gemini Robotics ER 2是公司迄今最安全的机器人模型,尤其在遵循指令以及避让人类方面表现更佳。
谷歌表示,Gemini Robotics ER 2将通过公司的开发者平台AI Studio开放,并在企业级AI平台上提供私人预览;更加专业化的Gemini Robotics 2和On-Device 2模型则将率先向早期合作伙伴及100多家受信任测试机构开放。
公司还宣布,将向机器人开发者开放模型候补名单,并正与包括Apptronik、Agile Robots SE以及Boston Dynamics在内的一系列核心合作伙伴展开合作。

DeepMind机器人业务副总裁Carolina Parada在介绍时表示:“我们的目标是将AI带入物理世界,并构建一层能够被所有机器人使用的智能系统。”
但DeepMind机器人业务总监Kanishka Rao也坦言,真正实现机器人媲美人类的灵巧性仍然任重道远。目前机器人动作依然缓慢且谨慎,因为机器在执行过程中仍需停下来思考那些人类能够凭直觉完成的决策。
Rao强调,机器人目前的学习效率仍远低于人类。人类往往只需经历一两次错误便能调整行为,而机器人距离这一水平仍有较大差距。
此次发布建立在谷歌于2025年推出Gemini Robotics的基础上,后者是Gemini旗舰AI模型的机器人版本,能够将语言和视觉信息转化为机器人的实际动作。
这一产品也标志着谷歌重新点燃了延续十余年的机器人战略。Alphabet曾收购多家机器人初创公司,但随后逐步缩减相关业务,并于2023年关闭了Everyday Robots部门。
谷歌的竞争对手OpenAI和英伟达也在积极布局机器人AI。OpenAI一直探索融合视觉、语言和动作能力的通用机器人基础模型,而英伟达则提供帮助开发者训练AI机器人的软件平台。