谷歌旗下DeepMind近期发布了Gemini Robotics 2系列智能套件,该套件由三款AI模型组成,共同为机器人提供智能支持,且能够跨机型快速适配不同硬件躯体。
DeepMind将其定位为机器人的"智能层"——可供各硬件厂商依托开发的通用基础智能套件。该套件仅需数小时的数据训练即可让AI模型适配全新机身。
这也是Gemini Robotics 2备受关注的核心原因——倘若仿人机器人未来普及度达到笔记本电脑水平,那么谁能提供可在不同机身之间顺畅迁移的通用"大脑",谁就将掌握整个行业的核心话语权。
业内指出,Alphabet、英伟达,以及一批中国科技企业,都在争相抢占"物理AI"技术栈的主导权:即建立一套可用于不同厂商机器人的通用软硬件平台,进而掌握行业标准。
业内指出,这一布局逻辑,与当初移动操作系统创造巨大产业价值的思路一致。
典型代表是安卓:谷歌并未大规模自产手机硬件,而是将安卓系统开放给三星、小米等众多厂商;海量用户与开发者持续涌入形成网络效应,平台借此掌握应用分发渠道、用户流量入口与增值服务体系,不靠销售硬件盈利,长期从整个移动产业持续获取生态收益。
跨机型迁移
Gemini Robotics 2系列共包含三款AI模型,可为仿人机器人及其他类型机器人提供全身控制能力、更精准的操作能力与协同作业能力:
1.Gemini Robotics 2:视觉-语言-动作模型(VLA),将机器人视觉信息与指令转化为运动指令,可驱动完整仿人机器人实现从足部到指尖的动作,同时适配常规双臂机器人系统。
2.Gemini Robotics ER2:具身推理模型,能够规划持续数分钟的多步骤任务,在操作失败后自主恢复,支持多机器人分工完成整套作业流程。
3.Gemini Robotics On-Device 2:轻量化版本,可直接在机器人硬件本地运行,适用于网络云连接不稳定或无法联网的场景。
当地时间7月30日,DeepMind公开演示了用同一参数模型控制三台硬件结构互不相同的机器人。其中包括搭载了两套不同机械手的Apptronik Apollo 2机器人,以及一台配备夹爪的独立双臂设备。
2025年推出的初代Gemini Robotics仅能控制机器人上半身;新版可实现全肢体动作控制,支持仿人机器人同步完成行走、下蹲、弯腰、伸展等动作。在演示中,一台Apollo 2机器人走向洒水壶,并将其放置于低层货架。
业内指出,目前该模型效果仍不稳定:在Apollo 2的全身拾取测试中,机器人从桌面拾取物体准确率约68%,货架取物准确率76%,地面取物准确率仅46%。
多指灵巧操作仍是尚未攻克的难题,简易夹爪的表现依旧优于结构复杂的仿人机械手。同时,机器人运动速度与稳定性也有待提升。
目前,三款模型的开放程度不尽相同:具身推理模型Gemini Robotics ER2已经开放;但真正实现全身控制的Gemini Robotics 2模型本体,以及轻量化的On-Device 2版本,目前仍处于早期内测阶段,短期内无法大规模投入实际使用。
DeepMind表示,基于遵守安全约束、主动避让人类等评测指标,Gemini ER2是公司迄今安全性最高的机器人模型。
