谷歌Gemini Robotics 2实测:拧灯泡92%成功率,人形机器人终于学会”全身协调”了

AI资讯13秒前发布 aibotclaw
0 00

给一台人形机器人下达一句”把洒水壶放到架子的绿色箱子里”,它自己走过去、弯腰拿起水壶、绕过障碍物、精准放入收纳箱——这不是科幻电影的场景,而是Google DeepMind在7月30日刚刚发布的Gemini Robotics 2完成的实操演示。

这次谷歌不是简单地升级一个模型,而是一次性扔出了三个互相配合的机器人AI系统,试图解决困扰行业多年的核心难题:让机器人从”只会动手臂”进化到”全身协调”。

三模型分工:大脑、四肢、本地引擎各司其职

Gemini Robotics 2系列的核心架构分成三层,每层解决一个关键问题。

人形机器人全身AI控制网络示意图

Gemini Robotics 2(VLA执行模型)负责把摄像头画面和自然语言指令直接转化为电机控制信号。与前代只能操控机器人上半身不同,新一代首次实现了从头到脚的全身关节控制——行走、转向、下蹲、弯腰、保持平衡,再到手臂抓取,全部由同一个AI模型统一调度。这意味着机器人不再需要”先走到位置停下来,再伸手拿东西”的分步操作,而是边走边看边拿,动作连贯性大幅提升。

Gemini Robotics ER 2(具身推理模型)是整套装系统的”高级大脑”。它不直接控制电机,而是负责理解指令、拆解任务、跟踪进度、处理异常。当你给它一句模糊的”儿童需要运动”,ER 2会自动拆解出找棒球、拿球拍、布置场地等十几个步骤,并在执行过程中持续通过摄像头监控进度——如果某一步出错,它从断点重试而非从头来过。更关键的是,ER 2支持多台不同类型机器人协同作业,一台搬东西、一台组装、一台质检,分工配合完成同一条工作流。

Gemini Robotics On-Device 2(端侧模型)跑在机器人本地的计算单元上,无需联网,延迟极低。最实用的特性是跨硬件适配——只需几小时数据和不到200条示例,就能迁移到一台全新形态的机器人上,大幅降低厂商适配成本。

实测数据:拆卸能力惊艳,精细组装仍有短板

机械灵巧手精准操控发光灯泡展示92%成功率

谷歌同步公布了标准化测试数据,可以看到新一代灵巧操作的真实水平。拧下灯泡成功率高达92%,22自由度五指灵巧手能精准控制力度、不捏碎玻璃灯罩,这是本次发布最具标志性的演示。货架拾取成功率76.3%,桌面拾取68.4%。

但精细组装类任务依然棘手:安装灯泡成功率仅36%,扎垃圾袋44%,密封拉链袋40%,扫簸箕配合32%。拆卸靠旋转就够了,组装需要双向力度控制——力大了滑丝,力小了空转,这正是当前机器人与人类差距最明显的地方。

谷歌的差异化路线:只做AI大脑,不做硬件身体

多类型机器人协同作业的未来智能工厂场景

特斯拉Optimus、宇树、Figure AI都在走整机自研路线,而谷歌选择了完全不同的赛道——不造机器人硬件,只提供通用AI模型,向所有厂商开放。目前合作方包括Apptronik、波士顿动力、Agile Robots等,同一套模型权重可以驱动人形机器人Apollo 2,也可以驱动工业双臂Franka Duo。

在安全维度上,ER 2的安全指令遵循准确率从上代的47.2%飙升至97.9%,人体 proximity检测准确率从51.1%提升到93.0%。当有人靠近1米范围内,机器人会自动停机,区域清空后恢复工作。谷歌还同步推出了ASIMOV-Agentic安全基准,专门测试机器人在不确定环境中的风险识别和主动求助能力。

开发者现在就能通过Gemini API和Google AI Studio使用ER 2模型进行多步骤任务规划的测试。VLA和端侧模型则面向早期合作伙伴及100多家受信任测试机构定向开放。

具身智能的竞争正在从”谁的机械臂更灵活”转向”谁的大脑更通用”。谷歌这次用三个模型的组合拳,把赌注押在了”一套智能层适配所有机器人”的生态路线上,是否能成为机器人领域的Android,还得看后续开放节奏和实际落地效果。

© 版权声明

相关文章