最重要的数字是 22:五指 SharpaWave 手的自由度数,谷歌新款机器人模型现在能在完整的人形身体上驱动它。在 7 月 30 日发表的两篇博客中,Google DeepMind 发布了 Gemini Robotics 2,这是其首个控制完整人形机器人的视觉-语言-动作模型,用谷歌的话说'从脚到指尖',而此前版本只能做桌面上的上半身任务。在 Apptronik 的 Apollo 2 上的演示中,机器人走到桌边,抓起浇水壶,穿过房间放上架子,然后用这只灵巧手打结、封拉链袋;Franka Duo 平台则用双指夹爪完成紧凑装箱。
第二个模型才是构建者真正能碰到的。Gemini Robotics ER 2 是规划大脑:它编排持续数分钟、包含谷歌所称数百个决策的多步骤任务,自行纠正失败的步骤,原生调用 Google 搜索等工具,并接入 Gemini Live API 实现双向流式交互。它今日起通过 Gemini API 和 Google AI Studio 公开可用,并在 Gemini Enterprise Agent Platform 上提供私有预览。谷歌自评声称:进度分类准确率 57.4%,时刻定位准确率 91.3%、平均绝对误差 0.96 秒,执行速度是远大于它的模型的 4 倍,还能读取 10 种仪器,从数字显示屏到液体温度计。
第三个模型 Gemini Robotics On-Device 2 在本地运行,谷歌称它能在几小时内适配全新的机器人本体,通常只需不到 200 个样本,已在 Dexmate、SO101 和 Trossen 硬件上演示。多机器人演示把 Apollo 2 与 Franka F3 Duo 配对,另一个演示中 ER 2 编排 Boston Dynamics Spot 的 API,按语音指令取来零食,代码已放上 GitHub。被点名的合作伙伴是 Apptronik、Boston Dynamics 和 Agile Robots。安全方面,谷歌发布了针对不安全工具调用和人工介入请求的新基准 ASIMOV-Agentic,并表示当有人靠近时 ER 2 会让人形机器人停下,道路清空后再继续。
保留意见是结构性的。上述每一项基准都是谷歌自己跑的评估,展示给记者(包括 WIRED)的演示是预录视频,不是现场运行。可用性的分布也让这则公告回到实际尺寸:三个模型中只有 ER 2 公开可用,Robotics 2 和 On-Device 2 仍限于抢先体验合作伙伴。DeepMind 机器人负责人 Carolina Parada 把这次发布称为通向'物理 AGI'的里程碑。对构建者更有用的是更安静的解读:机器人控制正在变成与文本生成同一张 API 账单上的一行,而悬而未决的问题正从'模型能不能动手臂'变成'谁被允许运行它,依据什么安全论证'。
