机器人演示视频大多是剪过的。这次配了一张柱状图,这要勇敢得多。
7月30日,Google DeepMind 发布 Gemini Robotics 2——它第一次不只管上半身,而是从脚到指尖控制整台人形机器人。旗舰演示是 Apptronik 的 Apollo 2:一句「把洒水壶放进下层货架的绿色箱子里」,机器人走过去、蹲下、拿起来、再走几步、放进去。这次一起发的是三个模型:负责动身体的视觉-语言-动作模型,负责规划的具身推理模型 ER 2,以及断网也能跑的端侧版本。
以上是通稿。下面看图。
DeepMind 自己愿意印出来的数字
Apollo 2 配 Inspire 手,全身操作那一组:从货架上拿,76.3%;从桌上拿,68.4%;从地上拿,45.7%。
Apollo 2 配五指、22 自由度的 SharpaWave 手,精细操作那一组:拧下灯泡,92%;把灯泡拧回去,36%;系垃圾袋,44%;密封袋,40%;用簸箕,32%。
再看 Franka Duo——双臂平台,末端是一只无聊的二指平行夹爪,一根手指都没有:精密插装,89.6%;工具分拣配盘,78.9%;通用抓放,74.2%。
DeepMind 自己在图注里把话说了:多指精细操作「仍然困难」。它还提了一句机器人「在移动速度上还有待提升」,翻译过来就是:慢。
先在灯泡那一对数字上停一会儿。拧下来成功率 92%,拧回去成功率 36%。同一只手、同一个灯泡、同一个模型,只是反过来做一遍。拆是抓住加旋转;装是要摸到一根你看不见的螺纹,把角度对到零点几度以内,还要靠手感判断有没有拧滑丝。92 对 36 这个落差,其实是一次相当精确的测量:人类的手上功夫里,有多大一块既不是眼睛,也不是脑子,而是触觉。
夹爪正在赢过手
下面这部分没人写进标题。全场最便宜、最笨的那个末端——一只像是从上世纪九十年代产线上拆下来的二指钳子——精密插装拿到 89.6%。而那只拟人的、22 自由度、五根手指的手,在「把灯泡拧回去」这种同类问题上是 36%。
这个行业一直相信手是那把钥匙:手指做得够好,机器人就白捡了人类设计过的全部工具。这张图给出的暗示正好相反:手是最难的那一块,而夹爪在真正付钱的那些活儿上已经够用了。仓库不需要系垃圾袋,仓库需要插装、配盘、抓放,而夹爪今天就能在一个具备泛化能力的模型上做到 74% 到 90%。
所以要判断哪些岗位先动,别再问这活儿需不需要「手」。问它需不需要手指。配一盘工具,现在就暴露了;在别扭的角落里重接一个灯座,暂时还没有——不是因为它像我们自我恭维的那样「有技术含量」,而是因为它需要靠手感摸到一根螺纹,而那件事今天是 36%。
真正要命的是再培训那个数
被夹在两组灵巧度图表之间的,是影子拖得最长的一行字。端侧版 Gemini Robotics On-Device 2 迁移到一具全新的机器人身体上——外形不同、传感器不同、自由度不同——只需要几个小时,通常不到 200 条样本。
两百次演示。几个小时。这是让一台机器学会一副新身体的价格。
对照一下让一个人学会一份新工作的价格:以月计,而且账单是这个人自己付。模型今天还不如人会拧灯泡。但迁移这一项已经领先了三个数量级,而迁移正是把一次漂亮演示变成一支机队的那个环节。DeepMind 同时还发了 ASIMOV-Agentic 基准,用来测规划模型会不会拒绝自家动作模型发来的危险指令、以及会不会在没把握时主动叫人——这说明他们预期这些东西很快就要站在人旁边干活,并且已经在为这件事做预算了。
7月30日这件事的诚实读法,不是「机器人现在什么都会了」。而是:脑子能泛化了,夹爪能干活了,手还不行,再培训的账单以小时计。四条里有三条,记在机器那一边。