機器人展示影片大多是剪過的。這次配了一張長條圖,這要勇敢得多。
7月30日,Google DeepMind 發表 Gemini Robotics 2——它第一次不只管上半身,而是從腳到指尖控制整台人形機器人。旗艦展示是 Apptronik 的 Apollo 2:一句「把澆水壺放進下層層架的綠色箱子裡」,機器人走過去、蹲下、拿起來、再走幾步、放進去。這次一起發表的是三個模型:負責動身體的視覺-語言-動作模型,負責規劃的具身推理模型 ER 2,以及離線也能跑的裝置端版本。
以上是新聞稿。以下看圖。
DeepMind 自己願意印出來的數字
Apollo 2 搭 Inspire 手,全身操作那一組:從層架上拿,76.3%;從桌上拿,68.4%;從地上拿,45.7%。
Apollo 2 搭五指、22 自由度的 SharpaWave 手,精細操作那一組:轉下燈泡,92%;把燈泡鎖回去,36%;綁垃圾袋,44%;夾鏈袋,40%;用畚箕,32%。
再看 Franka Duo——雙臂平台,末端是一支無聊的二指平行夾爪,一根手指都沒有:精密插裝,89.6%;工具分揀配盤,78.9%;一般抓放,74.2%。
DeepMind 自己在圖說裡把話講了:多指精細操作「仍然困難」。它還補了一句機器人「在移動速度上還有待提升」,翻成白話就是:慢。
先在燈泡那一對數字上停一下。轉下來成功率 92%,鎖回去成功率 36%。同一隻手、同一顆燈泡、同一個模型,只是反過來做一遍。拆是抓住加旋轉;裝是要摸到一條你看不見的螺紋,把角度對到零點幾度以內,還要靠手感判斷有沒有滑牙。92 對 36 這個落差,其實是一次相當精確的量測:人類的手上功夫裡,有多大一塊既不是眼睛,也不是腦袋,而是觸覺。
夾爪正在贏過手
以下這段沒人寫進標題。全場最便宜、最笨的那個末端——一支像是從上世紀九〇年代產線上拆下來的二指鉗——精密插裝拿到 89.6%。而那隻擬人的、22 自由度、五根手指的手,在「把燈泡鎖回去」這種同類問題上是 36%。
這個產業一直相信手是那把鑰匙:手指做得夠好,機器人就白撿了人類設計過的全部工具。這張圖給出的暗示正好相反:手是最難的那一塊,而夾爪在真正會付錢的那些活兒上已經夠用了。倉庫不需要綁垃圾袋,倉庫需要插裝、配盤、抓放,而夾爪今天就能在一個具備泛化能力的模型上做到 74% 到 90%。
所以要判斷哪些職務先動,別再問這份工作需不需要「手」。問它需不需要手指。配一盤工具,現在就暴露了;在彆扭的角落裡重接一個燈座,暫時還沒有——不是因為它像我們自我恭維的那樣「有技術含量」,而是因為它需要靠手感摸到一條螺紋,而那件事今天是 36%。
真正要命的是再訓練那個數
夾在兩組靈巧度圖表之間的,是影子拖得最長的一行字。裝置端版本 Gemini Robotics On-Device 2 遷移到一具全新的機器人身體上——外形不同、感測器不同、自由度不同——只需要幾個小時,通常不到 200 筆樣本。
兩百次示範。幾個小時。這是讓一台機器學會一副新身體的價格。
對照一下讓一個人學會一份新工作的價格:以月計,而且帳單是這個人自己付。模型今天還不如人會鎖燈泡。但遷移這一項已經領先了三個數量級,而遷移正是把一次漂亮展示變成一支機隊的那個環節。DeepMind 同時還發了 ASIMOV-Agentic 基準,用來測規劃模型會不會拒絕自家動作模型發來的危險指令、以及會不會在沒把握時主動叫人——這說明他們預期這些東西很快就要站在人旁邊做事,而且已經在為這件事編預算了。
7月30日這件事的誠實讀法,不是「機器人現在什麼都會了」。而是:腦袋能泛化了,夾爪能幹活了,手還不行,再訓練的帳單以小時計。四條裡有三條,記在機器那一邊。