8 月 25 日下午,Figure 创始人 Brett Adcock 发了条帖子,把一个藏了四个月的项目端上桌面。项目叫 Index,原来在内部代号 Project Go-Big,现在成了 iOS 和 Android 上都能下载的 App。
四个月,它收到了 1600 万条视频,来自 108 个国家。下载量 26.4 万,每周有 4.4 万人在往里传东西。传的速度是每一秒钟进库 30 分钟的画面,换算成人类工时,一天大约 4.9 年。
Figure 为这些视频付出去 1500 万美元。接下来 12 个月,公司准备在数据采集和算力上再投 10 亿以上。
一条视频不到一美元。
它收的是什么
Index 的界面是一份任务清单。摆桌子、倒垃圾、叠衣服、整理房间——用户挑一项,戴上手机或头戴支架,把自己做这件事的第一视角录下来,上传,拿赏金。Figure 管这些人叫 Creators。
平台还有另一半:用户可以直接在 App 里约一位零工上门做家务,零工干活的同时把第一视角录下来。这笔交易里,付钱的是雇主,干活的是零工,拿走录像的是 Figure。
录的范围不止家里。餐厅、零售的后仓、物流场地都在采集清单上。
数据的多样性 Figure 也报了数:每积累 1000 小时素材,里面平均含 373 个不同任务、1146 件被操作的物品、116 种不同环境。
上传进来的东西要过五道关:先用视觉模型按分辨率、帧率、光照和任务相关性筛一遍;再由专门的人工审核团队查有没有人刷任务骗赏金;然后给每段视频算高维向量,把太相似的重复片段丢掉;接着按任务配额和聚类做再平衡,压掉过多的简单任务、把稀有情况提上来;最后给通过的片段打分层的文字标注,把高层任务描述和底层动作对齐。这一整套的下游是 Helix,Figure 的机器人神经网络。
同一件事,三种做法
把 Index 放进语境里才看得出它有多不一样。
中国的做法是盖房子。我们 7 月 17 日写过那 64 个数据采集中心,还有 20 个在建,全部按 1:1 复刻真实场景,请人进去当着摄像机干活。8 月 21 日又写过 CAICT 那份报告里的 70 个具身智能训练场,其中 86% 布置成工业制造场景。这条路的成本结构是地租、设备和工资。
美国这边的另一种做法是招人。7 月 30 日我们写过 Agility 在弗里蒙特开中心、招大约 200 人,专门教 Digit 干仓库活。这条路的成本结构是薪资和福利。
Figure 走的是第三条:不盖房子,不招人,做一个 App。它拿到的场景数是 108 个国家、每 1000 小时 116 种环境,这个覆盖面不是任何一组固定场地能造出来的。它的成本结构是按条计价的赏金。
三条路里,只有第三条不产生雇佣关系。
赏金单不是工资单
这才是这条新闻真正的分量所在。
在中国的采集中心里,出镜的人是被雇的;在 Agility 的弗里蒙特中心里,教机器人的 200 人是员工。在 Index 上,4.4 万名周活跃贡献者是按次结算的独立承包人,没有工时保障,没有福利,没有最低量,也没有对数据后续用途的任何权利。Figure 已经付掉的 1500 万,和它准备投的 10 亿,中间隔着的不只是数量级,还有这笔钱大部分不会以人力形态花出去这件事。
再看那份任务清单。餐厅、零售后仓、物流场地,正好是 Figure 已经在推销机器人的地方——它在 BMW 斯帕坦堡的产线上跑过物流序列,跟 Catalyst Brands 在里诺签了部署合同,BotQ 工厂第 1000 台 Figure 03 刚下线。换句话说,App 里列出来的任务不是随机采样,是产品路线图的另一种写法。你录的那段叠衣服,训练的是准备进你这个行业的那台机器。
Adcock 自己已经把话说明白了:硬件规模不再是主要瓶颈,瓶颈是机器身上的智能。10 亿美元投向数据和算力,是这句判断的下注方式。
哪些岗位应该把这条新闻记下来
家政和居家服务。 Index 采集清单上排在最前面的是叠衣服、铺床、打扫、摆桌子。这类工作长期被认为难自动化,理由是环境不标准。116 种环境这个数字就是冲着这条理由去的。
餐厅后厨和前厅收台。 采集范围写明包含餐厅。餐饮的动作序列短、重复率高、容错空间比手术台大,是继物流之后最容易被排上号的一类。
零售后仓理货。 Figure 在里诺的部署本来就在零售侧,采集清单里又单列了 retail stockroom。产品和数据两端对上了,说明这不是探索性采集。
仓储物流。 这条已经在进行中,不用等。值得看的是 Index 会不会把 BMW 那条产线上没解决的边缘情况补上。1146 件不同物品这个数字,针对的正是「货品形状太杂所以自动化不划算」这个老论点。
时间上不必恐慌。人类第一视角视频缺少力反馈和触觉信号,能不能撑起精细操作,学界还没有定论。但有一件事已经确定:从 8 月 25 日开始,上面这几类工作有了公开的、结构化的、每 1000 小时含 373 个标注任务的数据集,而且这个数据集每天以 4.9 年工时的速度在长。
被记录,是被自动化之前的那一步。这一步现在有人付钱了,一条不到一美元。