正在翻开……

RT-2:把机械臂挤进词表

RT-2 · Brohan, Brown, Carbajal 等 54 人 · Google DeepMind · 2023 · arXiv:2307.15818

今天满天飞的 VLA(Vision-Language-Action,视觉-语言-动作模型)这个词,就是这篇论文造的。如果你读过我们的地图篇《当 AI 长出手来》,你已经见过那个惊人的主意——动作也是一种语言。但主意本身不值钱:把一个 550 亿参数、只会说话的大家伙真的接上电机,中间有一连串没人踩过的坑。这篇我们钻进坑里看:手术具体怎么做、哪一步的代价最贵、以及做完之后它仍然做不到什么。PaLI-X、PaLM-E、反词元化——这些名字你一个都不用记。你只需要盯住一根香蕉,和一道小学算术题:2 + 1 = ?

它什么都懂,就是手没接线

2023 年初,Google 手里有当时世界上最聪明的「看图说话模型」(论文里叫视觉语言模型,VLM):给它一张照片,它能告诉你里面有什么、谁和谁是什么关系、法语提问也照答不误。桌上这个场景——一根香蕉、三张数字卡片、一罐可乐、一只闲着的机械臂——对它来说毫无难度。就像家里来了位百科全书级的客人:什么都知道,就是四体不勤。

挨个点下面三个问题,先考考它;确认它真的懂了,再点最后那条红色的指令。

电机总线监听中……收到可执行指令:0 条
这是一台会看图说话的大模型 + 一只等待指令的机械臂 · 先提问,再下命令

机器人的一句话,只有八个词

机械臂听的"话",RT-2 直接沿用了前作 RT-1 定好的格式:每个控制瞬间,手臂需要知道 8 件事——要不要收工、朝三个方向各挪多少、绕三个轴各转多少、夹爪张多开。每一件事的取值被切成 0 到 255 共 256 档(为什么要切档、切粗切细有什么代价,地图篇拆过,这里直接用结论)。于是一个机器人动作,就是一句 8 个整数的电文。论文里的真实例子长这样:

"1  128  91  241  5  101  127"
(收工=1 · 平移三档 · 旋转三档 · 夹爪一档)

像发电报:再复杂的舞步,拆成每拍一句、八个字的电文,就能从电话线里过去。光看定义没感觉——你来当一次 RT-2:用下面的按钮,把香蕉搬到写着"3"的卡片旁边,最后按「收工」交卷。每按一下,你就替模型"说"了一句话:

下探到香蕉正上方再合爪才能抓住 · 每按一下 = 替模型说一句 8 个词的电文

词表手术:给 256 个新词找座位

词表(词元表)是语言模型认识的全部"字",每个词元背着一套预训练权重,像剧院里张张有主的座位。现在要塞进 256 个从没存在过的动作词。先别往下读——如果是你,你会怎么办?押一个:

押完注,看两台真实模型分别怎么动这台手术

一起炼,还是先后炼

直觉的做法:预训练好的看图说话模型摆在那儿,用机器人数据微调一遍不就完了?论文管这叫「只炼机器人数据」(fine-tuning)。另一条路贵得多:「一起炼」(co-fine-tuning,共同微调)——微调的每一锅里,既有机器人轨迹,也掺着原汁原味的网络图文问答(PaLI-X 版机器人数据约占一半,PaLM-E 版约三分之二,靠采样权重配平)。像学第二门外语时把母语课本也带在书包里:多背了几斤书,但不会学了新的忘了旧的。到底值不值?论文用同一套"没见过的东西"考卷做了消融实验。点下面五份配方,亲眼比较:

同一套"未见物体 / 未见背景 / 未见环境"考卷 · 数据:论文表 6

三个数值得盯:从零训只有 9%——惨到论文直接放弃给 55B 跑从零对照,这一格永远空着;5B 上"一起炼"只比"只炼"多 2 个百分点(44 对 42),可到了 55B,差距张开到 11 个百分点(63 对 52)——模型越大,忘掉网络课本的损失越贵。右下角那本"网络课本"就是原因:只炼机器人数据时,模型对"卡通、恐龙、Taylor Swift"这些概念的记忆会被 8 个整数的电文一点点冲刷掉;一起炼,课本始终摊开着。网络知识不是一次性注入的燃料,是要持续喂的口粮——停喂就忘。顺带一提代价:炼出来的 55B 塞不进任何机器人的机载电脑,只能架在云端多块 TPU 上、隔着网线遥控手臂,每秒 1 到 3 句电文——正好是你在上一节体会过的那个节奏。好,钱花了、饭喂了,网络知识真的流进手里了吗?

论文表 6 全档数据(易 / 难分开算)
配方未见物体 易/难未见背景 易/难未见环境 易/难平均
从零 · 5B0 / 1046 / 00 / 09%
只炼 · 5B24 / 3879 / 5036 / 2342%
一起炼 · 5B60 / 3867 / 2944 / 2444%
只炼 · 55B60 / 6275 / 3857 / 1952%
一起炼 · 55B70 / 6296 / 4863 / 3563%

单位均为成功率。机器人数据来自 RT-1:13 台机械臂在办公室厨房环境里采了 17 个月;网络数据是 100 亿级图文对(过滤后取 10 亿)。另有一个 3B 小型版在开源的 Language-Table 仿真台上拿到 90±10 分,超过之前所有基线(72-77 分),说明配方换个机器人也灵。

涌现考场:考它没学过的题

先说清"涌现"在这里的严格含义:指令里的关键概念,从没在任何机器人数据里出现过——能做出来,只可能是网络知识顺着共享的词表流进了电机。论文攒了约 6000 次真机评测,把这类考题分成三科:符号理解、推理、人物识别。下面四道都是论文里的原题(我们那根香蕉也在)。每道题先押注:这台 55B 的 RT-2,多半能成,还是多半会砸?四道都押完才开榜:

"多半能成" = 该科成功率过半 · 数据:论文表 5,每条指令真机跑 5 次
论文表 5 · 涌现考卷完整成绩单
模型符号理解数学标志(logo)营养颜色/多语言推理平均人物识别总平均
VC-1(视觉预训练基线)11082013101311%
RT-116503228162017%
RT-2 · PaLI-X-55B8225524858465360%
RT-2 · PaLM-E-12B3635564435434340%

多语言也算涌现:机器人数据全是英文指令,但"mueve la manzana al vaso verde"(西语:把苹果移到绿杯子)、"déplacer les frites verts dans la tasse rouge"(法语)它也接得住——109 种语言的网络图文喂出来的。整体上 RT-2 比 RT-1 高 3 倍多(60% 对 17%)。

先想,再动手

"把香蕉移到 3 旁"再难,好歹指名道姓。可"我饿了"呢?没有名词,没有动词,没有目标——人听了会先在心里过一道弯:"饿了 → 要吃的 → 桌上有根蛋白棒 → 拿它"。论文最后做了个轻巧的实验:把训练数据改造一下,让模型在动作电文前,先写一行给自己看的「打算」(Plan)——这借的是大语言模型思维链(chain-of-thought)的路子,而且只额外训了几百步点一条指令,看它落笔的顺序(四条都是论文真实记录,动作数字原样照抄):

点一条拐弯的指令 · 看「打算」那一行如何把弯拉直

边界:新名词学得会,新动词学不会

把网络知识炼进手臂,到底买到了什么、没买到什么?下面七件事,全部出自论文的评测清单和失败清单。你来当审稿人:每件事,判它"能"还是"不能"——判完七件,规律自己会浮出来。

判词:能 / 不能 · 出处:论文附录 F 评测清单 + 第 5 节与附录 G 失败清单

沙盒:指挥一台完整的 RT-2

这就是整条流水线:相机画面和你的指令拼成一句提问 → 视觉编码器 → 语言模型 →(先写打算,如果开了思维链)→ 吐出 8 个动作词元 → 反词元化(de-tokenize,把词元翻译回位移)→ 电机。随便发指令,拨弄两个开关;再接受一个挑战:找出一条它每个字都听得懂、却永远做不成的指令。

55B · 云端 TPU · 每秒 1-3 句电文 · 结果按论文各科成功率折算成"5 次里成几次"

凉亭:VLA 这个词,从这里开始

回看你这一路亲手做过的事:你先让一个满腹经纶的模型当众卡壳——说得出、做不到(§1);然后替它说了一段 8 个词一句的电文独白(§2);押中(或没押中)两台模型的词表手术——借数字的座位,或者赶走冷门词(§3);比较过五份训练配方,看着"只炼机器人数据"把网络课本一点点忘掉(§4);给四道涌现考题开了榜,发现数学那科小模型反超(§5);看它在动手前先写一行给自己的打算(§6);最后当审稿人画出了"新名词能、新动词不能"的边界(§7),又在沙盒里亲手撞了一次(§8)。

论文给这套"视觉 + 语言 + 动作共用一个模型、一张词表"的做法起了个名字:vision-language-action model,VLA。名字起对了很重要——此后几年,开源复刻、跨机构数据联盟、各家的下一代机器人大脑,全都自称 VLA,整个赛道以这篇论文为原点重新排队。而它留下的两道未解题——新动作从哪来(论文自己猜:也许从人类视频里学)、大模型怎么塞回机器人肚子里(量化、蒸馏)——正是后来者排队要解的题。想看这条队伍排成了什么样,地图篇《当 AI 长出手来》的六级台阶和数据饥荒图就在隔壁等你。

一句话带走:让手学会说话,比让嘴学会干活,路要短得多。嘴到手的全部工程,不过是 256 个借来的座位、一锅掺着网络课本的饭、和一行写给自己的打算。