RT-2:把机械臂挤进词表
RT-2 · Brohan, Brown, Carbajal 等 54 人 · Google DeepMind · 2023 · arXiv:2307.15818
今天满天飞的 VLA(Vision-Language-Action,视觉-语言-动作模型)这个词,就是这篇论文造的。如果你读过我们的地图篇《当 AI 长出手来》,你已经见过那个惊人的主意——动作也是一种语言。但主意本身不值钱:把一个 550 亿参数、只会说话的大家伙真的接上电机,中间有一连串没人踩过的坑。这篇我们钻进坑里看:手术具体怎么做、哪一步的代价最贵、以及做完之后它仍然做不到什么。PaLI-X、PaLM-E、反词元化——这些名字你一个都不用记。你只需要盯住一根香蕉,和一道小学算术题:2 + 1 = ?
它什么都懂,就是手没接线
2023 年初,Google 手里有当时世界上最聪明的「看图说话模型」(论文里叫视觉语言模型,VLM):给它一张照片,它能告诉你里面有什么、谁和谁是什么关系、法语提问也照答不误。桌上这个场景——一根香蕉、三张数字卡片、一罐可乐、一只闲着的机械臂——对它来说毫无难度。就像家里来了位百科全书级的客人:什么都知道,就是四体不勤。
挨个点下面三个问题,先考考它;确认它真的懂了,再点最后那条红色的指令。
机器人的一句话,只有八个词
机械臂听的"话",RT-2 直接沿用了前作 RT-1 定好的格式:每个控制瞬间,手臂需要知道 8 件事——要不要收工、朝三个方向各挪多少、绕三个轴各转多少、夹爪张多开。每一件事的取值被切成 0 到 255 共 256 档(为什么要切档、切粗切细有什么代价,地图篇拆过,这里直接用结论)。于是一个机器人动作,就是一句 8 个整数的电文。论文里的真实例子长这样:
"1 128 91 241 5 101 127"
(收工=1 · 平移三档 · 旋转三档 · 夹爪一档)
像发电报:再复杂的舞步,拆成每拍一句、八个字的电文,就能从电话线里过去。光看定义没感觉——你来当一次 RT-2:用下面的按钮,把香蕉搬到写着"3"的卡片旁边,最后按「收工」交卷。每按一下,你就替模型"说"了一句话:
词表手术:给 256 个新词找座位
词表(词元表)是语言模型认识的全部"字",每个词元背着一套预训练权重,像剧院里张张有主的座位。现在要塞进 256 个从没存在过的动作词。先别往下读——如果是你,你会怎么办?押一个:
一起炼,还是先后炼
直觉的做法:预训练好的看图说话模型摆在那儿,用机器人数据微调一遍不就完了?论文管这叫「只炼机器人数据」(fine-tuning)。另一条路贵得多:「一起炼」(co-fine-tuning,共同微调)——微调的每一锅里,既有机器人轨迹,也掺着原汁原味的网络图文问答(PaLI-X 版机器人数据约占一半,PaLM-E 版约三分之二,靠采样权重配平)。像学第二门外语时把母语课本也带在书包里:多背了几斤书,但不会学了新的忘了旧的。到底值不值?论文用同一套"没见过的东西"考卷做了消融实验。点下面五份配方,亲眼比较:
三个数值得盯:从零训只有 9%——惨到论文直接放弃给 55B 跑从零对照,这一格永远空着;5B 上"一起炼"只比"只炼"多 2 个百分点(44 对 42),可到了 55B,差距张开到 11 个百分点(63 对 52)——模型越大,忘掉网络课本的损失越贵。右下角那本"网络课本"就是原因:只炼机器人数据时,模型对"卡通、恐龙、Taylor Swift"这些概念的记忆会被 8 个整数的电文一点点冲刷掉;一起炼,课本始终摊开着。网络知识不是一次性注入的燃料,是要持续喂的口粮——停喂就忘。顺带一提代价:炼出来的 55B 塞不进任何机器人的机载电脑,只能架在云端多块 TPU 上、隔着网线遥控手臂,每秒 1 到 3 句电文——正好是你在上一节体会过的那个节奏。好,钱花了、饭喂了,网络知识真的流进手里了吗?
论文表 6 全档数据(易 / 难分开算)
| 配方 | 未见物体 易/难 | 未见背景 易/难 | 未见环境 易/难 | 平均 |
|---|---|---|---|---|
| 从零 · 5B | 0 / 10 | 46 / 0 | 0 / 0 | 9% |
| 只炼 · 5B | 24 / 38 | 79 / 50 | 36 / 23 | 42% |
| 一起炼 · 5B | 60 / 38 | 67 / 29 | 44 / 24 | 44% |
| 只炼 · 55B | 60 / 62 | 75 / 38 | 57 / 19 | 52% |
| 一起炼 · 55B | 70 / 62 | 96 / 48 | 63 / 35 | 63% |
单位均为成功率。机器人数据来自 RT-1:13 台机械臂在办公室厨房环境里采了 17 个月;网络数据是 100 亿级图文对(过滤后取 10 亿)。另有一个 3B 小型版在开源的 Language-Table 仿真台上拿到 90±10 分,超过之前所有基线(72-77 分),说明配方换个机器人也灵。
涌现考场:考它没学过的题
先说清"涌现"在这里的严格含义:指令里的关键概念,从没在任何机器人数据里出现过——能做出来,只可能是网络知识顺着共享的词表流进了电机。论文攒了约 6000 次真机评测,把这类考题分成三科:符号理解、推理、人物识别。下面四道都是论文里的原题(我们那根香蕉也在)。每道题先押注:这台 55B 的 RT-2,多半能成,还是多半会砸?四道都押完才开榜:
论文表 5 · 涌现考卷完整成绩单
| 模型 | 符号理解 | 数学 | 标志(logo) | 营养 | 颜色/多语言 | 推理平均 | 人物识别 | 总平均 |
|---|---|---|---|---|---|---|---|---|
| VC-1(视觉预训练基线) | 11 | 0 | 8 | 20 | 13 | 10 | 13 | 11% |
| RT-1 | 16 | 5 | 0 | 32 | 28 | 16 | 20 | 17% |
| RT-2 · PaLI-X-55B | 82 | 25 | 52 | 48 | 58 | 46 | 53 | 60% |
| RT-2 · PaLM-E-12B | 36 | 35 | 56 | 44 | 35 | 43 | 43 | 40% |
多语言也算涌现:机器人数据全是英文指令,但"mueve la manzana al vaso verde"(西语:把苹果移到绿杯子)、"déplacer les frites verts dans la tasse rouge"(法语)它也接得住——109 种语言的网络图文喂出来的。整体上 RT-2 比 RT-1 高 3 倍多(60% 对 17%)。
先想,再动手
"把香蕉移到 3 旁"再难,好歹指名道姓。可"我饿了"呢?没有名词,没有动词,没有目标——人听了会先在心里过一道弯:"饿了 → 要吃的 → 桌上有根蛋白棒 → 拿它"。论文最后做了个轻巧的实验:把训练数据改造一下,让模型在动作电文前,先写一行给自己看的「打算」(Plan)——这借的是大语言模型思维链(chain-of-thought)的路子,而且只额外训了几百步。点一条指令,看它落笔的顺序(四条都是论文真实记录,动作数字原样照抄):
边界:新名词学得会,新动词学不会
把网络知识炼进手臂,到底买到了什么、没买到什么?下面七件事,全部出自论文的评测清单和失败清单。你来当审稿人:每件事,判它"能"还是"不能"——判完七件,规律自己会浮出来。
沙盒:指挥一台完整的 RT-2
这就是整条流水线:相机画面和你的指令拼成一句提问 → 视觉编码器 → 语言模型 →(先写打算,如果开了思维链)→ 吐出 8 个动作词元 → 反词元化(de-tokenize,把词元翻译回位移)→ 电机。随便发指令,拨弄两个开关;再接受一个挑战:找出一条它每个字都听得懂、却永远做不成的指令。
凉亭:VLA 这个词,从这里开始
回看你这一路亲手做过的事:你先让一个满腹经纶的模型当众卡壳——说得出、做不到(§1);然后替它说了一段 8 个词一句的电文独白(§2);押中(或没押中)两台模型的词表手术——借数字的座位,或者赶走冷门词(§3);比较过五份训练配方,看着"只炼机器人数据"把网络课本一点点忘掉(§4);给四道涌现考题开了榜,发现数学那科小模型反超(§5);看它在动手前先写一行给自己的打算(§6);最后当审稿人画出了"新名词能、新动词不能"的边界(§7),又在沙盒里亲手撞了一次(§8)。
论文给这套"视觉 + 语言 + 动作共用一个模型、一张词表"的做法起了个名字:vision-language-action model,VLA。名字起对了很重要——此后几年,开源复刻、跨机构数据联盟、各家的下一代机器人大脑,全都自称 VLA,整个赛道以这篇论文为原点重新排队。而它留下的两道未解题——新动作从哪来(论文自己猜:也许从人类视频里学)、大模型怎么塞回机器人肚子里(量化、蒸馏)——正是后来者排队要解的题。想看这条队伍排成了什么样,地图篇《当 AI 长出手来》的六级台阶和数据饥荒图就在隔壁等你。
一句话带走:让手学会说话,比让嘴学会干活,路要短得多。嘴到手的全部工程,不过是 256 个借来的座位、一锅掺着网络课本的饭、和一行写给自己的打算。