正在翻开……

当 AI 长出手来:VLA 地图

Ma, Song, Zhuang, Hao, King · IEEE TNNLS 2025 · arXiv:2405.14093(2024 首发,至今仍在更新)

聊天 AI 会写十四行诗,却拧不开一瓶矿泉水。让 AI 从屏幕里伸出手来,是眼下增长最疯的领域之一:视觉-语言-动作模型(Vision-Language-Action,下文叫它 VLA)。这篇综述是该领域的第一张全图,里面挤着几百个名字——RT-2、OpenVLA、π0、GR00T、SayCan……你一个都不用记。我们全程只用一句指令:「把房间收拾一下」,看它如何从没人听得懂,到被拆解、被编码、最后被一只真正的手执行。读完,每个名字自然会落在地图上它自己的位置。

一句话,指挥一台机器人

场景是综述作者自己画的那间客厅:地上一辆玩具车,咖啡桌上一台相机。角落里停着一台 2021 年的机器人——别小看它,抓取、路径规划这些活它都熟。点一条指令发给它,看它接不接得住:

点上方任意一条指令 · 观察机器人的反应

机器人的第一个瓶颈不是手笨,是耳聋;第二个瓶颈,是听懂了也不知道从何做起。这两个瓶颈,恰好就是这张地图的两个半球。

地图的骨架:大脑与小脑

你决定"去厨房倒杯水"的时候,没有哪一秒是在有意识地指挥股四头肌。决策住在语言里,迈腿住在肌肉里,两套系统各干各的。综述把几百个机器人模型整理成同一副骨架:任务规划器(task planner,大脑)负责把长指令拆成小步骤,控制策略(control policy,小脑)负责把每个小步骤变成电机转角。我们那句指令的命运,全写在这张图里:

综述的层级框架(原文图 4 的例子):「把房间收拾一下」被大脑拆成三个子任务,小脑逐个执行。综述的三条研究线就长在这副骨架上——小脑怎么造(控制策略)、大脑怎么造(任务规划器)、零件怎么造(视觉表征 / 世界模型等组件)。

顺便交代综述的定义:狭义的 VLA 指 RT-2 那种"拿视觉语言大模型直接当小脑"的做法(综述叫它 Large VLA);广义则是任何看图、听话、产生动作的模型。本文两种都会遇到。

大脑活在语言里,小脑活在动作里。这张地图的全部故事,是这两个世界怎么接起来。然而小脑有个先天麻烦:Transformer 天生吐的是词,可小脑要吐的是关节角——7 个连续的实数。嘴型对不上。

手的语言问题

小提琴的音高是连续的,钢琴只有 88 个键——可 88 个键够弹肖邦。机械臂的动作也一样:与其让模型回归一个精确的连续值(BC-Z 用 MLP 干这个),不如把每个维度切成固定数量的档位,动作就变成了"按第几号键"。这正是 RT 系列的做法。拖动滑块改变档位数,看夹爪的下降-抓取-抬起轨迹被切档后还剩几分原样:

灰色 = 原始连续轨迹 · 绿色 = 切档后的轨迹 · 拖到两端看极端情况

两档的时候,夹爪只有"举着"和"砸下"两种人生,玩具车凶多吉少;到 256 档,绿色阶梯和灰线已经肉眼难分。注意右上角那行字:切完档,一步动作就是七个小整数——连续动作切成足够密的档位,就成了一门词汇量有限的语言。而语言,恰好是 Transformer 的母语。

不过,把动作写成"词"只是准备了课本。真正的分水岭在于:这本课本被塞进了的嘴里。

分水岭:动作也是一种语言

2023 年,RT-2 做了一件事后看理所当然、当时无人敢做的事:把 §03 那些动作档位直接排进视觉语言大模型的词表,跟"猫""因为""extinct"这些词元(token,模型眼里的最小记号)坐同一排座位;然后用互联网级的图文问答数据和机器人数据联合微调(co-fine-tuning)。于是同一台"预测下一个词元"的机器,既能答题,也能开动夹爪。依次按下面三个按钮——注意它们经过的是同一个盒子:

同一个下一词元预测器 · 词表里既有文字,也有动作档位

"VLA"这个词就是 RT-2 论文发明的。而它的胃口也是互联网级的——问题来了:互联网上有的是图和文字,机器人的粮仓里有什么?

数据饥荒:两个半数量级的落差

网络图片自带说明文字,白捡;机器人轨迹要一个人握着遥操作手柄,一条一条演示出来。下面这张图,上面一根是 CLIP 一个模型的训练饭量(4 亿图文对,我们在《当文字遇见图像:CLIP》里见过它),下面十三根是这些年最有名的机器人数据集。先看清默认的样子,再点「对数刻度」

线性刻度下,全部机器人数据集挤在左边一条发丝里 · 数字取自综述表 V

线性刻度下,十三个数据集全部缩在一根发丝里;就算把它们不去重地全叠起来(约 320 万条轨迹),也不到 CLIP 饭量的百分之一。切到对数刻度才看得见彼此——每格是 10 倍。而且一条轨迹只对应一句指令,监督信号还要再打折扣。网络图文按亿计,机器人轨迹按万计。差出的这两个半数量级,是这个领域一切痛苦、也是一切发明的来源。

围绕这口枯井,综述记录了三条自救路:仿真造数据(RLBench、CALVIN、Habitat……但仿真的物理和渲染跟现实有缝,叫 sim-to-real gap「仿真到现实的落差」);人类视频当师傅(LAPA 从网络视频里学"潜在动作",UMI 用手持夹爪录人类演示——但人手和机械爪长得不一样);机器人自己采(AutoRT、RoboGen 让大模型当监工批量生成任务)。每条路都补了一点,每条路都有代价。

综述表 V:十三个真机数据集的完整账本(可跳过)
数据集技能数任务数轨迹数采集方式机器人
MIME (2018)12208.3K人类遥操作Baxter
RoboTurk (2018)*232.1K人类遥操作Sawyer
RoboNet (2019)162K脚本7 种
MT-Opt (2021)212800K脚本+强化学习7 种
BC-Z (2021)310025.9K人类遥操作EDR
Fractal / RT-1 (2022)12700+130K人类遥操作EDR
MOO (2023)559.1K人类遥操作EDR
VIMA (2022)*17650K脚本UR5
RoboSet (2023)123898.5K人类+脚本Franka
BridgeData V2 (2023)1360.1K人类+脚本WidowX
RH20T (2023)42147110K+人类遥操作4 种
DROID (2024)8676K人类遥操作Franka
OXE (2023, 汇总)527160K1M+聚合 60+ 数据集22 种

* 标星的在仿真里采集。按 RT-X 的口径,"技能"是动词,"任务"是动词×物体的组合。OXE 会在下一节登场——它就是全行业面对饥荒的集体答案。

小脑的六级台阶

零件备齐了:动作能写成词(§03),词表能和语言合并(§04),数据的窘境也心里有数(§05)。现在把综述的演进线拉直,从 2021 走到 2025。拖动滑块,一站一站走,每站盯住两件事——它新添了什么本事,以及我们那句「把房间收拾一下」有没有着落:

第 1 站 · CLIPort (2021) · 借来的眼睛

看出这条线的暗律了吗:CLIPort 借 CLIP 的眼睛,RT-1 攒 13 万条演示,RT-2 把词表合一,RT-X 让 22 种机器人共享一锅数据,π0 用流匹配(flow matching,一种直接生成连续值的技术)把连续动作请回来,GR00T 用双系统解决"想得深"和"动得快"的打架。每一级台阶都在回答同一道题:怎么用最少的机器人数据,接住最多的世界知识。

但也请注意每一站右下角那个不变的 ✗——六站全是小脑。「把房间收拾一下」至今躺在原地,因为它等的是大脑。

六站的完整参数对照(取自综述表 III 及正文)
模型年份视觉语言/VLM动作头训练数据
CLIPort2021CLIP-ResNet50 + Transporter 双流CLIP 文本编码器SE(2) 抓放Ravens 仿真
RT-12022EfficientNetUSE 句向量 (FiLM 融合)Transformer → 离散档位Fractal:130K 条 / 700+ 任务
RT-22023ViT-4B / ViT-22BPaLI-X / PaLM-E动作词元入词表机器人数据 + 互联网 VQA 联合微调
RT-X / OpenVLA2023-24(RT 系) / DINOv2+SigLIP(RT 系) / Prismatic-7B离散词元OXE:22 种机器人 · 1M+ 轨迹
π02024SigLIPPaliGemma动作专家 · 流匹配(连续)OXE + 自采跨具身数据
GR00T N12025System 2:VLM 慢想 (10 Hz)System 1:扩散快动 (120 Hz)面向人形机器人

这条主线之外,综述还记录了旁支:扩散策略(Diffusion Policy、Octo、RDT-1B——擅长多峰、高维动作)、3D 点云策略(DP3、Act3D、PerAct)、状态空间模型(RoboMamba)等。它们都会在结尾的沙盒里等你。

大脑上线:会说,还要能做

让 LLM 当大脑,把「把房间收拾一下」拆成子任务——听起来一句提示词的事。但 LLM 有个致命的天真:它活在语言里,不知道这台机器人此刻够不够得着。SayCan 的答案漂亮得像一道乘法:LLM 给每个候选动作打一个"说得通"的分(says),机器人的价值函数给同一个动作打一个"做得到"的分(can),两分相乘才是真正的下一步。切换三个场景,看乘法怎么改主意:

橙 = LLM 觉得说得通 · 绿 = 机器人觉得做得到 · 深色 = 两者相乘 · ★ = 胜出

盯住橙色柱:三个场景里它纹丝不动——LLM 又看不见沙发底。变的全是绿色柱,于是乘出来的深色柱一次次改选:车在脚边就捡车,车够不着就先干别的,桌上有果汁渍、抹布就在手边,那就先擦桌子。LLM 知道什么说得通,机器人知道什么够得着;两个分数相乘,计划才踩到了地上。

大脑这半球还有另一派:不说人话、直接写代码的规划器(Code as Policies、ProgPrompt——让 LLM 生成调用抓取 API 的程序)。而不管哪一派,一次规划都是开环的:计划赶不上变化,世界随时会捣乱。所以——

组装时刻:让它真的收拾一次房间

大脑、小脑、词表、乘法,全部零件都在你手里了。现在装成整机,跑完那句指令。按 ▶ 启动;等机器人抓着玩具车走到半路时,按「捣乱」把车打掉——看这台机器怎么办:

大脑拆解 → 小脑逐个执行 · 试试在搬运途中捣乱

至此,你已经亲手摸过了这张地图的整副骨架。最后一件事:给你零件箱。

沙盒:组装你自己的 VLA

综述的表 III 列了六十多个小脑,说到底都是三个插槽的排列组合:眼睛、动作头、数据配方。每个插槽挑一个零件,雷达图会按综述各节"优势与局限"的定性结论给你的机器打分。挑战:能不能把「语义泛化」和「反应速度」同时拉到 4 格以上?

挑零件 · 看雷达 · 分数是综述结论的定性归纳,不是实测跑分

先自己试,再回来读这段:单靠三个插槽,「语义」和「速度」怎么都凑不齐——想懂"灭绝的动物"就得背一个几十亿参数的 VLM,而它每步推理的延迟拖垮实时控制;想快就得砍脑容量。这不是你不会配,是综述"挑战"一章点名的真难题(real-time responsiveness)。勾上「双系统」你会看到出路:让大模型 10 Hz 慢想、小模块 120 Hz 快动——你在第六站见过它,代价是系统更复杂。工程的尽头没有满分答卷,只有想清楚了的取舍。

杠精清单:四个你可能正想提的反驳(我们替你先问了)

"一条轨迹有几百帧画面,凭什么说数据差几百倍?"——问得好。按帧算,100 万条轨迹确实有上亿帧;但同一条轨迹里的帧高度雷同,且全部轨迹只对应 100 万句指令。按"独立的(输入,标注)对"算,两个半数量级的落差成立。承认:跨单位的对比只在数量级意义上严谨。

"仿真能无限造数据,饥荒不就解决了?"——sim-to-real gap 挡在中间:渲染失真、物理引擎不准、可变形物体(衣服、液体)尤其难仿。综述 V-B 节的原话是这一落差"成因多面"。仿真是重要粮仓,不是免费午餐。

"离散档位不是有毛病吗?"——有。Octo 指出离散化会诱发"过早闭爪",倒水这类任务也需要比 SE(2) 抓放更多的自由度。所以扩散和流匹配又把连续动作请了回来——你在沙盒里应该已经撞见了这条取舍。

"为什么不端到端一个大模型全包,还分什么大脑小脑?"——综述的诚实回答:分层是当下最实用的架构,但层级多了,复杂度和延迟也涨,频繁重规划会卡顿;把长任务直接端到端翻译成低级信号,被列为值得探索的开放方向,而不是已解决的问题。

凉亭:这张地图还在生长

这篇综述 2024 年 5 月首发时,正文讲完就结束了;到你现在读到的第 8 版,作者们额外维护了一份普查附录:按年数 VLA 论文,2020 年 2 篇,2021 年 2 篇,2022 年 9 篇,2023 年 22 篇,2024 年 63 篇——2025 年,295 篇,参与机构从 1 家涨到 243 家,参考文献编号排过了 780。你手里这张地图的边界,正以每天将近一篇的速度向外推。人形、四足、灵巧手、自动驾驶、手术机器人,全在往上添街区。

但骨架已经很久没变了,而你把骨架的每根骨头都亲手掰过:你对着 2021 年的机器人说过它听不懂的人话,把连续轨迹切成过 2 档和 256 档,看着同一个词元预测器先答题后开夹爪、再凭"灭绝"二字选中恐龙,在线性刻度下找不到机器人数据集的踪影,用一道乘法替 LLM 补上了"够不够得着"的常识,还亲手把玩具车打掉、看失败变成一句话写回大脑。下次再冒出什么 XX-VLA,你只需要问三个你已经会问的问题:它的动作怎么写成词?它的数据从哪个粮仓来?它的大脑和小脑怎么分工?——名字会变,插槽不会。

地图的空白处也如实标出:安全(综述把它列为头号挑战——机器人的失误发生在物理世界里,需要"先评估、后执行",以及借 RLHF 对齐人类偏好,那套对齐术的来历在《驯服野兽:RLHF 与 ChatGPT 的诞生》里);触觉、听觉这些还没接好的感官;以及那口永远差两个半数量级的数据井。这个领域站在你读过的每一篇的肩膀上——Transformer 给了它嘴型,CLIP 给了它眼睛,RLHF 给了它分寸。现在,它在长手。