正在翻开……

VistaVLA:眼里有照片,心里没地图

Liu et al. · 南洋理工 EmPACT Lab × A*STAR · 2026 · arXiv:2607.12356

你闭着眼,也能伸手拿到桌上那只杯子——因为你心里有一张桌面的立体地图。而今天的多数机械臂大脑(就是总图里讲过的 VLA)眼里只有照片:把物体朝它挪十厘米,照片几乎没变,它就照旧往老地方伸手。这篇论文要给机器人补上那张心里的图——材料是十万颗会发光的小球。照例先说好:3DGS、SigLIP、Morton 码……这些名字你一个都不用记。你只需要盯住一张桌子:一块海绵、一只杯子、一只碗,它们会从头用到尾。

先来当一回只看照片的机器人

规则很简单:你是机械臂的大脑,但你只能看到一张正面照片。任务是那句经典指令——「把杯子后面的海绵拿起来」。训练时海绵一直摆在老位置,你已经练得很熟了。现在有人动了桌子。拖动滑块把海绵朝你挪近或推远,然后点「照老经验伸手」。

训练时的位置
左 = 你(机器人)看到的正面照片 · 海绵挪远挪近时,注意照片变了多少

心里的图,先有形状:十万颗小球

造立体地图的材料,这两年图形学给了个漂亮答案:3D 高斯泼溅(3D Gaussian Splatting,白话:把场景拆成几万颗半透明的彩色小球,每颗记住自己的位置、大小、颜色)。几张不同角度的照片进去,一团小球云出来——从此你想从哪个角度看,就把小球们朝那个方向重新一撒。VistaVLA 用两台固定相机的照片实时搭这团云。拖动滑块,绕着桌子转一圈:

正面 0°
左上角两张小图 = 仅有的两张输入照片(视角焊死)· 大图 = 从小球云里随意渲染的新视角

注意你刚才做的事:输入只有左上角那两张视角焊死的照片,可大图里你转到了照片从没拍过的角度——杯子和海绵的前后关系、遮挡边缘,全都对。照片是一次性的观察,小球云是可以反复查询的世界。这正是「地图」和「照片」的分水岭:地图不怕换视角。还有一个容易漏看的细节:这团云不是提前扫描好的——机器人每做一步动作,都用最新的照片当场重搭一次,所以桌上东西被挪动了,地图跟着变,不存在「拿着旧地图找新桌子」的问题。

然而现在这团云只是个哑巴雕塑:它知道哪里有东西,不知道那是什么。指令里说的「海绵」「杯子」,在小球的世界里还查无此人。

再给每颗小球发一个词

怎么让小球「认字」?VistaVLA 找了两位现成的老师:一位看图懂语言(SigLIP2,CLIP 的后辈),一位看图懂结构(DINOv2)。两位老师看每张照片,给每个像素写下一份 2176 维的「这是什么」笔记——太厚了,先用一个小压缩器压到 128 维。然后是关键一步:渲染的时候,每颗小球把自己的 128 维笔记「泼」到它在照片里占的那些像素上,泼出来的结果必须和老师的笔记对得上。多张照片一起对账,每颗小球最后攒下的,就是它在所有角度下的公共语义。点下面的词,看哪些小球应声亮起:

灰色 = 只有几何的哑巴小球 · 点一个词 → 带那个语义的小球亮起(换视角也照样亮,语义长在 3D 上)

亮起的瞬间,注意两件事。第一,词是开放的——老师是语言对齐的大模型,所以不止「海绵」「杯子」这几个预设,任何能说出口的东西都能查(论文的说法:开放词汇的语义落在了 3D 空间里)。第二,语义跟着小球走而不是跟着像素走——你在上一节转过视角,同一颗小球换个角度还是那颗海绵。几何管「在哪」,语义管「是什么」,两者钉在同一颗球上,认知地图才算成形。

然而好事变成了坏事:这张地图有十万颗球,每颗带 128 个数。VLA 的注意力窗口是按 token 收费的——十万个 token 塞进去,机械臂算完一步,菜都凉了。

十万颗球,挤成 64 个字

论文给这道工序起名 Merge-then-Query:先合并,再提炼。像整理一屋子杂物:先把同类的捆成捆(合并),再写一页清单(提炼)。点「下一步」,亲眼看十万变六十四:

第 0 步:完整小球云,约 10 万颗 · 每颗带位置 + 128 维语义

组装时刻:把地图塞进一个 0.5B 的小脑袋

零件齐了,看它们咬合。特意留意这台 VLA 的块头:底座是 VLA-Adapter,只有 5 亿参数——比你在 π0 篇见过的 30 亿级选手小一个数量级。它凭什么打?凭喂进去的东西不一样。点每个环节,看数据怎么流:

点图中任一环节看说明 · 每个控制步都重跑一遍:拍照 → 搭云 → 压缩 → 出动作,预测 K 步、执行 4 步就重来

进入模型的是四路 token 排成一列:图像 token(手腕相机的照片,管「此刻看见什么」)、指令 token(那句「把杯子后面的海绵放进碗里」)、64 个地图 token(管「桌面的立体布局」)、动作查询 token(负责把前面的一切翻译成手臂的连续动作)。排队顺序有讲究:地图排在指令之后,等于先读题再看图;动作排在最后,能回头看所有人。预测出的 K 步动作只执行前 4 步就重新拍照重规划——和你在 GR00T 篇拧过的「动作块别太长」是同一个道理。

然而,架构自洽不等于真的有用。多装两台相机、多喂几百个图像 token,会不会效果一样?该验货了。

验货:三个反直觉的数字

验货用的是真机:七个桌面任务(放海绵、叠盒子、叠碗、扔垃圾并合盖、转魔杖接杯……),每个测十次。对手里最扎眼的是 π0.5——预训练过海量机器人数据的 30 亿参数通才。开赛前,先押两注:

第一注:给基线直接喂深度图(每个像素多远都告诉它),成绩会——
第二注:仿真里把场景里的物品调换位置(LIBERO-Pro-Swap),预训练过的大牌们(OpenVLA、π0)能拿几分?
两注都押完才开牌 · 数据取自论文图 4、表 1、表 2
数字控的折叠区:真机、扰动、仿真三张成绩单
考场项目基线 VLA-Adapter+深度图π0.5 (3B)VistaVLA (0.5B)
真机 ×7 任务平均成功率—(基准)≈基线低于 Vista+22.8 分
深度扰动放海绵(挪远近)6/106/107/109/10
位置扰动整理海绵(挪左右)0/100/100/103/10(全场唯一非零)
LIBERO 标准四套平均94.1%94.2%(有预训练)96.05%(无预训练最佳)
LIBERO-Pro-Swap换位零样本1.7%0.0%12.2%

其余消融:压缩方式换成 FPS 抽稀 → 放海绵 0/10;查询 token 数 16/32/64/128/256 → 64 最佳、256 最差;相机/token 消融见 §6 正文。真机平台 Agile-Piper,每任务 10 次试验、初始位姿复位。

但注意 3/10 这个数字——位置扰动下它是全场唯一活口,可十次也只成三次。地图有了,还远谈不上牢靠。最后一节,这张桌子交给你,亲手去找它的边界。

沙盒:摆桌子为难它

俯视视角,海绵归你摆。两台机器人等着你发号施令:只看照片的基线,和心里有图的 VistaVLA。成功率就是论文真机实测的那几档。挑战:① 先在训练位置试两把,确认两台都行;② 把海绵挪远,看谁先露馅;③ 把海绵挪到侧面去——找到那个连 VistaVLA 也只有三成把握的死角。

训练位置
训练位置
档位对应论文实测:训练位 → 两边都稳 · 深度偏移 → 6/10 vs 9/10 · 位置偏移 → 0/10 vs 3/10

玩几把你就会摸到那条边界:深度方向上 VistaVLA 相当稳(小球云本来就是立体的,远近骗不了它);平面大挪移它也常失手——三成把握,只是比零强。论文自己把这行字写进了结论:大的位置扰动仍然是难题。认知地图解决了「看见立体」,还没解决「在陌生布局里重新规划」——那是下一篇论文的事。

凉亭:从照片到地图

学术锚点:本文来自南洋理工大学 EmPACT Lab 与新加坡 A*STAR I2R,2026 年 7 月(arXiv:2607.12356)。骨架是「语义高斯场 + Merge-then-Query 压缩 + VLA-Adapter 0.5B 底座」。本文做了不少简化:高斯泼溅的数学(协方差、透明度合成)只给了白话;两阶段训练里先几何后语义的课程、LoRA 微调、Morton 码的位交织细节都收进了旁白;图里的小球云是教学示意,颗数远少于真实的十万。

杠精角落:四条最硬的反驳,论文自己怎么接

「实时重建一团高斯,机械臂等得起吗?」——论文的答法是工程化:前馈式重建(不做逐场景优化)+ 99% 的 token 压缩 + 每预测 K 步只执行 4 步。但它没有给出端到端延时的正面数字,这确实是软肋。

「依赖标定好的多相机,出了实验室怎么办?」——论文自己承认:搭高斯场需要已知位姿的观察,工作台固定、相机标定是前提。放宽标定要求被列为未来工作。

「位置扰动 3/10 也好意思叫赢?」——对照组全是 0/10。从不可能到三成是质变,从三成到能用是量变——论文只声称了前者。

「只有桌面小任务,和 SONIC 那种全身大活儿比呢?」——不同赛道:这篇解决的是操作里的空间感,评测全在固定平台桌面;全身移动操作里这张地图怎么用,还没人验证。

回想你这一路亲手做过的事:你只看正面照片伸过手,抓过一把空气,然后从侧面看见深度是怎么被压扁的;你绕着一团小球云转了一圈,发现地图不怕换视角;你点过「海绵」,看语义亮在 3D 空间里而不是像素上;你按过「随机抽稀」,眼看最小的主角被抽没,才明白合并要认语义;你押过深度图那一注——多数人押「大涨」,而正确答案是几乎不涨;最后你在沙盒里亲手找到了它三成把握的死角。

这条线索值得记住:机器人操作的短板正在从「动作不够灵巧」转向「空间理解不够」。π0 篇解决了手怎么动得流畅,SONIC 篇解决了身体怎么走得稳,这一篇补的是眼睛和心之间那一段——看见的是照片,行动靠的是地图。下一站:回总图看这颗棋子落在「3D 输入」那一格;或者去 RT-2 篇,看看这一切开始的地方。