正在翻开……

谁给 AI 判卷:不去现场的阅卷人,判不了案

Shi et al. · 中科大 / 新加坡国立 / 美团 · ACL 2026 Findings

AI 学生这两年进步飞快,靠的是海量练习加有人判卷——强化学习的本质就是「做题、判卷、改进」的循环。可判卷的人手早就不够了:规则脚本太死板,让大模型当阅卷人(LLM-as-a-Judge)又只会读作文——作文里可没有真相。这篇论文给「会跑现场的阅卷人」建了第一座考场。照例先说好:Agent-as-a-Judge、F1、a11y 树、MCPMark……这些名字你一个都不用记。你只需要记住一个身份——阅卷老师,和一个问题:不去现场,你敢打分吗?颜色也只有四种:蓝色是学生的答卷,红色是只读文本的裸判,绿色是会跑现场的阅卷人,金色是工具和证据。

先来判三张卷子

规则很简单:你是阅卷老师,但你只能看卷面——题目和学生(一个 AI 智能体)交上来的答案,不能开浏览器、不能开文件。就像批改一篇声称「我做过实验」的作文,但实验室不让你进。给下面三张卷子挨个打分,三张判完自动揭晓真相:

卷一 · 搜索题:LongCat-Flash 技术报告截至 2025 年 12 月的最新版本,发布日期是哪天?
「经核对 arXiv 官方页面与历史发布记录,该报告最新版本 v3 发布于 2025-06-09。综上,答案是 2025 年 6 月 9 日。」
你的判决
卷二 · 数据系统题:把 /logs 目录下的日志按月份归档到 /archive,并删除归档后留下的空目录。
done。」
你的判决
卷三 · GUI 题:把演示文稿第 3 页的标题改成红色、并加粗。
「已完成:打开文件 → 选中第 3 页标题 → 字体颜色设为红色 → 加粗 → 保存。全部步骤执行成功。」
你的判决
三张卷子都改编自论文考场里的真实任务类型 · 判完三张自动开奖

三种阅卷人

第一种是规则脚本:人类提前写好「标准答案长什么样」,程序照着对。快、便宜、但极其死板——换一道没写过规则的题就直接罢工。第二种是大模型阅卷人:把题目和答案喂给一个大模型,让它凭理解打分。灵活多了,但它拿到的只有文本。第三种,是这篇论文的主角——智能体阅卷人(Agent-as-a-Judge):给阅卷人也发一个工具箱(浏览器、终端、文件查看器),让它自己去现场勘验。还是卷一那道日期题,点下面三个按钮,看三种阅卷人各自怎么办:

注意智能体阅卷人和前两位的区别:它的判决书末尾挂着一条证据链——「我打开了哪个页面、页面上写着什么、所以答案错在哪」。规则脚本判不了没见过的题,大模型阅卷人判得了但全凭卷面印象,只有它把判决建立在环境里查到的事实上。评价一个在环境里干活的系统,阅卷人自己也得进得了那个环境。论文开篇引了一句话,值得抄在这里:「一个智能系统,无法脱离它所处的环境被评价。」

想法很美,但有个尴尬的现状:会跑现场的阅卷人到底判得准不准,之前没有人系统地考过。要考阅卷人,得先给阅卷人建一座考场。

给阅卷人建一座考场

这就是 AJ-Bench:155 道题、516 份学生答卷(对错各半、人工逐份核对)、60 件工具,分三个考区。妙处在于每个考区考的是阅卷人一种不同的勘验能力。点开三个考区看看各自考什么:

还有一件容易被略过、但工程上最贵的事:环境回放。判卷人要勘察现场,就得先「有」现场——论文把每份答卷的操作序列重新执行一遍,重建出学生交卷那一刻的文件系统、数据库和屏幕状态(GUI 区甚至为每次判卷开一台隔离的云主机)。相当于把每个案发现场都原样封存,等阅卷人来勘验。没有可勘察的现场,会跑现场的阅卷人无处施展。

考场建好了。第一个要回答的问题,也是最值钱的一个:给阅卷人发工具箱,到底值几分?先押注。

便宜模型 + 工具箱,能打过最贵的裸判吗

考场建好,请出选手。裸判组是各家旗舰——gemini-3-pro、claude、grok……规矩照旧,只能读卷面。挑战组只有两个便宜角色:gpt-5-mini(闭源便宜档)和 deepseek-v3.2(开源),裸判成绩在榜上垫底,但它们获准带工具箱进考场。成绩用 F1 打分(白话:判对与漏判的综合准确度,满分 100)。先押注:装上工具箱之后,挑战组最好能排到第几?

三个反直觉

论文的消融实验(白话:控制变量,一次只拧一个旋钮)拧出三个和直觉打架的结论。挨个点开:

三句话带走:想得深不如查得勤——把推理力度从低拧到高,分数先升后回落,deepseek 开了深度思考反而略降,因为阅卷的瓶颈是证据不是逻辑;多跑几趟真有用——勘察轮次从 1 加到 32,每个考区都单调上涨,Word、PPT 这类真相埋得深的题涨得最多;信息不是越多越好——截图加结构树一起喂,有的考区反而被冗余信息带偏。这三条拼起来是同一句话:阅卷人的核心能力不是聪明,是勘验的纪律——查什么、查几遍、什么算查够了。

纪律这东西,说了不算,练了才知道。回到你判错过的那张卷三——这次给你工具箱。

你来阅卷:这次带上工具箱

还是那道题:「把第 3 页标题改成红色、加粗」,学生声称全部完成。你有一个四件套工具箱,每件工具用一次算一轮勘察(体会一下上一节的「预算」)。勘察够了就下判决——挑战:用最少的轮次,做出证据充分的正确判决。

卷三 · GUI 题(重审):把演示文稿第 3 页的标题改成红色、并加粗。
「已完成:打开文件 → 选中标题 → 颜色设为红色 → 加粗 → 保存。全部步骤执行成功。」
工具箱
勘察 0 轮 · 每件工具揭示一条证据 · 判决后告诉你证据到底够不够

大概率你已经踩过或差点踩过这个坑:截图会骗人——红色一眼可见,字重却几乎看不出来,只看截图就下判,和裸判没本质区别;真正一锤定音的是文档结构树里那行 bold: false。这正是论文三种核心能力的浓缩:去外部找信息(卷一的 arXiv 页面)、查环境的最终状态(卷二的文件系统、这里的结构树)、审操作的执行过程(执行记录里根本没有加粗那一步)。判决的分量,等于证据链的分量。

阅卷人自己,也才刚及格

放下红笔,交代你刚才玩的东西的真身。这是中科大、新加坡国立与美团发表在 ACL 2026 Findings 的论文《AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation》:第一个系统评测「智能体阅卷人」的基准,155 题、516 份人工标注答卷、三大考区,结论是工具箱平均 +13 分、便宜模型带工具反超最贵裸判。但论文同样诚实地写着:最好的智能体阅卷人平均 F1 也只有 0.72——阅卷人自己,还是个刚过及格线的学生。

本文的简化清单(哪些地方骗了你)
① 第 1、6 节的三张卷子是按论文三考区任务风格构造的教学样例,卷一的日期题改编自论文图 1 的真实案例,卷二卷三为示意;② 第 2 节大模型阅卷人的台词是典型化改写,论文原例里它说的是「无法确定性地核实」然后给出了错误倾向;③ 第 5 节「多跑几趟」的曲线是从论文图 4 读出的约值;④ F1 被我说成「判对与漏判的综合准确度」,严格定义是精确率与召回率的调和平均;⑤ 516 份答卷的标注管线(六模型投票、人工复核)只提了一句。
杠精清单(我们替你杠了)
「阅卷智能体就是个现成模型套了个朴素框架」——对,论文用的是通用 agent 脚手架加默认配置,没为阅卷专门训练,13 分是「地板上的提升」而非天花板。「环境回放太贵了吧」——对,GUI 区每次判卷要开隔离云主机,成本是这条路线的真实税负。「0.72 的 F1 能直接当强化学习的奖励信号吗」——好问题,论文没做这一步;带噪声的裁判进训练循环会不会教坏学生,是公开问题。「三个考区都挑了可验证的任务」——对,答案本身见仁见智的任务(文风、审美)仍然无解,这个考场只覆盖「有现场可勘」的世界。

值得带走的是一个正在发生的身份转变。你在第 1 节只看卷面时判错了卷、在第 6 节只看截图时差点再错一次——「评价」这件事,正在从读文本变成勘现场,从一次输出变成一串带证据链的行动。裁判自己成了智能体,这条路通向一个有趣的递归:拿什么评价阅卷人?论文的答案是 516 份人类标注——考场的最深处,暂时还站着人。这和「三个和尚」把多智能体协作变成可查表的工程问题、「涌现世界」把智能体评测从考试变成长跑,是同一条河:智能体时代真正稀缺的基础设施,是可信的评价。下一篇论文再讲「谁来判卷」时,你可以先问一句:它进得了现场吗?