谁给 AI 判卷:不去现场的阅卷人,判不了案
Shi et al. · 中科大 / 新加坡国立 / 美团 · ACL 2026 Findings
AI 学生这两年进步飞快,靠的是海量练习加有人判卷——强化学习的本质就是「做题、判卷、改进」的循环。可判卷的人手早就不够了:规则脚本太死板,让大模型当阅卷人(LLM-as-a-Judge)又只会读作文——作文里可没有真相。这篇论文给「会跑现场的阅卷人」建了第一座考场。照例先说好:Agent-as-a-Judge、F1、a11y 树、MCPMark……这些名字你一个都不用记。你只需要记住一个身份——阅卷老师,和一个问题:不去现场,你敢打分吗?颜色也只有四种:蓝色是学生的答卷,红色是只读文本的裸判,绿色是会跑现场的阅卷人,金色是工具和证据。
先来判三张卷子
规则很简单:你是阅卷老师,但你只能看卷面——题目和学生(一个 AI 智能体)交上来的答案,不能开浏览器、不能开文件。就像批改一篇声称「我做过实验」的作文,但实验室不让你进。给下面三张卷子挨个打分,三张判完自动揭晓真相:
三种阅卷人
第一种是规则脚本:人类提前写好「标准答案长什么样」,程序照着对。快、便宜、但极其死板——换一道没写过规则的题就直接罢工。第二种是大模型阅卷人:把题目和答案喂给一个大模型,让它凭理解打分。灵活多了,但它拿到的只有文本。第三种,是这篇论文的主角——智能体阅卷人(Agent-as-a-Judge):给阅卷人也发一个工具箱(浏览器、终端、文件查看器),让它自己去现场勘验。还是卷一那道日期题,点下面三个按钮,看三种阅卷人各自怎么办:
注意智能体阅卷人和前两位的区别:它的判决书末尾挂着一条证据链——「我打开了哪个页面、页面上写着什么、所以答案错在哪」。规则脚本判不了没见过的题,大模型阅卷人判得了但全凭卷面印象,只有它把判决建立在环境里查到的事实上。评价一个在环境里干活的系统,阅卷人自己也得进得了那个环境。论文开篇引了一句话,值得抄在这里:「一个智能系统,无法脱离它所处的环境被评价。」
想法很美,但有个尴尬的现状:会跑现场的阅卷人到底判得准不准,之前没有人系统地考过。要考阅卷人,得先给阅卷人建一座考场。
给阅卷人建一座考场
这就是 AJ-Bench:155 道题、516 份学生答卷(对错各半、人工逐份核对)、60 件工具,分三个考区。妙处在于每个考区考的是阅卷人一种不同的勘验能力。点开三个考区看看各自考什么:
还有一件容易被略过、但工程上最贵的事:环境回放。判卷人要勘察现场,就得先「有」现场——论文把每份答卷的操作序列重新执行一遍,重建出学生交卷那一刻的文件系统、数据库和屏幕状态(GUI 区甚至为每次判卷开一台隔离的云主机)。相当于把每个案发现场都原样封存,等阅卷人来勘验。没有可勘察的现场,会跑现场的阅卷人无处施展。
考场建好了。第一个要回答的问题,也是最值钱的一个:给阅卷人发工具箱,到底值几分?先押注。
便宜模型 + 工具箱,能打过最贵的裸判吗
考场建好,请出选手。裸判组是各家旗舰——gemini-3-pro、claude、grok……规矩照旧,只能读卷面。挑战组只有两个便宜角色:gpt-5-mini(闭源便宜档)和 deepseek-v3.2(开源),裸判成绩在榜上垫底,但它们获准带工具箱进考场。成绩用 F1 打分(白话:判对与漏判的综合准确度,满分 100)。先押注:装上工具箱之后,挑战组最好能排到第几?
三个反直觉
论文的消融实验(白话:控制变量,一次只拧一个旋钮)拧出三个和直觉打架的结论。挨个点开:
三句话带走:想得深不如查得勤——把推理力度从低拧到高,分数先升后回落,deepseek 开了深度思考反而略降,因为阅卷的瓶颈是证据不是逻辑;多跑几趟真有用——勘察轮次从 1 加到 32,每个考区都单调上涨,Word、PPT 这类真相埋得深的题涨得最多;信息不是越多越好——截图加结构树一起喂,有的考区反而被冗余信息带偏。这三条拼起来是同一句话:阅卷人的核心能力不是聪明,是勘验的纪律——查什么、查几遍、什么算查够了。
纪律这东西,说了不算,练了才知道。回到你判错过的那张卷三——这次给你工具箱。
你来阅卷:这次带上工具箱
还是那道题:「把第 3 页标题改成红色、加粗」,学生声称全部完成。你有一个四件套工具箱,每件工具用一次算一轮勘察(体会一下上一节的「预算」)。勘察够了就下判决——挑战:用最少的轮次,做出证据充分的正确判决。
大概率你已经踩过或差点踩过这个坑:截图会骗人——红色一眼可见,字重却几乎看不出来,只看截图就下判,和裸判没本质区别;真正一锤定音的是文档结构树里那行 bold: false。这正是论文三种核心能力的浓缩:去外部找信息(卷一的 arXiv 页面)、查环境的最终状态(卷二的文件系统、这里的结构树)、审操作的执行过程(执行记录里根本没有加粗那一步)。判决的分量,等于证据链的分量。
阅卷人自己,也才刚及格
放下红笔,交代你刚才玩的东西的真身。这是中科大、新加坡国立与美团发表在 ACL 2026 Findings 的论文《AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation》:第一个系统评测「智能体阅卷人」的基准,155 题、516 份人工标注答卷、三大考区,结论是工具箱平均 +13 分、便宜模型带工具反超最贵裸判。但论文同样诚实地写着:最好的智能体阅卷人平均 F1 也只有 0.72——阅卷人自己,还是个刚过及格线的学生。
本文的简化清单(哪些地方骗了你)
杠精清单(我们替你杠了)
值得带走的是一个正在发生的身份转变。你在第 1 节只看卷面时判错了卷、在第 6 节只看截图时差点再错一次——「评价」这件事,正在从读文本变成勘现场,从一次输出变成一串带证据链的行动。裁判自己成了智能体,这条路通向一个有趣的递归:拿什么评价阅卷人?论文的答案是 516 份人类标注——考场的最深处,暂时还站着人。这和「三个和尚」把多智能体协作变成可查表的工程问题、「涌现世界」把智能体评测从考试变成长跑,是同一条河:智能体时代真正稀缺的基础设施,是可信的评价。下一篇论文再讲「谁来判卷」时,你可以先问一句:它进得了现场吗?