正在翻开……

三个和尚有水喝吗:AI 组队的科学

Kim, Gu, Park, et al. · MIT / Google / UW 等 · arXiv:2512.08296 · 2025

今年整个行业都在做同一件事:给 AI 加人手。一个 AI 不够聪明?那就派五个,一个当队长,四个当组员——听起来天经地义,人多力量大嘛。这篇论文把这件事放上了秤:同样是组队,有的任务成绩 +80.8%,有的任务 −70%。什么时候是三个臭皮匠,什么时候是三个和尚没水喝?下面的「编排器」「去中心化」「回归系数」你一个都不用记——每个词都会在你手里动起来。你只需要带一样东西来:组过一次小组作业的记忆。

先当一次经理

你手下有一个 AI,任务很简单:在游戏里合成一面石墙。它需要三步——查配方、搬材料、合成。一步接一步,不能颠倒。

一个人干当然可以。但你是经理,经理的本能是:多派几个帮手,稳妥一点——反正 AI 又不要工资,没什么大不了吧?点下面的按钮,给团队加人,一人是单干,多于一人时自动配一位队长来分工:

游戏合成任务(PlanCraft 基准)· 队长制团队 · 数据:论文实测

看到成功率那根柱子了吗?每加一个人,它就矮一截:一个人 56.8%,四个人只剩 28.2%——整整跌掉一半。再看对话轮数:从 5 轮涨到 36 轮。查配方只要一秒,团队却开了三十多轮会来讨论谁去查。你刚才做的事——「保险起见多派几个」——正是现在无数产品每天在生产环境里做的事。

然而,先别急着裁员。换一个任务,同一套团队,剧情会完全反过来。

换个任务,剧情反转

新任务:判断一家公司值不值得投。要看三摊东西——监管新闻、财报文件、运营数据。三摊互不依赖,谁先谁后都行。

还是那套按钮,还是那位队长,再加一次人试试:

财务分析任务(Finance-Agent 基准)· 同一套队长制 · 数据:论文实测

这次成功率一路上扬:34.9% → 63.1%,提升 80.8%。对话轮数照样暴涨,但这回每一轮都花得值——三个人各查一摊,谁也不用等谁,队长最后把三份发现交叉核对。同一个动作「加人」,上一节是灾难,这一节是神药。

这正是这篇论文要回答的问题。作者把 5 种组队方式 × 6 类任务 × 9 个模型,总共 260 种组合,全部拉出来控制变量实测——统一工具、统一提示词、统一思考预算,只让「组队结构」一个东西变。全景是这样的:

六类任务上「组队 vs 单干」的成绩变化区间 · 0 线右边 = 组队赚了,左边 = 组队亏了 · 数据:论文 260 种配置汇总

注意两件事。第一,六条横条横跨 0 线两侧,从 −70% 到 +80.8%——组队不是普遍的好或坏。第二,把 260 种配置平均一下,组队的平均收益是 −0.3%,约等于零,但标准差高达 37.5%。平均数里没有故事,方差里才有:组队是一把双刃剑,而挥向哪边是有规律的。

要找到规律,得先把「组队」这个词拆开——人可以怎么个组法?

组队的五种姿势

论文比较了五种经典结构,翻译成小组作业的语言就是:单干、各干各的(最后拼在一起交)、队长制(一人分工收作业)、圆桌会(人人讨论到吵出共识)、混合制(有队长,组员之间还开小会)。挨个点开看,注意右边两根条:它们是每种结构的「账单」——

点上方标签切换结构 · 左:消息怎么流动 · 右:这种结构的账单(论文实测均值)

看「沟通开销」那根红条:各干各的只多花 58% 的口舌,混合制的聊天记录是干活本身的 5 倍(515%)。再看绿条「每千 token 换来的成功」:单干 67.7,混合制只剩 13.6——同样的预算,效率差五倍。论文还量出了一条规律:对话轮数随人数按幂律爆炸,T = 2.72×(n+0.5)1.724,拟合优度 R²=0.974。沟通不是免费的,而且它涨得比人数快。

然而账单只说了成本。为什么同样的成本,在财报任务上赚回来了,在合成石墙上血亏?答案不在团队身上,在任务身上。

任务的解剖学

先押个注。论文给每类任务算了一个「复杂度」分:合成石墙 0.419,财报分析 0.407——几乎一样难。可组队的结局一个天上一个地下。你觉得关键差别是什么?

先押注 · 然后亲手把 3 个人派进两种结构的任务里

然而可拆性还不是全部。回头看第二节的全景图:办公流程(Workbench)也可以拆,组队却几乎不赚(+5.6% 顶天)。它还差了什么?

0.45 那条线:单干越强,组队越亏

再押一注:如果你的 AI 单干就已经能做对 60% 的任务,这时候加三个帮手,成绩会——

谣言与验证者

因为错误会传染。一个 agent 犯了错——查错一个数、幻觉出一个不存在的文件——这个错不会安静地待在原地,它会顺着消息流传给队友,队友基于它继续干活,错上加错。论文追踪了每条轨迹里错误被引用、被放大的次数。选一种结构,然后亲手往里注入一个错误,看它能传多远:

错误放大系数 = 一个初始错误最终在结论里留下的痕迹倍数 · 单干作为基准 = 1.0 · 数据:论文轨迹级实测

规律很清楚:有没有一个负责核对的人,是 4 倍和 17 倍的区别。队长制(4.4×)里,错误在汇总时会被队长的交叉核对拦下一部分;圆桌会(7.8×)靠互相辩论能纠一些,但共识也可能围着错误达成;「各干各的」(17.2×)最惨——没人对表,每个人的错误原封不动直接汇进最终答案。这就是它在串行任务上 −70% 的死因:既没有并行红利可赚,又没有验证者兜底。没有验证者的团队里,错误不是被平均掉的,是被放大的。

三块拼图到齐了:结构的账单(第三节)、任务的可拆性(第四节)、基线与纠错(第五、六节)。现在把它们拼成一台机器。

组装时刻:你的架构选择器

论文把这些因素拟合成一个预测模型:喂进任务性质和模型能力,吐出五种结构的预期成绩。它在从未见过的留出配置上,87% 的情况能选对最佳架构。下面是这台机器的教学版——三个旋钮就是你刚刚亲手验证过的三个因素。先点三个预设感受一下,再自由拧,完成右下角的三个挑战:

任务可拆性
单干基线35%
工具数量5 个
教学近似模型:只保留论文回归中的显著项 · 论文原模型在留出配置上 87% 选对架构

拧的时候留意几个瞬间:把基线推过 45%,五张卡会一张接一张由绿转红,单干登顶——这就是第五节那条线在工作;把任务掰成一条链,所有团队瞬间垮掉——第四节;把工具拉到 16 个,圆桌会反而爬上第一,因为工具越多、单点越容易漏,多人冗余交叉才兜得住——这是论文三个任务原型里最反直觉的一条。没有最好的架构,只有和任务对上的架构。

所以,三个和尚有水喝吗

有,也没有——现在你可以给出比这诚实得多的答案:挑水这个任务是一条链,不可拆,单干基线又高,所以三个和尚注定没水喝;但如果任务是「找出全村哪口井没干」,三个和尚分头跑,回来交叉对口供,就是 +80.8% 的那一边。寓言只讲了一半,这篇论文把另一半量了出来。

回想你这一路亲手做过的事:你当经理把一个 56.8% 的团队加成了 28.2%,又在下一个任务里把 34.9% 加到了 63.1%;你翻过五种结构的账单,看到聊天记录可以是干活的五倍;你把三个人派进链条,看着两个人空转;你拖着基线撞上 0.45 那条线;你注入的那个错误,在没有验证者的团队里放大了 17 倍。这五个数字拼出的是同一句话:给 agent 加人不是规模化,让结构对齐任务才是。

2020 年,Kaplan 的规模法则告诉行业「模型的能力随算力可预测地增长」,四年后它成了每个实验室的本能。这篇论文想为 agent 时代写下同样的第一页——只是这次的自变量不是算力,是协作结构。第一页往往粗糙(作者自己承认 R² 只有 0.373),但它把「多智能体好不好」从信仰之争变成了可以测量、可以预测、可以查表的工程问题。下一次有人在会上说「我们上多智能体吧」,你可以问三个问题:任务可拆吗?单干基线过 0.45 了吗?谁当验证者?

杠精清单:你可能正想反驳的四件事

「R²=0.373 也好意思叫规律?」——单条 agent 轨迹的噪声确实巨大(同一配置重跑,成绩都会晃)。这个模型的价值不在预测精确分数,而在 87% 的留出配置上选对架构。工程上,选对结构比猜准小数点值钱。

「0.45 会不会只是这 9 个模型的巧合?」——论文在未参与拟合的更强前沿模型上做了验证,五种架构的相对排序保持一致。但作者也明说:这是第一版经验常数,不是物理常数。

「换个更强的模型不就完了?」——恰恰相反,这正是论文的「能力饱和效应」:模型越强,单干基线越高,越快撞上 0.45 线——组队红利随模型变强而缩水。多智能体不是通往更强智能的免费电梯。

「我的框架有记忆、反思、工具缓存,不适用吧?」——论文刻意统一了工具、提示词和思考预算,就是为了把「架构本身」的效应剥出来。你的工程优化会改变常数的大小,但很难翻转方向:结构与任务的对齐,仍是第一位的。