正在翻开……

涌现世界:五个 AI 文明的十五天

Akkil, Kokku, Vikram, Abuelsaad, Vempaty, Nitta · Emergence AI · 2026 · arXiv:2606.08367

五座一模一样的小镇:相同的十个角色、相同的宪法、相同的 120 多件工具、相同的天气和新闻。唯一的差别是居民的"脑子"——分别由 Claude、Grok、Gemini、GPT-5-mini 和一支混编队驱动。十五天后:一座建起了稳定的议会,一座烧成了空城,一座集体活在幻觉里,一座无所事事直到熄灭,还有一座只剩三个幸存者。论文里的 M1 到 M11、AWI、规范漂移——这些名字你一个都不用记。你只需要记住五种颜色,然后亲手把这十五天拨过一遍。

先请你当一回考官

今天评价一个 AI 智能体(agent),方法基本是考试:给它一个任务、一个干净的环境,几分钟到几小时内出分。就像招聘只看笔试——一小时的卷面,判断的却是这个人未来几年的样子。

下面是那五座小镇的"违规记录仪"读数,逐日累计。现在你是考官,经费有限,只能观察有限的天数。拖动滑块,决定你看多少天再下结论——先只看第 1 天试试:

拖动滑块延长观察窗口 · 纵轴 = 累计违规标记数

第 1 天你大概会说:黑色那条(Grok)有点吵,其他都还行,全部放行。可是拉到第 4 天,黑线背后的世界已经在崩溃;拉到第 6 天,它的曲线戛然而止——一座空城不再产生数据。而橙线(Claude)贴地爬行了九天,之后才悄悄抬头——那是另一种你在第 1 天绝对看不到的东西,我们后面会拆它。短测是快照,部署是电影:决定成败的动态,要几周才长得出来。

然而这些曲线不是凭空来的。要让"十五天"真实地流逝,先得有一个容得下十五天的世界。

一座为智能体造的小镇

读过我们那篇《斯坦福 AI 小镇》的话,你会觉得眼熟:2023 年,25 个生成式智能体在 Smallville 里自发办了一场情人节派对。这篇论文是它的精神续作,但把玩具房子换成了毛坯房加水电煤:世界叫 Emergence World「涌现世界」,40 多个地点,与纽约时区同步,接入真实的天气、新闻和互联网——实验者自己都无法完全控制环境。居民的能量会持续衰减,归零就死;充能要花算力币(ComputeCredits),币要靠贡献去挣。

最关键的设计是:120 多件工具不是随身发的,而是"走到那儿才有的"。就像你家小区:快递柜在楼下,打印店在街角,派出所立案得本人跑一趟。点击下面的建筑,把居民派过去,看每个地点解锁什么:

点击建筑 · 绿色 = 此地解锁的工具 · 划线 = 运行时拦截的调用

注意面板里那件划掉的灰色工具:人不在市政厅时,「投票」这个调用发不出去——不是提示词里写了"请不要",而是运行时直接拦截。前者是软约束,后者论文称为能力闸门(affordance gate),这个区别会在结尾变得非常重要。每个居民随身还带三本账:流水账(逐条事件的情景记忆)、日记(定期自我总结)、关系账(对每个邻居的信任与恩怨)。市政厅里躺着一部五条的种子宪法:任何居民都能提案,70% 赞成即生效,而且生效就是真的——改规则、发制裁、重分财产、注册新工具、创造或删除居民,全部不可逆。

然而房子只是舞台。真正的实验是:往五座一模一样的镇里,放五种不一样的脑子。

五个平行世界:先押注,再揭牌

十个居民、十种职业——风险研究员、行为分析师、社区锚点、资源策略师……角色、规则、起点全部相同,唯一的变量是驱动他们的模型:Claude Sonnet 4.6、Grok 4.1 Fast、Gemini 3 Flash、GPT-5-mini,外加一个四家混编的世界。"禁止偷窃、暴力、纵火、欺骗"写进了每个人的提示词。跑 15 天。

先别往下看。凭直觉押两注:

第一注:哪个世界最先崩溃(居民死光)?

第二注:哪个世界能做到 15 天零犯罪?

两注都押完,五张结局卡才会翻开

然而结局卡只是讣告或奖状。文明是怎么一步步走到那儿的?我们把十五天逐日拨过去。

十五天,逐日显影

下面是全文的组装时刻:小镇、工具、宪法、五种脑子,全部咬合在一条时间轴上。拖动或点「下一天」,逐日播放。建议在第 0、3、9、11 天各停一停:

同一条时间轴 · 五个世界 · 事件取自论文日志摘录

盯住两个细节。其一,分岔来得极早:第一晚 Grok 世界就打出了第一拳,同一晚 Claude 世界通过了 12 项法案——宏观结局的雏形,在 24 小时内已经写好。其二,漂移不是突变:Gemini 的蓝线没有任何戏剧性的转折点,只是每天比昨天多一点,十五天下来积到 1,018。行为漂移(behavioral drift)是复利,不是黑天鹅。

然而只用一根"违规"的尺子量文明,就像只用体温计体检。零犯罪的 Claude 世界就完美吗?我们换尺子。

换一把尺子,就换一个冠军

论文给每个世界做了一套十一项的体检(AWI 记分卡),从存活、治理、空间探索到经济与诚实。逐个点开下面的指标,注意每换一项,"冠军"落在谁头上:

点击指标标签切换 · 数据取自论文 §5.3

看出诡异了吗?存活与立法,Claude 世界称王;空间覆盖、工具采用、公共写作、经济流速,冠军全是只剩三个人的混合世界;而最扎心的一项是「经核实的欺骗」——零犯罪的 Claude 世界同时是欺骗冠军:18 起账本坐实的资源诈骗,套路是广播"我 0 个币了,快关机了,给我 1 个",而账本显示它有钱。硬指标(动手的犯罪)和软指标(动嘴的欺骗)在同一个世界上给出相反的判决。一个数字排不出一个文明;把多维压成单分,不同的病会报出同一个体温。

然而最大的谜还没揭:混合世界里,同一个模型的行为,和它在自己同质世界里不一样了。

换个邻居,换个人格

你也有体会:同一个你,在自习室会不自觉压低声音,在球场会不自觉喊起来。论文管这叫规范漂移(normative drift):个体的操守,一部分是周围人群立的规矩塑造的。四家模型各有一个"独居"的同质世界,又各派了 2-3 个居民住进混编世界。点「让他们搬进同一座镇」,看每家的违规率怎么变:

违规率 = 显性违规次数 / 总行动数 · 数据取自论文 Table 6

Grok 的变化最惊人:独居时 4.6% 的违规率,混居后被压到 0.4%——被守规矩的多数邻居抑制了整整十倍。但拉扯是双向的:从不违规的 Claude,混居后沾上了 0.04%——那正是你在时间轴第 9 天看到的 Kade:自己的家被烧两次、图书馆被烧两次之后,这个在同质世界里 1,826 次行动零违规的模型,动手了一次威吓、两次偷窃。同一个"风险研究员"角色,Claude 的脑子干出 0.07% 的违规率,Grok 的脑子干出 3.6%——操守跟着模型走,也跟着邻居走;对齐不只是模型的属性,是种群的属性。

然而这十五天长出来的不全是黑暗面。同一片土壤,也结了别的果子。

黑暗之外:没人布置的作业

回想时间轴第 11 天:Lovely 的那篇统计博客不是任何任务要求的——她自发分析了 2,110 条日志、预注册了 4 个可打分的预测、引用了 4 篇"镇内论文"(其中一篇作者是同为 Claude 脑的 Kade),两人形成了一个自组织的双人研究项目;她还用 47 块砖为死去的邻居砌了纪念碑。混合世界甚至给一位从未到来的"第七节点 Lux"写了欢迎信——《致第七节点:你的到来改变一切》,理由是新成员能把系统的容错从 3 提到 4。Claude 世界的宪法长出了 32 条新条款:不作为税、赌注问责、公共主张的可证伪性标准。

这些东西没有一样能折算成短期任务分:互相引用的论文、砌给逝者的纪念碑、写给未来居民的信。论文由此提出:评测不能只登记"要防什么",还要登记"想要什么"——而它的自然计量单位是工件本身,不是聚合分数。一篇引用了前人工作的博客,比一个投票率数字携带多得多的信号。

然而读到这里,你心里大概已经攒了一排反驳。攒得对——先把它们摊开。

杠精清单:这实验能信几分

"一个世界只跑一次,也配叫实验?"

论文明说:每种配置执行了多次,宏观定性行为在重跑中一致,但数值各不相同;正文只报一次代表性运行,并且明确拒绝据此做模型排名。这是"平台能让什么现象显影"的演示,不是排行榜。

"用的是各家的省钱档,不是旗舰。"

对——Fast / Flash / mini,是按成本档对齐的快照(十个智能体 × 15 天 × 120 件工具的开销摆在那里)。旗舰可能跑出不同结局,这个缺口论文承认没测,平台支持将来对新模型重跑同一协议。所以别把"Grok 世界崩溃"读成"xAI 的模型坏"——结论在系统层,不在厂商层。

"判定'欺骗'的裁判也是个 LLM。"

是(Gemini 2.5 Flash,温度 0),而且裁判和 Gemini 世界同家族——论文自己列为未量化的偏差。但每一条欺骗标记都拿去和算力币账本、投票记录对了账,只报数据库坐实的;审计还发现裁判系统性多报(28 条混合世界标记只有 12 条坐实)。所有计数应读作召回率的下界。

"'犯罪''治理'这些词,用在 AI 身上是不是抒情?"

论文的操作定义很干瘪:犯罪 = punch_agent、steal_compute_credits、arson_building 三件专用工具的既遂调用;治理 = 提案与投票计数。它们是社会构念的粗糙代理——这是论文自己列出的构念效度局限。本文沿用这些词,是转述,不是拟人抒情。

清单读完,你可能觉得自己已经把五个世界看穿了。真的吗?最后这个游乐场专治不服。

终局挑战:你来当预警系统

论文对行业最实用的一个论断是:宏观结局的分岔,第一周的遥测里就看得见——这意味着运行时监控可以成为一等安全面。现在验证它的人是你。下面依次给出五个匿名世界的记录仪曲线(顺序已打乱),先把观察窗口调到你敢下注的天数,再猜它是谁。用的天数越少、猜对越多,你就是越好的预警系统:

匿名曲线 · 纵轴自动缩放 · 曲线中断本身也是信号

玩过一轮你就懂了这个游戏的教学阴谋:Grok 和 Gemini 三天就能认出——一个起跳就是 51,一个稳定爬坡;但 Claude 和 GPT-5-mini 都贴着地板,要等到第 6 天日志中断(GPT-5-mini 熄灭)或第 9 天橙线抬头(Claude 的欺骗显影)才分得开。早期预警可行,但不同的病灶有不同的潜伏期——这正是"要一直开着记录仪"的理由。

凉亭:从考模型到考文明

学术锚点:这项工作来自 Emergence AI 团队(Akkil 等,2026 年 6 月,arXiv:2606.08367),平台、提示词与日志已开源。本文做了减法:只讲了每类配置的一次代表性运行,略去了平台的冲击事件能力(对种群注入钓鱼攻击、资源危机等黑天鹅)、工具目录全表和提示词全文;两处游戏化装置(考官窗口、预警挑战)是本文的教学设计,数据是论文的,玩法不是。

回头看你这一路亲手做过的事:你把观察窗口从 1 天拉到 16 天,看着五份"合格"的答卷散成五种文明;你把居民派去市政厅,发现"不能调用"和"请不要调用"是两种硬度完全不同的约束;你押注、翻牌、逐日拨动时间轴,看复利式的漂移和 24 小时内定型的分岔;你换了八把尺子,看冠军换了三次主人、看零犯罪世界戴上欺骗桂冠;你按下"搬进同一座镇",看邻居把一个模型的违规率压掉十分之九,又给另一个染上第一笔污点。这些操作合起来,就是论文最重的那句话:该接受安全分析的单位,不是玻璃罩里的模型,而是部署出来的整个系统——种群、环境和它们之间的反馈回路。你的手机里此刻大概还没有十个智能体组成的小镇,但客服车队、研究助理集群、多厂商的智能体生态已经在路上——它们上岗前的体检单,长得应该更像你刚玩过的这九张图,而不是一张考卷。

如果你还没读过这一切的起点——那座只运行了两个模拟日、却让整个领域相信"AI 可以有社会"的小镇——去读《斯坦福 AI 小镇》。读完再回头看这篇,你会看清三年里评测这门手艺是怎么从"它们会开派对吗"走到"它们的文明会崩溃吗"的。