正在翻开……

写内容的人必看:改三处写法,在 AI 答案里被引用的机会多 41%

Aggarwal, Murahari et al. · Princeton 等 · KDD 2024

上一期 AI 洞察里,18 年 SEO 老兵 Ethan Smith 给了一套 AEO 实操打法——但「什么样的内容更容易被 AI 引用」,当时靠的全是从业者经验。这一期看证据:普林斯顿等四家机构的研究者拿一万个真实问题做了对照实验,把答案量到了小数点——给论断附上信源、加进统计数据、引用权威原话,能见度最多提升 41%;而 SEO 时代最灵的关键词堆砌,是九种写法里唯一让你变差的那个。

先解决一个测量问题:「被看见」怎么量?

做实验得先有尺子。传统搜索的能见度好量——你排第几就是第几。但答案引擎把几个来源的内容揉进一段话里,「排名」失去了意义。论文提出的替代尺子,白话讲就是两问:答案里有多少句话是从你家搬的?搬得靠不靠前?这把尺子的学名叫「位置加权词数」——你贡献的词越多、出现越靠前,得分越高。另有一把「主观印象」尺子,让模型从相关性、影响力、独特性等七个维度打分,作为交叉验证。

尺子有了,实验就直白了:一个问题,五个来源网页,随机挑一个用某种写法改写,其它四个不动,看被改写的那家在答案里的份额变了多少。每种写法在一万个问题上重复,跑五遍取平均。论文的主图把这个过程画成了一个披萨店的故事:

GEO 论文主图:披萨网站优化前后在 AI 答案中的能见度对比
问「纽约有什么好玩的」:优化前(左),披萨网站灰在角落里,答案末尾才轻轻带过一句;按配方改写后(右),同一个网站的内容跳到了答案第一句——「先去尝尝纽约风味披萨当早餐」。内容没变多少,写法变了。图:GEO 论文 Figure 1 · arXiv:2311.09735

九种写法的成绩单

研究者测了九种网站主可以立刻上手的改写:有的动风格(更流畅、更通俗、更权威),有的加内容(补数据、附信源、引原话),还有一种是 SEO 的祖传手艺——往文里塞关键词。成绩单如下:

九种写法在一万个问题上的能见度变化(位置加权词数,相对无优化基线)。前三名的共性一眼可见:引言、数据、信源,全是「可核实的确定性」——给了模型敢直接搬运你原话的理由。数据:GEO 论文 Table 1,五次运行平均。

头名「加权威引言」值得展开:它不是让你自吹,而是在内容里引用可信来源的原话——专家怎么说、报告怎么写。第二、三名同理:把「瑞士人很爱吃巧克力」改成「瑞士人均年消费巧克力 11-12 公斤(据国际巧克力组织调查)」,论文附录里这一个改动让来源能见度涨了 132%。模型转述世界时喜欢有把握的句子,你把把握递到它手里,它就搬运你。

两个反直觉的次要发现。其一,「语句更流畅」这种纯文字打磨也能涨 28%——答案引擎不只看你说了什么,还看你说得顺不顺,写作水平第一次直接变成了分发变量。其二,「语气更权威」几乎无效(+10%,且主要涨在主观分上):模型对「装腔」已经相当免疫,它认的是证据的形状,不是嗓门的大小。

唯一的输家,恰好是 SEO 的祖传手艺

成绩单最底下那根红条要单独说。关键词堆砌——把用户可能搜的词尽量塞进正文——是搜索时代验证过二十年的手艺,在这场实验里是九种写法中唯一低于基线的:能见度 −8%。换到真实产品 Perplexity 上重测,还是垫底:

走出实验室:在真实部署的 Perplexity 上重跑实验,结论复现——加引言依然最强(+22%),堆关键词依然为负(−10%)。「加统计数据」在主观印象尺上冲到了 +37%。数据:GEO 论文 Table 5。

为什么反噬?搜索引擎靠关键词匹配找你,多塞词等于多买彩票;但答案引擎里坐着一个读得懂内容的语言模型,塞满关键词的文字在它眼里就是——难读。这给上期 Ethan「SEO 有效的在 AEO 也有效」的判断补了一个精确的修正:内容层面成立(好落地页两边都赢),技巧层面不全成立(专为爬虫准备的花招,会被会读书的模型反手扣分)。

最惊人的数字:排名第五的网站 +115%

论文里藏着一个比「+41%」重要得多的数字。研究者按网页在 Google 的原始排名拆开看:同样的优化,对排第一的网站和排第五的网站,效果天差地别——方向都是反的:

当所有来源都做优化时,「附上信源」这一种写法对不同搜索排名网站的能见度影响:原本排第五的网站暴涨 115%,原本排第一的反而跌 30%——答案引擎重新分配了注意力。加引言(+99.7%)、加数据(+97.9%)对第五名的效果同样接近翻倍。数据:GEO 论文 Table 2。

这组数字的含义,论文作者自己点破了:传统搜索的头部位置靠域名权重和外链堆出来,小站几乎无法翻身;而答案引擎的模型只读内容本身——外链、域名年龄这些护城河,在一段被投喂给模型的正文里统统不可见。小创作者第一次和大公司站在了同一条起跑线上,比的只剩谁的内容更值得引用。上期 Ethan 从实战里得出「早期公司在 AEO 反而有机会」,这里是同一结论的实验版——两条完全独立的证据链,指向同一个判断。

组合拳:流畅 × 数据是最佳搭档

真实世界里没人只用一招。研究者把前四名写法两两组合重测,得到这张热力图——它也是论文里信息密度最高的一张图:

对角线(虚线框)是单打独斗,其余是两两组合。颜色最深处是「流畅 × 数据」(+35.8%)——文字打磨与硬证据互补,胜过任何单招。另一个细节在「信源」那行:它单用最弱(+19.1%),但与别人搭配平均能到 31.4%——信源是放大器,不是主攻手。数据:GEO 论文 Figure 4 · arXiv:2311.09735 · 本站按原始数值重绘

领域差异也要记一笔:辩论、历史类问题里「权威语气」突然变灵,法律与观点类问题最吃「统计数据」,讲人物与社会的内容最吃「引言」。没有万能配方,先判断你的内容属于哪类问题的答案,再选主料。

把配方翻译成动作

把整场实验浓缩成三件今天就能做的事:

  • 每个关键论断,给出处「研究表明」不算数——哪个研究、谁做的、原话怎么说。引言和信源是能见度最强的两味主料,也是模型敢引用你的凭据。
  • 把形容词换成数字「增长很快」→「同比增长 217%」。定性改定量这一个动作,实验里稳定贡献 30% 上下的提升,对法律、观点、商业类内容尤其猛。
  • 为读者写,别为爬虫写通顺、好读本身就值 +28%;反过来,专为机器塞的关键词会被扣分。答案引擎时代第一次出现了这样的对齐:对人类读者好的写作,就是对分发最优的写作。

也要把论文自己交代的局限搬过来:实验用的生成引擎会进化,今天的配方需要像 SEO 一样持续重测;基准里的问题分布会过时;实验也没有回答「这些改动对传统搜索排名有没有副作用」——作者的判断是影响很小,因为改的只是正文文字,不动外链和域名。

一篇教你被引用的论文,自己成了被引用最多的那个

回头看,这篇论文最妙的地方是它的命运本身。2023 年 11 月,ChatGPT 才发布一周年,几个研究生就赌这个方向值得建基准、下定义——两年后,AEO 成了增长圈最热的词,而全网几乎每篇教程都在引用它的数字:40%、一万个问题、关键词堆砌无效。一篇教大家「被 AI 引用是有配方的」的论文,靠着自己的配方(下定义、给数据、可核实),成了这个领域被引用最多的内容。

这也是我们把它做成这一期的原因:上期的播客给了打法,这期的论文给了打法背后的物理学。你现在读的这篇文章,图注里每个数字都标了出处——按配方说,这叫 Cite Sources。我们也在按实验结果写作。