写内容的人必看:改三处写法,在 AI 答案里被引用的机会多 41%
Aggarwal, Murahari et al. · Princeton 等 · KDD 2024
上一期 AI 洞察里,18 年 SEO 老兵 Ethan Smith 给了一套 AEO 实操打法——但「什么样的内容更容易被 AI 引用」,当时靠的全是从业者经验。这一期看证据:普林斯顿等四家机构的研究者拿一万个真实问题做了对照实验,把答案量到了小数点——给论断附上信源、加进统计数据、引用权威原话,能见度最多提升 41%;而 SEO 时代最灵的关键词堆砌,是九种写法里唯一让你变差的那个。
先解决一个测量问题:「被看见」怎么量?
做实验得先有尺子。传统搜索的能见度好量——你排第几就是第几。但答案引擎把几个来源的内容揉进一段话里,「排名」失去了意义。论文提出的替代尺子,白话讲就是两问:答案里有多少句话是从你家搬的?搬得靠不靠前?这把尺子的学名叫「位置加权词数」——你贡献的词越多、出现越靠前,得分越高。另有一把「主观印象」尺子,让模型从相关性、影响力、独特性等七个维度打分,作为交叉验证。
尺子有了,实验就直白了:一个问题,五个来源网页,随机挑一个用某种写法改写,其它四个不动,看被改写的那家在答案里的份额变了多少。每种写法在一万个问题上重复,跑五遍取平均。论文的主图把这个过程画成了一个披萨店的故事:
九种写法的成绩单
研究者测了九种网站主可以立刻上手的改写:有的动风格(更流畅、更通俗、更权威),有的加内容(补数据、附信源、引原话),还有一种是 SEO 的祖传手艺——往文里塞关键词。成绩单如下:
头名「加权威引言」值得展开:它不是让你自吹,而是在内容里引用可信来源的原话——专家怎么说、报告怎么写。第二、三名同理:把「瑞士人很爱吃巧克力」改成「瑞士人均年消费巧克力 11-12 公斤(据国际巧克力组织调查)」,论文附录里这一个改动让来源能见度涨了 132%。模型转述世界时喜欢有把握的句子,你把把握递到它手里,它就搬运你。
两个反直觉的次要发现。其一,「语句更流畅」这种纯文字打磨也能涨 28%——答案引擎不只看你说了什么,还看你说得顺不顺,写作水平第一次直接变成了分发变量。其二,「语气更权威」几乎无效(+10%,且主要涨在主观分上):模型对「装腔」已经相当免疫,它认的是证据的形状,不是嗓门的大小。
唯一的输家,恰好是 SEO 的祖传手艺
成绩单最底下那根红条要单独说。关键词堆砌——把用户可能搜的词尽量塞进正文——是搜索时代验证过二十年的手艺,在这场实验里是九种写法中唯一低于基线的:能见度 −8%。换到真实产品 Perplexity 上重测,还是垫底:
为什么反噬?搜索引擎靠关键词匹配找你,多塞词等于多买彩票;但答案引擎里坐着一个读得懂内容的语言模型,塞满关键词的文字在它眼里就是——难读。这给上期 Ethan「SEO 有效的在 AEO 也有效」的判断补了一个精确的修正:内容层面成立(好落地页两边都赢),技巧层面不全成立(专为爬虫准备的花招,会被会读书的模型反手扣分)。
最惊人的数字:排名第五的网站 +115%
论文里藏着一个比「+41%」重要得多的数字。研究者按网页在 Google 的原始排名拆开看:同样的优化,对排第一的网站和排第五的网站,效果天差地别——方向都是反的:
这组数字的含义,论文作者自己点破了:传统搜索的头部位置靠域名权重和外链堆出来,小站几乎无法翻身;而答案引擎的模型只读内容本身——外链、域名年龄这些护城河,在一段被投喂给模型的正文里统统不可见。小创作者第一次和大公司站在了同一条起跑线上,比的只剩谁的内容更值得引用。上期 Ethan 从实战里得出「早期公司在 AEO 反而有机会」,这里是同一结论的实验版——两条完全独立的证据链,指向同一个判断。
组合拳:流畅 × 数据是最佳搭档
真实世界里没人只用一招。研究者把前四名写法两两组合重测,得到这张热力图——它也是论文里信息密度最高的一张图:
领域差异也要记一笔:辩论、历史类问题里「权威语气」突然变灵,法律与观点类问题最吃「统计数据」,讲人物与社会的内容最吃「引言」。没有万能配方,先判断你的内容属于哪类问题的答案,再选主料。
把配方翻译成动作
把整场实验浓缩成三件今天就能做的事:
- 每个关键论断,给出处「研究表明」不算数——哪个研究、谁做的、原话怎么说。引言和信源是能见度最强的两味主料,也是模型敢引用你的凭据。
- 把形容词换成数字「增长很快」→「同比增长 217%」。定性改定量这一个动作,实验里稳定贡献 30% 上下的提升,对法律、观点、商业类内容尤其猛。
- 为读者写,别为爬虫写通顺、好读本身就值 +28%;反过来,专为机器塞的关键词会被扣分。答案引擎时代第一次出现了这样的对齐:对人类读者好的写作,就是对分发最优的写作。
也要把论文自己交代的局限搬过来:实验用的生成引擎会进化,今天的配方需要像 SEO 一样持续重测;基准里的问题分布会过时;实验也没有回答「这些改动对传统搜索排名有没有副作用」——作者的判断是影响很小,因为改的只是正文文字,不动外链和域名。
一篇教你被引用的论文,自己成了被引用最多的那个
回头看,这篇论文最妙的地方是它的命运本身。2023 年 11 月,ChatGPT 才发布一周年,几个研究生就赌这个方向值得建基准、下定义——两年后,AEO 成了增长圈最热的词,而全网几乎每篇教程都在引用它的数字:40%、一万个问题、关键词堆砌无效。一篇教大家「被 AI 引用是有配方的」的论文,靠着自己的配方(下定义、给数据、可核实),成了这个领域被引用最多的内容。
这也是我们把它做成这一期的原因:上期的播客给了打法,这期的论文给了打法背后的物理学。你现在读的这篇文章,图注里每个数字都标了出处——按配方说,这叫 Cite Sources。我们也在按实验结果写作。