同样的内容,换个结构,被 AI 引用率高了 17%

同样的内容,换个结构,被 AI 引用率高了 17%
大多数 GEO 建议都在讲「写什么」——多加数据、多引专家、语气更权威。但 2026 年 3 月的一篇 arXiv 研究提出了一个被低估的角度:在内容一个字都不改的前提下,只调整它的结构,就能明显改变它被 AI 引用的概率。 保持事实和措辞完全不变、只重排结构,在六个生成式引擎上带来了一致的 17.3% 引用率提升,主观质量也提高了 18.5% [1]。
这件事的价值在于:结构是你完全能掌控、可以刻意设计的东西;而「内容够不够权威」这种语义信号,既模糊又需要长期积累。这篇文章拆解研究到底发现了什么、哪些结构特征最关键、经过验证的具体数值区间是多少,以及不同 AI 引擎为什么偏好不同的结构。
先给结论:AI 引擎在决定引用什么之前,会先「解析」你的页面。 清晰的标题层级、落在合理区间的段落长度、恰当比例的列表与表格、克制的视觉强调,能让页面里一个个段落更容易被单独拎出来复用——而「被引用」本质上就是这么一次「拎出来复用」。把结构做对,你就能在不改动任何一条主张的情况下,提高被引用的概率。
---
结构和语义,是两条不同的杠杆
最早的 GEO 研究优化的是语义——加统计数据、加引述、用更权威的措辞——据报告能带来最高 40% 的引用提升 [1]。这条杠杆确实有效,但它也是所有人都在拉的那一条,而且「让内容显得更权威」很难精确执行。
GEO-SFE 这项研究(Structural Feature Engineering,结构特征工程)单独拎出了另一条杠杆。它的方法是:只改结构、不改含义——研究用句向量验证了改写前后的语义相似度高达 0.843,确认事实和主张没有发生变化 [1]。所以最终出现的引用提升,纯粹来自结构本身。
另一篇 arXiv 研究从侧面印证了同一点:引用行为更多受文档层面的内容属性驱动,而不是孤立的词句修改 [2]。换句话说,重新组织和排布,比抠单个措辞更管用。
这对实际操作是个好消息。结构可测量、可掌控、改起来快。你不需要先「攒够权威」才能把一个页面的结构做好——你只要把它工程化地设计对。
---
结构的三个层级
GEO-SFE 把结构拆成三个层级,并通过消融实验量化了每一层对总引用提升的贡献 [1]。
| 层级 | 涵盖内容 | 贡献占比 |
|---|---|---|
| 宏观结构 | 文档骨架:标题层级、导航、逻辑流、内部链接 | 44.9% |
| 中观结构 | 段落级组织:段落长度、列表、表格、格式多样性 | 39.7% |
| 微观结构 | 句子级:视觉强调、关键词位置、句法 | 15.4% |
对内容团队来说,最关键的一句话是:宏观 + 中观结构合起来贡献了约 85% 的效果。 文档的骨架和它的分块方式,远比「给关键词加粗」这类句子级润色更重要。如果你时间有限,先修标题结构和段落/格式这一层;微观微调是最小的那条杠杆。
而且这三层基本相互独立——它们的贡献加起来正好凑成 100%——这意味着你可以分开优化,然后把收益叠加起来 [1]。
---
五条结构原则,都带具体数值
这项研究之所以格外实用,是因为每条原则都配了一个经过验证的目标区间,而不是含糊的「记得用标题」。以下就是在受测引擎上让引用概率最大化的配置 [1]。
| 原则 | 验证过的目标 | 为什么有效 |
|---|---|---|
| 1. 层级清晰 | 标题深度 3–5 层,各节均衡 | 超过 5 层,注意力会被太多结构标记稀释;少于 3 层,又给不了检索足够的组织线索 |
| 2. 信息分块 | 段落 150–300 词 | 超过 300 词,段落中段的注意力约衰减 31%;少于 150 词,信息被切碎,引用概率约下降 23% |
| 3. 格式整合 | 结构化格式(列表、表格)占内容的 25–35% | 结构化格式的抽取准确率比等价散文高约 43%;但超过 35% 会打断阅读流 |
| 4. 策略性强调 | 视觉强调覆盖 5–10% 的内容,向句首倾斜 | 句首位置获得的注意力约为句中位置的 2 倍 |
| 5. 导航密度 | 内部链接密度 0.15–0.20 | 支撑跨概念的多跳推理,又不至于让导航过载 |
其中几条特别值得强调,因为它们和很多人的写作习惯相反。
150–300 词的段落是一个检索甜区,而不是文风偏好。 它直接对应一个被反复证实的现象——「中间迷失」(lost in the middle):语言模型对段落开头和结尾的信息利用得远好于埋在中间的内容 [3]。超长段落,恰恰把可引用的事实埋在了模型读得最差的地方。
列表和表格不是装饰,而是抽取加速器。 比散文高约 43% 的抽取准确率是一个很大的效应。当一条事实能放进一个表格行或一个列表项时,它就变成了一个自包含、容易被整段拎走的单元。但 25–35% 的上限也很重要:一个全是要点的页面,人读起来更累,也不再有帮助。
强调是一种稀缺资源。 标记 5–10% 的内容能引导注意力;全都标记,等于什么都没引导。研究还发现一个稳定的强调强度次序:加粗 > 斜体 > 下划线。
---
不同引擎,偏好不同的结构
这项研究在策略上最重要的发现是:三种主流的生成式引擎架构,对结构的偏好并不一样。GEO-SFE 按「如何检索、如何生成」把它们分成三类,再测量每类各自奖励哪些结构特征 [1]。
| 架构类型 | 代表引擎 | 最看重的结构特征 | 引用提升 |
|---|---|---|---|
| 先检索后综合 | Google SGE、Bing Chat | 元结构清晰(0.45)、前置信息密度(0.30)、层级深度(0.25) | +19.2% |
| 迭代精炼 | Perplexity、Phind | 交叉引用丰富(0.41)、层级广度与深度(0.35)、可触发查询的关键词(0.24) | +14.0% |
| 检索生成一体 | ChatGPT、Claude | 块的独立性(0.38)、格式多样性(0.35)、更激进的分块(0.27) | +19.7% |
落到实处:
- 面向 Google SGE 和 Bing,把清晰的元结构和信息密度放在前面。这类批量检索系统会很早对页面下判断,所以一个强而清晰、标注明确的开头,加上干净的层级,就承担了主要工作。
- 面向 Perplexity 和 Phind,投入在交叉引用和内部链接上。这类多轮系统奖励那些能支撑跨概念、探索式检索的内容。
- 面向 ChatGPT 和 Claude,让每一个块都能独立成立。实时流式抽取偏爱脱离上下文也能读懂的自包含段落,同时喜欢多样的格式。
注意这里有个矛盾:ChatGPT 这类引擎偏好更浅的结构(标题深度约 3.5 层),而 Google 这类偏好更深的(约 4.5 层)。所以并不存在一个「完美结构」。研究的处理方式是:把通用原则作为基准,再根据你最看重的平台,叠加小幅度的、针对特定架构的修正 [1]。
---
实测数据长什么样
这项评估用了 200 篇文章、覆盖六个领域,针对 377 个真实查询,在六个引擎上各测试「基线版」和「重构版」——总共 2,400 个测试用例 [1]。
| 架构类型 | 基线引用率 | 重构后 | 提升 |
|---|---|---|---|
| 先检索后综合 | 43.7% | 52.1% | +19.2% |
| 迭代精炼 | 52.3% | 59.6% | +14.0% |
| 检索生成一体 | 39.1% | 46.8% | +19.7% |
| 总体 | 45.0% | 52.8% | +17.3% |
这些提升在统计上显著(p < 0.001),效应量属于中到大。在主观质量上,跨七个维度评估,重构后的内容平均提升 18.5%,其中提升最大的是「感知影响力」(+32.0%)和「点击概率」(+31.4%)[1]。
这和更广泛的实证研究方向一致。GEO-16 审计框架发现,在 16 个页面质量支柱中,与被引用关联最强的是元数据与新鲜度、语义化 HTML、结构化数据——都是结构和技术信号,而不是文笔——且达到质量门槛的页面能实现 78% 的跨引擎引用率 [4]。两条独立的研究线索指向同一个结论:结构是一等的引用因素。
---
怎么落地
你不需要论文里的优化算法,也能拿到大部分收益。把这些发现翻译成一份可执行的清单,从问题最严重的地方开始改。
- 审查你的标题树。 目标是 3–5 层深度、各节均衡。收拢失控的多层嵌套;给大段没有结构的文字加上骨架。
- 把段落调到 150–300 词。 太长的拆开,别让可引用的事实卡在段落中间;太碎的合并。
- 把散文改成结构,只要合适。 把对比改成表格、把步骤和标准改成列表——目标占页面的四分之一到三分之一,别更多。
- 答案前置。 把直接答案和关键信息密度放在靠前的位置,面向 Google 和 Bing 时尤其如此。
- 让每个段落自包含。 面向 ChatGPT 和 Claude,写那种被单独拎出来也读得懂的小节——术语就地解释,别用「如前所述」。
- 强调要少而靠前。 只给那 5–10% 真正重要的内容加粗,优先照顾句首的关键词。
- 在相关概念之间加内链。 支撑多跳检索,对 Perplexity 这类引擎尤其重要。
- 保住含义。 重构永远不该改变你的事实。整件事的意义,就是在语义不变的前提下拿到引用提升。
改动的先后顺序,跟着消融数据走:先宏观(占 45% 收益),再中观(占 40%),最后微观(占 15%)。
---
常见问题(FAQ)
内容结构真的比措辞更影响 AI 引用吗?
结构是一条很大、且独立的杠杆。一项在保持含义不变的前提下重构内容的受控研究,跨六个引擎带来了 17.3% 的引用提升 [1];另一项研究也发现,引用行为更多由文档层面的属性驱动,而非孤立的词句修改 [2]。语义仍然重要,但结构是那条更可控、也常被忽视的杠杆。
想被引用,段落多长合适?
经过验证的区间是 150–300 词。超过 300 词,模型对段落中段的注意力约衰减 31%;少于 150 词,信息被切碎,引用概率约下降 23% [1]。这与语言模型研究中记录的「中间迷失」现象一致 [3]。
列表和表格真的有用吗?
有用。研究中,结构化格式的抽取准确率比等价散文高约 43%,因为表格行或列表项里的一条事实,本身就是一个自包含、容易被引用的单元。要注意的是比例:把结构化格式控制在页面的 25–35% 左右,过度结构化会损害可读性 [1]。
面向 ChatGPT 和 Google,要用同一套优化吗?
不。它们奖励不同的结构。Google SGE 和 Bing 偏好清晰的元结构、前置密度和更深的层级;ChatGPT 和 Claude 偏好自包含的块和格式多样性、结构更浅;Perplexity 偏好交叉引用和内部链接 [1]。先把通用基本功做好,再向你最看重的平台倾斜。
应该先改哪个结构层级?
先改宏观结构。消融分析显示,约 44.9% 的引用提升来自文档骨架,39.7% 来自段落级的分块与格式,15.4% 来自句子级强调 [1]。先把标题树和大纲理顺,再去抠加粗和斜体。
重构会不会伤到内容含义或人类读者?
只要做法正确,不会。这项研究施加了严格的语义保留约束,仍然录得 18.5% 的主观质量提升,包括更高的感知影响力和点击概率 [1]。更好的结构,往往同时对人和机器都更友好。
---
核心结论
- 结构是一条独立的引用杠杆。 在含义不变的前提下,仅重构结构就让六个引擎的引用率提升了 17.3% [1]。
- 宏观 + 中观结构贡献了约 85% 的效果(44.9% + 39.7%);句子级强调是最小的杠杆,占 15.4% [1]。
- 目标很具体: 标题 3–5 层、段落 150–300 词、结构化格式 25–35%、强调 5–10%、内链密度 0.15–0.20 [1]。
- 引擎各不相同。 Google/Bing 奖励前置密度和层级深度;ChatGPT/Claude 奖励自包含的块;Perplexity 奖励交叉引用 [1]。
- 独立研究相互印证: GEO-16 发现元数据与新鲜度、语义化 HTML、结构化数据是与引用关联最强的支柱之一 [4],且文档级属性的作用大于词句级修改 [2]。
- 它可控、且见效快。 和「攒权威」不同,重构完全在你手里,今天就能作为一份可执行清单落地。
「引用经济」奖励的,是机器能够解析、切分、复用的内容。这既是一个写作问题,更是一个工程问题。把骨架做对——标题、段落长度、格式——你就让页面上的每一条事实都更容易被引用,而不必改动你真正主张的任何一个字。
---
在 AI 答案里被引用,越来越是一门结构工程。
Innflows 帮助企业审计页面的结构层级、分块方式、格式与技术信号,找出限制内容被 AI 解析和引用的关键问题,并给出可执行的优化优先级。
---
参考来源
[3] - Lost in the Middle: How Language Models Use Long Contexts — arXiv:2307.03172
[4] - AI Answer Engine Citation Behavior: An Empirical Analysis of the GEO-16 Framework — arXiv:2509.10762

