AI 引用的「暗物质」:60% 被引用的页面,根本没排在 Google 前面

AI 引用的「暗物质」:60% 被引用的页面,根本没排在 Google 前面
先说一个可能会改变你 AI 可见度认知的数据:AI 引擎在回答里引用的网页,约有 60% 根本没有出现在 Google 或 Bing 同一查询的自然搜索前 20 名里 [1]。这个比例在间隔 14 天的三轮测量中分别是 62%、57%、60%——足够稳定,说明它是结构性现象,而不是偶然波动 [1]。
这就是 AI 引用的「暗物质」:一大批 AI 回答里真实引用、却在你的排名监控后台完全看不见的页面。如果你还在用 Google 排名来衡量 AI 可见度,等于是在错误的天空里找星星。
先给结论:AI 检索和传统排名,已经是两套逻辑不同的系统。 一个页面可以被 ChatGPT 或 Google AI Overviews 引用,却在蓝色链接里排得很靠后——因为 AI 是从「匹配意图、带有具体证据、来自它信任的来源」的段落里拼装答案,而不是从你辛苦优化的排名列表里选。想看清 AI 可见度,就必须直接测量引用本身,并且为「被检索」而不是「被排名」做优化。
这篇文章讲清四件事:暗物质到底是什么、两套系统为什么会脱钩、当排名不再预测引用时到底什么才带来引用、以及你该怎么测量和应对。
---
什么是 AI 引用的「暗物质」
天文学里,暗物质是你看不见、却能通过引力效应推断出来的质量。AI 引用的暗物质是同一个道理搬到搜索里:你在排名结果里看不见这些页面,但从 AI 生成的答案里能推断出它们确实在起作用。
测量方法很直接:拿到 AI 引擎在一批查询里引用的 URL,再去查这些 URL 在同一批查询的传统自然搜索里排第几,落在前 20 名之外的比例,就是你的「暗物质率」。
多项独立研究给出的数字高度一致:
| 来源 | 测量方式 | 结果 |
|---|---|---|
| Digital Authority | AI Overview 引用 vs 自然前 20,三轮测量 | 约 60% 被引 URL 排在前 20 之外 [1] |
| Ahrefs(2025 年 8 月) | 被引 URL vs Google 前 100 | 约 80% 的 AI 被引 URL 不在前 100 名内 [2] |
| citybiz / 行业数据 | 来自前 10 名页面的 AI Overview 引用占比 | 从 2024 年底的约 75% 跌到 2026 年初的 20–33% [3] |
把这几个数据放在一起,结论只有一个:过去「排得好」和「被引用」高度重合,如今这种重合已经崩塌。曾经同步移动的两个界面,正在明显分道扬镳。
---
排名和引用,为什么会脱钩
传统自然排名回答的是一个问题:给定这个查询,最好的整页是哪些、按什么顺序排?AI 检索回答的是另一个问题:给定这个提问,我能把哪些段落拼成一个有依据的答案,又该信任哪些来源为它背书?
这是两个不同的问题,自然不会给出同一份名单。背后有几股结构性力量在推动这种分裂。
AI 检索的是段落,不是整页。 生成式引擎会把内容切成小块(chunk)、做向量化,再抽取最匹配提问意图的具体段落。一个整体排在第 35 位的页面,完全可能包含针对某个细分问题最值得引用的那一段。整页排名永远浮不出这一段,段落检索却可以。
不同引擎信任不同来源。 各家的引用生态差异极大。有分析显示,同时被 ChatGPT 和 Perplexity 引用的域名估计只有 11%,其余 89% 都是单一引擎特有的 [4]。Reddit 这类社区平台、官方文档和媒体报道,在 AI 答案里出现的频率,远高于它们的 Google 排名所能预测的水平。
引用集中在另一条曲线上。 AI 引用呈现「赢家通吃」的分布,且和自然排名并不重合。在一个大规模数据集中,前 10 个域名吞下了 25.3% 的全部引用,前 100 个域名吃掉 67.7%,剩下约 6,250 个域名去分那最后三分之一 [5]。而占据这种集中度的域名,未必就是自然排名的赢家。
大多数答案根本不给出处。 暗物质还有更暗的一角:很多 AI 答案压根不带外部链接。截至 2026 年 5 月,美国地区只有 6.8% 的 ChatGPT 答案包含指向外部来源的链接 [6]。正因为引擎给出引用时如此稀少又难以捉摸,那些真正被抽中的页面才更值得研究。
落到实处就一句话:Google 排名,已经是「AI 会不会引用你」的一个很弱的替代指标。 你可能排第一却在答案里隐身,也可能排在第四页却每天被引用。
---
「被认识」不等于「被引用」
脱钩还有第二张面孔,专门坑品牌:AI 明明很清楚你是谁,到了关键时刻却从不提你。
一项覆盖八个 AI 平台的 2026 年二季度研究发现,当被直接问到时,96% 的受测品牌能被准确描述;但在回答品类调研类问题时,89% 的品牌从未出现过 [7]。品类层面的数据也印证了这一点:在 1,094 个品类里,89% 的 AI 搜索需求落在没有任何品牌占据的品类中 [8]。
这就是「被认识」和「被检索」的区别。当用户问「介绍一下某某品牌」,模型调用的是它已经记住的知识;当用户问「做 Y 最好的工具是什么」,引擎则要从它信任的来源里检索并拼装答案——被记住,并不等于在那个真正驱动购买意图的问题上可被检索。
暗物质和识别鸿沟,其实是同一个现实的两个角度:页面被引用却没排名,品牌被认识却没被引用。两种情况里,你看得见的信号(排名,或品牌知名度),都无法预测那个真正重要的结果(在答案里被引用)。
---
当排名不再预测引用,到底什么带来引用
如果排名不再预测引用,那什么才行?证据指向的不是某个单一技巧,而是一组「利于被检索」的属性。
技术可访问性是第一前提。 页面如果无法被检索,就不可能被引用。一项对 500 万个被引 URL 的分析发现,AI 平台持续引用的,是那些技术基础扎实——可抓取、加载快、结构清晰——的页面 [9]。Google 自己的生成式 AI 指南对这个前提说得很直白:内容必须可抓取,因为它的模型要用公开可访问的内容来为回答提供依据 [10]。这恰恰解释了暗物质为什么如此庞大:技术上可访问、段落充实的页面,无论排名如何都会被检索到。
段落级的具体性。 因为引擎检索的是 chunk,优化的基本单位就是段落,而不是整页。一个自包含、直接回答某个问题的段落——带一个数字、一条定义、一个具体步骤——本身就可被独立检索。含糊、依赖上下文才成立的文字,则不行。
证据密度。 具体的主张、统计数据、命名实体和日期,给一个段落提供了「值得为之引用」的理由。那些只为「读起来像标准答案」而被抽空细节的内容,检索表现反而更差——这和「为求可引用而改写、结果反倒降低检索率」是同一套机制。
分引擎的来源信任。 因为各家引用生态不同,承载你主张的来源,和你自己的页面同样重要。第三方佐证、社区存在感和媒体报道,都在给各个引擎所依赖的「可信来源池」供货。
这里有一个证明它是因果、而非巧合的关键证据:在受控的拆分测试中,给一组页面加上 FAQ 板块会拉高 AI 引用,去掉后引用又跌回去 [11]。这种「改变输入、输出随之双向变动」的可逆性,正是大多数 AI 可见度测量始终达不到的证明标准。
| 传统排名优化的是 | AI 引用优化的是 |
|---|---|
| 整页的相关性与权威度 | 段落级的答案契合度 |
| 排名列表里的位次 | 是否被纳入拼装出的答案 |
| 外链与域名权重 | 特定引擎内部的来源信任 |
| 面向所有用户的一份名单 | 每个引擎各自的可信来源池 |
| 关键词与查询匹配 | 意图匹配 + 证据密度 |
---
怎么测量你的「暗物质」
后台看不见的东西,你没法管理。测量暗物质,意味着直接测量引用,而不是从排名去推断。
- 追踪引用,而不只是排名。 用一套固定的、真实的品类问题库,跑一遍 ChatGPT、Perplexity、Google AI Overviews、Gemini 和 Copilot,记录每个引擎引用了哪些 URL。光靠排名工具,永远发现不了那 60%。
- 算出你自己的暗物质率。 对那些你确实被引用的查询,去查这些页面的自然排名。如果很大比例落在前 20 之外,就说明你的品类同样已经脱钩,别再拿排名当替代指标。
- 把「被认识」和「被引用」分开测。 先直接问各引擎关于你品牌的问题(认识),再问一个买家真正会用的品类问题(引用)。两者之间的差距,才是你真正的机会。
- 分引擎测量。 主流引擎之间域名重合只有约 11% [4],一个混在一起的综合分数,掩盖的比呈现的多。每个界面都要单独追踪。
- 在能做的地方验证因果。 只要样本量允许,就对某个改动做拆分测试——加上或去掉一个 FAQ 板块、重构一个段落——看引用是否会双向变动 [11]。
目标不是一个好看的可见度分数,而是搞清楚:哪些问题会引用你、哪些引用了竞品、哪些谁都没引用——最后这一类,正是仍然敞开的机会。
---
常见问题(FAQ)
AI 引用的「暗物质」到底指什么?
它指的是 AI 引擎引用、却不出现在传统排名靠前结果里的那一大批页面。研究显示约 60% 的 AI 被引 URL 落在自然搜索前 20 之外,在 Ahrefs 的一项分析里约 80% 落在前 100 之外 [1][2]。你在排名工具里看不到它们,但它们正在 AI 答案里干活。
做 Google 排名对 AI 可见度还有用吗?
有帮助,但已经不能预测引用。来自前 10 名页面的 AI Overview 引用占比,从 2024 年底的约 75% 跌到 2026 年初的 20–33% [3]。扎实的技术基础仍然和「被引用」正相关 [9],但排名位次本身,已经是「AI 会不会引用你」的一个很弱的替代指标。
为什么 AI 会引用排名很差的页面?
因为 AI 检索的是段落而不是整页,它从匹配意图、带有具体证据的 chunk 里拼装答案。一个整体排名靠后的页面,仍可能藏着针对某个细分问题最相关、最自包含的一段——段落检索能把它捞出来,整页排名却不会。
我的品牌很有名,却很少被引用,为什么?
这就是「识别–引用鸿沟」。一项研究中,96% 的品牌被直接问到时能被准确描述,但 89% 从未出现在品类调研问题的答案里 [7]。被记住是「回忆」,被引用是「针对具体问题的检索」,后者需要单独去挣。
怎么判断我的品类里有没有暗物质?
把你品类里真实的问题跑一遍主流 AI 引擎,记录被引用的 URL,再查这些 URL 的自然排名。如果很大比例落在前 20 之外,说明你的品类也已经脱钩,排名监控就不再是衡量 AI 可见度的可靠方式。
llms.txt 或专门的 schema 是不是解药?
没有哪个单一文件是解药。证据支持的是可抓取性、段落级具体性、证据密度和分引擎的来源信任。受控测试显示,FAQ 板块这类结构性内容改动能让引用上下移动 [11];而一次性的技术文件,背后的证据要弱得多。
---
核心结论
- 约 60% 的 AI 被引 URL 排在自然前 20 之外,且这一比例在多轮测量中保持稳定——这是结构性现象,不是噪音 [1]。
- 排名与引用已经脱钩:前 10 名页面在 AI Overview 引用中的占比,约一年内从 75% 跌到 20–33% [3]。
- AI 检索段落、且分引擎信任不同来源,所以整页排名是弱指标;同时被 ChatGPT 和 Perplexity 引用的域名只有约 11% [4]。
- 被认识不等于被引用:96% 的品牌能被准确描述,89% 却从不出现在品类答案里 [7]。
- 引用靠可抓取性、段落具体性和证据密度挣来,拆分测试证明 FAQ 结构能让引用双向变动 [9][11]。
- 直接、分引擎测量引用:排名监控藏起了那 60%,只有一套跑遍各引擎的固定问题库,才能揭示你真实的 AI 可见度。
真正赢得 AI 引用的页面,就藏在明处——排名工具里看不见,却出现在每一条答案里。别再用 Google 排名衡量 AI 可见度,开始直接测量引用本身,并把页面做成「在段落层面可被检索」,而不只是「作为整页可被排名」。
---
AI 可见度的竞争,早已不在排名列表里,而在答案本身。
Innflows 帮助企业审计网站的技术可访问性、内容结构与实体信号,直接追踪品牌在各 AI 引擎中的被引用情况,把看不见的「暗物质」变成可测量、可优化的增长空间。
---
参考来源
[1] - AI Visibility Study — Digital Authority Partners
[2] - AI SEO Technical Approaches(引用 Ahrefs, 2025 年 8 月)— SelectedFirms
[3] - Is AEO Just SEO? What Businesses Should Know About AI Search Visibility — citybiz
[4] - The State of AI Citations 2026 — 5WPR
[5] - AI Search in 2026: Why Reddit Out-Cites Every Vendor in Your Category — AI Journal
[6] - AI Search Isn't Replacing Google, It's Layering On Top — Search Engine Journal
[7] - AI Recognizes 96% of Brands But Mentions Almost None — Search Engine Journal
[8] - 89% of AI Search Demand Has No Clear Owner — Search Engine Journal
[9] - How Do Technical SEO Factors Impact AI Search? (Study) — Semrush
[10] - Google AI Search Optimization Guide vs. llms.txt Audit — TechWyse
[11] - AI Search Is Working. How to Prove It With Real Tests — Search Engine Journal

