技术

训练机器人 vs 搜索爬虫:决定 AI 可见度的 robots.txt 分离策略

Leo Wang July 13, 2026
训练机器人 vs 搜索爬虫:决定 AI 可见度的 robots.txt 分离策略

训练机器人 vs 搜索爬虫:决定 AI 可见度的 robots.txt 分离策略

快速回答: AI 厂商现在为两种不同的任务运行独立的爬虫。一组用于抓取页面以训练模型(GPTBot、ClaudeBot、Google-Extended)。另一组用于索引页面以便 AI 搜索进行引用(OAI-SearchBot、Claude-SearchBot、PerplexityBot、Bingbot)。这些爬虫由您 robots.txt 中不同的 User-agent 控制,这意味着您可以选择退出训练,同时保持 AI 搜索引用的完整资格。过去“屏蔽所有 AI 机器人”的建议现在会产生反作用:它会悄无声息地将您的品牌从 2026 年增长最快的推荐流量渠道中抹除。本文将解释这种分离,列出重要的机器人,并为您提供一份可直接复制的 robots.txt 策略。

这就是为什么这件事迫在眉睫。大量网站所有者一举屏蔽了所有 AI 爬虫,通常是通过托管默认设置或出于好意的插件,却没意识到他们在切断训练抓取工具的同时,也切断了搜索索引器。结果是无声的可见度损失:页面在 Google 中仍有排名,但 ChatGPT、Perplexity 和 Claude 再也无法检索或引用它们。

---

为什么 AI 厂商将爬虫一分为二

直到最近,“AI 机器人”还是一个单一的概念。你要么让它进入,要么不让。这种思维模型现在是错误的,因为主要的实验室已经根据用途刻意分离了它们的爬虫。

改变一切的区别在于用途:为模型训练收集页面的爬虫与为 AI 搜索答案建立索引的爬虫在本质上是不同的行为者。OpenAI 运行 GPTBot 用于训练,运行 OAI-SearchBot 用于 ChatGPT 搜索。Anthropic 运行三个独立的机器人。Google 将传统的搜索抓取与其 Gemini 训练访问分开。由于每种用途都有自己的 User-agent,因此在您的 robots.txt 中,每种用途都是一个独立的决策。

这很重要,因为这两项活动对发布者的价值截然不同。

  • 训练抓取将您的内容喂入模型学习的语料库。屏蔽此项意味着您选择退出语料库包含。对于大多数发布者来说,这种收益无论如何都是空想,因为实验室很少披露语料库选择,且直接的可见度回报并不明确。
  • 搜索抓取决定了当用户今天提出问题时,您的页面是否可以被检索和引用。屏蔽此项会立即将您从该引擎的答案中完全移除,并带来可衡量的流量损失。

如果将两者合并为一条“屏蔽所有 AI 机器人”的规则,您就是用一个投机性的训练担忧换取了实实在在的实时引用损失。对于几乎所有商业网站来说,这都是一笔糟糕的交易。

---

经济账:为什么搜索引用值得保护

这一决策之所以具有威慑力,是因为 AI 搜索推荐流量增长迅速且转化率高,而训练抓取几乎没有任何回报。

考虑一下这些机器人“索取”与“回馈”访客频率之间的失衡:

  • Anthropic 的抓取与推荐比在 2025 年中期达到峰值,约为 70,900:1,这意味着它的训练爬虫每发送一名访客,就要抓取数万个页面。传统的 Googlebot 则接近 5:1
  • 目前约 82% 的 AI 机器人活动是以训练为导向的,高于一年前的约 72%,因此大部分 AI 抓取属于低回报类型。
  • 在需求侧,一家平台报告称,到 2026 年 4 月,ChatGPT 驱动了近 10% 的新注册,而六个月前这一比例还不到 1%。

综上所述,情况很明朗。训练爬虫消耗大量内容却几乎不返回任何东西,而 AI 搜索正迅速成为一个真正的获客渠道。明智的做法不是屏蔽一切或允许一切,而是如果您愿意,可以屏蔽低回报的训练爬虫,但始终保持搜索索引器开放。

---

2026 年重要的机器人

要执行分离策略,您需要知道哪个 User-agent 负责哪项工作。下表按厂商和用途对主要爬虫进行了分组。

厂商训练 / 语料库机器人搜索 / 引用机器人用户触发的抓取
OpenAIGPTBotOAI-SearchBotChatGPT-User
AnthropicClaudeBotClaude-SearchBotClaude-User
Perplexity(使用 PerplexityBot 进行索引)PerplexityBotPerplexity-User
GoogleGoogle-ExtendedGooglebot
AppleApplebot-ExtendedApplebot
MicrosoftBingbot
Common CrawlCCBot

一些容易让人困惑的澄清:

  • GPTBot 不是 OAI-SearchBot。 屏蔽 GPTBot 会让您退出 OpenAI 训练。它不会将您从 ChatGPT 搜索中移除,后者依赖于 OAI-SearchBot,在某些情况下还依赖于 Bing 的索引。
  • ClaudeBot 不是 Claude-SearchBot。 训练机器人和搜索机器人是不同的字符串,因此通用的“Claude”屏蔽可能会误伤。
  • Google-Extended 仅用于训练退出。 它不会影响正常的 Googlebot 抓取或您的 Google Search 排名。它仅控制您的内容是否用于训练 Gemini。
  • 用户触发的抓取工具(ChatGPT-User、Claude-User、Perplexity-User)抓取页面是因为人类要求助手查看该页面。屏蔽这些可能会破坏真实用户的请求,因此请谨慎对待。

简单来说,这三项工作是:

  1. 训练 —— 离线、批量收集以构建模型知识。对发布者的直接回报低。
  2. 搜索索引 —— 构建回答引擎引用的检索索引。回报高,需加以保护。
  3. 按需抓取 —— 因为用户实时粘贴或引用而抓取页面。屏蔽会伤害真实用户。

---

意外屏蔽问题

大多数 AI 爬虫屏蔽并非刻意为之。没有人会一觉醒来决定添加 Disallow: OAI-SearchBot 来把自己关在 ChatGPT 之外。屏蔽往往是通过默认设置和粗放的规则悄悄发生的。

三个常见原因:

  • 托管和 CDN 默认设置。 一些平台开始对特定日期后创建的网站默认屏蔽 AI 爬虫。如果您从未动过 robots.txt,您可能已经在不知情的情况下屏蔽了搜索索引器。
  • 通用的“屏蔽所有 AI”代码段。 插件和复制粘贴的 robots.txt 屏蔽规则通常将每个 AI User-agent 列在一个 Disallow 下,从而在拦截训练机器人的同时误伤了搜索机器人。
  • 遗留的防抓取规则。 为了阻止内容盗窃而编写的旧规则可能会匹配到现代搜索爬虫,而这些爬虫的名称在编写规则时还不存在。

这种规模不容小觑。研究发现,很大一部分新闻发布者都在屏蔽搜索机器人,通常是出于意外,并为此付出了失去引用的代价。由于这种失败在常规分析中是不可见的,它可能会持续数月之久。

教训是:审计您实际屏蔽的内容,因为默认设置可能并非您的本意。

---

可直接复制的 robots.txt 策略

这是一个针对最常见目标的平衡配置:尽可能避开训练语料库,但在 AI 搜索中保持完全可引用。 请根据需要进行调整。

# 允许 AI 搜索索引器(保护引用)
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Bingbot
Allow: /

User-agent: Googlebot
Allow: /

# 退出模型训练(可选)
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

如果您追求最大覆盖范围且不介意被用于训练,只需允许所有内容并跳过训练屏蔽部分。如果您是出于许可原因希望内容不被用于训练的发布者,上述屏蔽方案可以在不牺牲 AI 搜索可见度的情况下实现这一目标。

不要怎么做

避免许多模板仍然推荐的单一通用规则:

# 这是一个错误 —— 它也会屏蔽搜索引用机器人
User-agent: *
Disallow: /

针对“AI 机器人”的通配符 Disallow 通常会拦截 OAI-SearchBot、PerplexityBot 和 Bingbot。这就是品牌如何意外地从 AI 答案中抹除自己的。

---

robots.txt 不等同于 noindex

一个微妙但重要的规则:禁止抓取不等于从结果中删除页面。 它们解决的是不同的问题,错误地结合使用会导致麻烦。

  • robots.txt 中的 Disallow 告诉爬虫不要抓取该页面。但如果页面通过链接被发现,它仍然可能出现,因为爬虫从未读取页面以看到其中的任何指令。
  • noindex 告诉引擎不要将页面包含在结果中。为了让引擎看到 noindex,必须首先允许爬虫抓取该页面。

实际规则:永远不要同时对同一个 URL 应用 Disallow 和 noindex。 如果您想让页面不出现在结果中,请允许抓取并使用 noindex。如果您屏蔽了抓取,引擎可能永远读不到您的 noindex,并且仍可能引用该 URL。

专门针对 AI 搜索,目标通常恰恰相反:您希望搜索索引器抓取并读取您的页面,以便它们能够准确地引用。屏蔽它们会保证相反的结果。

---

如何审计您当前的 AI 爬虫访问权限

您不需要特殊的工具来发现自己是否意外屏蔽了搜索机器人。三项检查涵盖了大多数情况。

1. 阅读您的实时 robots.txt

在浏览器中打开 https://yourdomain.com/robots.txt。查找任何与 OAI-SearchBotClaude-SearchBotPerplexityBotBingbot 或通配符 User-agent: * 相关的 Disallow: / 规则。其中任何一项都可能抑制 AI 搜索引用。

2. 检查您的服务器日志中的搜索机器人

在访问日志中搜索(Grep)搜索索引器的 User-agent:

grep -E "OAI-SearchBot|PerplexityBot|Claude-SearchBot|Bingbot" access.log

如果您看到了训练机器人(GPTBot、ClaudeBot)但从未看到搜索索引器,那么可能是屏蔽或抓取障碍将引用爬虫挡在了门外。

3. 确认您的 CDN 或主机没有默认屏蔽

如果您的网站位于设置了 AI 屏蔽默认值的 CDN 之后,仅凭 robots.txt 无法说明全部情况,因为屏蔽可能在请求到达您的源站之前就在边缘发生了。检查 CDN 的机器人管理设置中是否有“AI 爬虫”开关,并确认允许搜索索引器通过。

---

超越 robots.txt:在可抓取后变得可引用

向搜索爬虫敞开大门是必要的,但还不够。一旦 OAI-SearchBot 和 PerplexityBot 能够访问您的页面,内容仍然必须是可读且可引用的。

  • 在初始 HTML 中提供内容。 大多数 AI 爬虫不执行 JavaScript,因此客户端渲染的内容即使对您允许的机器人也是不可见的。请在服务端渲染关键内容。
  • 保持实体语言一致。 为您的品牌、产品和类别使用一个稳定的名称,以便检索系统可以将提及的内容连接成一个单一实体。
  • 编写自包含的段落。 回答引擎通常会提取单个段落,因此每个段落都应承载一个完整的想法并带有明确的主语。
  • 在服务端添加结构化数据。 Organization、Product、Article 和 FAQ 架构有助于机器理解页面的主题。

爬虫访问权限决定了您是否在局内。内容结构决定了您在局内是否能被引用。

---

常见问题解答:训练机器人 vs 搜索爬虫

如果我屏蔽了 GPTBot,我会从 ChatGPT 搜索中消失吗?

不会。GPTBot 负责 OpenAI 的训练。ChatGPT 搜索依赖于 OAI-SearchBot,在某些情况下还依赖于 Bing 的索引。只要 OAI-SearchBot 和 Bingbot 保持允许状态,屏蔽 GPTBot 就会让您退出训练,同时保留 ChatGPT 搜索的资格。

ClaudeBot 和 Claude-SearchBot 有什么区别?

ClaudeBot 是 Anthropic 的训练和语料库爬虫。Claude-SearchBot 为 Claude 基于搜索的回答索引页面。它们是独立的 User-agent,因此您可以在允许搜索引用的同时屏蔽训练。

Google-Extended 会影响我的 Google 排名吗?

不会。Google-Extended 是 Gemini 的训练退出选项。它不会改变 Googlebot 抓取您网站的方式,也不会改变您在 Google Search 中的排名。它仅控制您的内容是否被用于训练 Google 的模型。

我应该屏蔽所有 AI 爬虫以保护我的内容吗?

通常不建议这样做。通用的屏蔽也会移除产生 AI 引用和推荐流量的搜索索引器。如果您有许可方面的顾虑,请专门屏蔽训练机器人,并保持搜索机器人开放。

为什么我的页面在 Google 中仍有排名,却从未出现在 AI 答案中?

最常见的原因是 robots.txt 规则或 CDN 默认设置在允许 Googlebot 的同时屏蔽了 AI 搜索索引器。页面保留在 Google 的索引中,但从未进入 AI 检索层,因此无法被引用。

这些机器人保证遵守 robots.txt 吗?

主要的 AI 搜索爬虫通常遵守 robots.txt,研究发现主要机器人的合规性很高。这正是意外屏蔽代价如此高昂的原因:爬虫会忠实地遵守它,包括您的错误。

---

核心要点

  • AI 厂商为训练和搜索运行独立的爬虫。 它们由 robots.txt 中不同的 User-agent 控制。
  • 屏蔽所有 AI 机器人现在是有害的。 它会将您从 AI 搜索引用(2026 年增长最快的推荐渠道)中移除。
  • 如果您愿意,可以屏蔽训练机器人,但始终允许搜索索引器 —— OAI-SearchBot、Claude-SearchBot、PerplexityBot 和 Bingbot。
  • 大多数屏蔽是意外发生的, 由托管默认设置、通用代码段或遗留规则引起。审计您实际屏蔽的内容。
  • Disallow 不是 noindex。 永远不要对同一个 URL 同时应用两者,对于 AI 搜索,请让索引器进入。
  • 访问只是第一步。 服务端渲染、一致的实体和结构化数据决定了您在可抓取后是否能被引用。

训练与搜索的分离是当今 AI 可见度中最重要但最不被理解的技术决策之一。它也是最容易做对的决策之一:robots.txt 中几行精确的代码就能区分一个 AI 可以引用的品牌和一个它甚至无法触达的品牌。审计您的爬虫访问权限并纠正意外屏蔽,是现代生成式引擎优化 (GEO) 计划中杠杆率最高的修复措施之一。

---

参考文献

  1. AI 爬虫访问控制:robots & llms.txt 决策矩阵 — digitalapplied.com
  2. 针对 AI 爬虫的 robots.txt:2026 设置指南 — okara.ai
  3. 前 12 大 LLM 爬虫及其功能(2026 目录) — hyperleap.ai
  4. AI 爬虫速查表:User-Agents 及是否屏蔽 — lawrencehitches.com
  5. 你应该屏蔽 AI 爬虫吗?robots.txt 决策指南 — guptadeepak.com
  6. AI 机器人 robots.txt 指南:GPTBot, ClaudeBot — soar.sh
  7. OpenAI 爬虫概览 — OpenAI Developers

Related Articles