数力科技Digital Force
← 全部文章

要不要让 AI 爬虫抓你的网站

过去一年,越来越多的人在后台看到一串陌生的访客名字:GPTBotClaudeBotCCBotPerplexityBotGoogle-Extended。它们不是人,是各家 AI 公司派来读你网站的程序。于是一个问题冒出来:要不要把它们挡在门外?

网上的答案两极分化。一派说「它们在偷你的内容拿去训练,赶紧全部封掉」;另一派说「封了你就从 AI 的答案里消失了,等于自断客源」。两边说的都对,也都不完整——因为他们在说的根本不是同一种爬虫。

这篇文章想把这件事讲清楚:这些爬虫分几类、各自拦掉会发生什么、你这门生意到底该怎么选、以及技术上具体怎么配、怎么验证配对了。写得比一般文章长,因为这个决定一旦拍错,要么白白丢掉本该来的流量,要么把想保护的东西根本没保护住。


先分清两种爬虫,这是整件事的关键

把「AI 爬虫」当成一类东西,是所有误判的根源。它们其实至少是两拨人,目的完全不同。

第一种:训练爬虫。它们把你的网页抓回去,喂给下一代模型做训练素材。你的内容被「消化」进模型的参数里,之后有人问相关问题,模型可能凭记忆答出来——但通常不会告诉用户这句话来自你,也不会给链接。代表选手是 OpenAI 的 GPTBot、非营利的 CCBot(Common Crawl,几乎所有大模型都拿它的数据训练过)、以及 Google-ExtendedApplebot-Extended 这两个「训练开关」(下面会解释它们为什么特殊)。

第二种:检索爬虫(也叫实时爬虫)。它们是在有人正在提问的那一刻才来抓你的页面,抓完立刻拿去组织答案,而且通常会带上出处和链接。代表选手是 OAI-SearchBotChatGPT-User(ChatGPT 联网时用)、PerplexityBot、以及 Anthropic 用于实时取用的 Claude-User

看出区别了吗——

  • 拦掉训练爬虫,你损失的是「被写进模型记忆」的机会。这个损失是慢性的、间接的,而且有争议(有人根本不想被拿去训练)。
  • 拦掉检索爬虫,你损失的是「此刻有人正问到你这个行业、AI 却读不到你的网站」的机会。这个损失是即时的、直接的,而且往往就是本该点进来的那个客户。

绝大多数「我把 AI 爬虫全封了」的人,真正想拦的是第一种,却因为一刀切把第二种也拦了。结果是:他们没能阻止内容进入训练(下面会讲为什么),却实实在在地从 AI 的实时回答里消失了。这是最常见、也最亏的一种配错。

还有一个容易被忽略的第三类:搜索索引爬虫。比如 Google 自己的 Googlebot,它抓回去建的是搜索索引——而 Google 的 AI Overviews(搜索页顶部那段 AI 摘要)用的正是这个索引。也就是说,你为了「不被 AI 用」去封 Googlebot,等于把普通 Google 搜索也一起封了。这就是为什么 Google 单独造了 Google-Extended 这个词:它不是一只爬虫,而是一个信号——你在 robots.txt 里写它,Googlebot 照常来建搜索索引,但 Google 承诺不拿你的内容去训练 Gemini。Apple 的 Applebot-Extended 是同样的设计。

它们到底叫什么:一张对照清单

各家的爬虫名字和用途都写在自己的官方文档里,而且这份名单几个月就变一次。下面是写这篇文章时的主要角色,按「拦掉的后果」分组,方便你决策——不是让你背下来。

训练用(拦掉 = 不进模型记忆,不影响你在搜索和实时问答里的可见性):

  • GPTBot — OpenAI 的训练抓取。
  • CCBot — Common Crawl,公开数据集,被无数模型间接使用。拦它影响面最广。
  • Google-Extended — 不是爬虫,是「允不允许 Google 拿去训练 Gemini」的开关。
  • Applebot-Extended — 同上,对应 Apple 的 AI。
  • Meta-ExternalAgent — Meta(Facebook/Instagram 母公司)的 AI 训练抓取。
  • Bytespider — 字节跳动(TikTok 母公司)。名声不太好,下面单独说。
  • Amazonbotanthropic-ai 等 — 各家还有一些偏训练/研究用途的抓取。

检索 / 实时用(拦掉 = 从对应产品的 AI 实时回答里消失):

  • OAI-SearchBot — 给 ChatGPT 的搜索功能建索引。
  • ChatGPT-User — 用户在 ChatGPT 里让它「去查一下」时的实时取用。
  • PerplexityBot / Perplexity-User — Perplexity 的索引与实时取用。
  • Claude-User / Claude-SearchBot — Claude 联网与搜索时的取用。
  • DuckAssistBot — DuckDuckGo 的 AI 助手。

规律很清楚:名字里带 SearchUser 的,多半是检索侧,拦它们直接掉可见性;纯训练用的那批,拦不拦是另一笔账。但别把这条当铁律——命名不统一,同一家公司也可能一个爬虫兼两用(比如 ClaudeBot 历史上主要用于训练抓取)。真要精确,去查每家官方的爬虫文档,别信任何人凭记忆列的表,包括这一张。

那,你这门生意该怎么选

抛开立场之争,落到具体决策,其实只取决于一件事:你的内容本身是不是你卖的东西。

如果你是靠内容换客户的普通生意

牙医、装修、移民顾问、会计、餐馆、培训机构——绝大多数新西兰中小企业属于这一类。你的网站是获客工具,不是收费产品。别人看到你、了解你、然后联系你,这就是网站的全部价值。

对你来说,答案几乎一定是:检索爬虫全部放行,训练爬虫也基本没理由拦。逻辑是这样的——

  • 检索爬虫带来的是此刻正在找你这类服务的人。有人问 ChatGPT「奥克兰哪家做双语网站」,你希望它能读到你、提到你、给你链接。拦掉它就是把这个客户拱手让人。这部分没有任何权衡余地。
  • 训练爬虫看起来「白拿你内容」,但对获客型生意来说,被写进模型记忆其实是好事。它意味着以后有人不联网、直接问「新西兰做个企业网站大概多少钱」,模型也可能凭训练时的记忆答出跟你相关的信息。你的品牌名、你的价格区间、你的服务范围,越是反复出现在被训练的语料里,越容易在这种「不带出处」的回答里被顺带提到。
  • 你想保护的那点内容——首页的服务介绍、几篇博客——本来就是要尽可能多的人看到的。被 AI 摘要一下反而扩大了触达。你没有什么「不想被人知道」的独家内容需要藏。

所以对这类生意,我们的建议直接得有点无聊:什么都别拦,把力气花在让内容值得被引用上。怎么让内容值得被引用,是另一篇文章的事——GEO 讲的就是这个

如果你的内容就是你的产品

新闻媒体、付费研究、原创摄影、大量原创教程、菜谱站、深度评测站——这类生意不一样。别人「读到就够了、不用点进来、不用联系你」,你反而亏了,因为你的商业模式是靠内容本身变现(订阅、广告、授权)。

对这类站,纠结的点是真实的:训练爬虫把你多年积累的原创内容免费吃进模型,模型转手就能生成「差不多的东西」,而你一分钱、一次点击都拿不到。这也是好几家大型媒体去年集体封 GPTBot、甚至打官司的原因。

但即便是这类站,成熟的打法也不是一刀切全封,而是分开处理:

  • 训练爬虫可以考虑封(GPTBot、CCBot、Google-Extended、Applebot-Extended 等)——不让自己的核心资产免费进模型。
  • 检索爬虫仍然放行——因为 AI 实时回答时会带链接、会导流。你要的就是这个流量。把 PerplexityBot、OAI-SearchBot 也封了,是把送上门的读者赶走。

这套「拦训练、放检索」的组合,才是对内容有真实价值的站点该做的精细活。绝大多数中小企业不属于这一类——如果你在犹豫自己算不算,那基本就不算。

一个残酷的事实:robots.txt 拦不住真想抓的人

假设你决定要拦。这里必须先泼一盆冷水:robots.txt 是一张「请勿入内」的纸条,不是一道墙。

它的运作方式是「君子协定」——爬虫来的时候自愿先读一下你的 robots.txt,看到 Disallow自愿不抓。守规矩的大公司(OpenAI、Google、Anthropic)确实会遵守,这是它们的公开承诺,违背了要担舆论和法律风险。

但也有不那么守规矩的。Bytespider 就多次被安全公司和站长报告无视 robots.txt、照抓不误、而且抓得很凶。对这种爬虫,你在 robots.txt 里写一百行 Disallow 都没用——它根本不看,或者看了不理。

真想「拦住」而不是「请求别抓」,得靠更硬的手段:

  • 在边缘按 User-Agent 或 IP 直接拦截。比如 Cloudflare 现在有一键「屏蔽 AI 爬虫」的开关(Bot 管理 / AI Audit 里),它是在请求到达你服务器之前就按已知的 AI 爬虫特征拦掉,不依赖对方自觉。这才是真正意义上的「拦」。
  • 服务器层面的规则(Apache/Nginx 按 User-Agent 返回 403),原理类似,但 User-Agent 可以伪造,效果不如边缘识别。

所以完整的心智模型是:robots.txt 用来对守规矩的大厂表达你的意愿(并且对它们有效),Cloudflare 这类边缘拦截用来对付不守规矩的。只写前者就以为万事大吉,是常见的自我安慰。

另一笔常被忽略的账:服务器负载

就算你不在乎内容被不被训练,还有个更实际的理由可能让你想限一限爬虫:它们会消耗你的服务器资源。

一些 AI 爬虫抓得非常密集——短时间内成百上千次请求,把整个站从头到尾翻一遍,隔几天再来一遍。对不同的站,影响天差地别:

  • 静态站 + CDN(比如托管在 Cloudflare Pages 上的站)几乎不受影响。页面是提前生成好的纯文件,CDN 直接在边缘吐给爬虫,根本惊动不到你的源服务器。爬虫抓一万次,你的成本约等于零。这也是我们默认给客户用静态托管的附带好处之一。
  • 动态站(WordPress、带数据库的应用)受影响明显。爬虫每抓一个页面,你的服务器就得实时跑一遍 PHP、查一次数据库。密集抓取时,这跟一小波真实流量高峰没区别——在便宜的共享主机上,甚至可能拖慢正常访客。

如果你是后一种情况、又发现日志里某个爬虫抓得离谱,限速或拦掉它是纯粹的运维决定,跟「要不要被 AI 用」无关。这种时候优先拦那个具体的、抓得凶的 User-Agent,而不是无差别封所有 AI。

版权与「零点击」:值得想清楚,但别被吓住

反对放行 AI 爬虫的核心情绪,其实是这个:我辛苦写的东西,被 AI 一句话总结掉,用户看完就走,根本不来我网站。这个现象有个名字,叫「零点击」——答案在 AI 那里就给完了,你连一次访问都没得到。

这个担忧是真实的,但要分清它对谁是问题:

  • 如果你靠页面访问量变现(广告、订阅),零点击直接打击你的收入,值得认真对待。
  • 如果你靠转化变现(有人联系你、下单、预约),情况正相反——AI 帮你把「这家做什么、大概多少钱、靠不靠谱」先讲了一遍,筛过一轮的人才来找你,这些反而是更接近成交的客户。此时被总结不是损失,是免费的初筛。

换句话说,同样一件事,对媒体是威胁,对多数服务型生意是助攻。先搞清楚自己靠什么赚钱,再决定零点击是不是你的敌人——别跟着舆论一起恐慌。

具体怎么配

下面给三档配置,从「什么都不做」到「能拦的都拦」。robots.txt 放在网站根目录(你的域名/robots.txt),是纯文本。

第一档:全部放行(推荐给绝大多数中小企业)。你什么都不用做——没有 Disallow 就是默认允许。真正该做的正向动作是主动帮 AI 读懂你

  • 确保关键内容写在 HTML 里,别靠脚本画上去(多数爬虫不跑 JavaScript);
  • 把公司信息做成结构化数据
  • 放一份 llms.txt——网站根目录的一个纯文本文件,用最简洁的方式讲清你是做什么的、有哪些主要页面、服务和价格。它是 robots.txt 的「正面版」:robots.txt 说「别抓什么」,llms.txt 说「这些是重点,欢迎来看」。我们自己站上这份你可以直接打开参考,格式没有秘密。

第二档:只拒绝训练,保留搜索与实时问答(推荐给靠内容变现的站)。只封训练侧,把检索侧和搜索侧留着:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

User-agent: Bytespider
Disallow: /

注意这里没有OAI-SearchBotChatGPT-UserPerplexityBotGooglebot——所以你照样出现在 ChatGPT 联网搜索、Perplexity、以及普通 Google 里,只是不进各家的训练语料。这就是前面说的「拦训练、放检索」。

第三档:尽量拦掉所有 AI。在第二档基础上再加上检索侧那批(OAI-SearchBotChatGPT-UserPerplexityBot / Perplexity-UserClaude-User / Claude-SearchBotDuckAssistBot 等),每个都写一段 Disallow: /。但请牢记两条:一,这会让你从 AI 的实时回答里消失,对多数生意是自伤;二,它只对守规矩的爬虫有效,真要拦住 Bytespider 那种,还得靠上面说的 Cloudflare 边缘拦截。

额外一招:如果你只想拦某几个具体页面(比如某个不想被总结的深度内容)而不是整站,可以用 Disallow: /那个路径/ 精确到目录,其余照常放行。robots.txt 的粒度可以很细。

配完一定要验证:别信「我改了就生效了」

robots.txt 是最容易「以为配好了其实没生效」的东西——路径放错、语法写错、或者被缓存挡住,都会让你的规则形同虚设。花两分钟验证:

  • 先确认文件真的在、内容真的对。命令行跑 curl https://你的域名/robots.txt,看返回的是不是你写的那份。浏览器直接打开也行,但 curl 更干净、不受浏览器缓存干扰。(「我改了但没变化」通常就是缓存。)
  • 看看到底谁来过。如果你能拿到服务器访问日志,按 User-Agent 过滤一下就知道哪些 AI 爬虫真的来抓过、抓得多勤。这比任何猜测都实在——你可能会发现,你天天担心的那个爬虫根本没来,而某个没听过的抓得最凶。
  • 用真人的方式复测可见性。配置的最终目的是影响「AI 提不提你」。所以定期用潜在客户的问法去问 ChatGPT、Claude、Perplexity,看结果有没有变。这套自查怎么做,我们单独写过一篇

我们的立场,一句话

对新西兰绝大多数中小企业:别拦,把 AI 爬虫当成免费的曝光渠道,然后花力气让你的内容值得被它引用。你更可能因为「AI 读不到你」而吃亏,而不是因为「AI 读到了你」。

只有当你的内容本身就是你卖的产品时,「拦训练、放检索」才值得认真配;而无论哪种情况,如果你需要的是真拦住而不只是礼貌请求,robots.txt 不够,得配合边缘拦截。

最后一句最重要,也是这篇文章真正想说的:不要为了「保护」那些你其实巴不得更多人看到的内容,把送客上门的渠道亲手关掉。这是我们见过最多、也最可惜的一种误操作。

如果你不确定自己网站现在对 AI 爬虫是什么态度、或者想把可见性系统地测一遍,我们的 SEO 与 GEO 服务里就包含这块。当然,上面的方法你完全可以自己走一遍——都写全了。

Get started

开始一个项目先聊三十分钟

先聊聊你的想法,我们给你一份免费的方案建议。

AI 客服右下角气泡
所在地Auckland, NZ