搜索爬虫、训练爬虫、用户触发抓取怎么区分?何冬讲清GEO抓取设置
何冬说明AI搜索发现、模型训练和用户触发抓取的用途差异,帮助企业按自身内容政策设置robots.txt。

不要把所有AI机器人当成一类:有的用于搜索发现和引用,有的可能收集训练数据,还有的只在用户要求读取某个网址时访问。企业应该先决定内容政策,再按平台最新说明设置。
给网站做AI抓取检查时,客户通常先问一句:“到底该允许还是禁止?”如果不区分用途,这个问题答不了。
我更愿意先问内容是什么。公开产品资料、付费课程、客户文件和内部报价,本来就不该使用同一套访问策略。
搜索发现机器人
这类机器人服务于公开搜索、摘要或引用。OpenAI把OAI-SearchBot用于搜索发现,Anthropic也单独说明Claude-SearchBot。企业希望公开页面有机会进入相关搜索时,要检查是否误拦截这类访问。
训练机器人
训练用途需要单独决定。OpenAI的GPTBot和Anthropic的ClaudeBot,与搜索机器人并不是同一个名称。允许搜索,不等于必须允许潜在训练;反过来,一刀切禁止所有机器人,也可能损失搜索发现机会。
用户触发抓取
有些访问发生在用户明确要求AI打开一个页面时。Perplexity和Anthropic都把这类用途与常规搜索或训练分开说明。企业需要结合内容性质、版权和业务目标判断。
robots.txt不是保险柜
robots.txt是公开的协商规则。它不能代替登录、权限、WAF,也不能保护已经公开的客户电话、报价或内部文件。真正敏感的资料要从公开网站移除,或放进有身份验证的系统。
我给企业做检查时,会把内容先分为公开、内部、敏感三档,然后再看爬虫设置。顺序反过来,很容易以为写几行规则就解决了隐私问题。
修改前先做这份清单
- 列出准备公开给搜索和客户的页面。
- 确认哪些内容不希望用于潜在训练。
- 核对平台官方机器人名称和更新时间。
- 检查CDN、WAF和服务器日志是否误拦截。
- 保存修改前版本,发布后再测试真实返回。
不熟悉写法时,可以先用AI爬虫规则生成器形成草稿,再交给网站技术人员审核。更完整的边界在robots.txt、llms.txt与结构化数据说明中。