robots.txt、llms.txt和结构化数据对GEO分别有什么用?

robots.txt控制抓取,llms.txt提供内容目录,结构化数据表达页面实体。何冬说明三者在GEO官网中的作用与边界。

robots.txt、llms.txt和结构化数据在GEO官网中的不同作用示意图
三者不能互相替代:robots.txt主要表达抓取访问规则,llms.txt是网站内容索引提案,结构化数据把页面已有事实表达为机器可读字段。它们都不能替代准确正文、内部链接和正常索引。

robots.txt:控制哪些爬虫可以访问

robots.txt位于网站根目录,用User-agent和Allow或Disallow表达抓取规则。OpenAI说明OAI-SearchBot与ChatGPT搜索内容发现相关,GPTBot与潜在模型训练控制相关,可以分别设置。规则还可能受CDN、防火墙和页面noindex影响。

llms.txt:提供简短的网站内容目录

llms.txt目前是一项公开提案,通常使用简洁Markdown列出网站说明和重要页面。它可以作为补充目录,但不是抓取授权文件,也没有统一证据证明发布后会直接提高引用。详细内容仍应放在普通网页中。

结构化数据:表达页面已经公开的关系

Organization、Person、Article、BreadcrumbList等类型可说明企业、人物、文章和路径关系。代码必须与页面上真实可见内容一致,不应添加网页中没有的资质、评分、案例或联系方式。

正确实施顺序

  1. 先保证页面可访问、正文完整且有站内链接。
  2. 核对robots.txt、noindex、canonical和站点地图。
  3. 根据可见内容添加必要结构化数据并验证。
  4. 需要时增加llms.txt简要目录。
  5. 通过日志、搜索平台和固定问题持续观察。

可以直接使用哪些工具

何冬整理了AI爬虫robots.txt规则生成器、llms.txt生成器、Organization生成器和FAQPage生成器。生成结果是编辑底稿,上线前仍需网站人员与现有代码合并。

参考资料:OpenAI发布者与开发者FAQ;Schema.org;llms.txt提案。