跳到主要内容

搜索与AI可见性 / 搜索基础

robots.txt(爬虫规则文件)

向爬虫表达可访问路径范围的根目录文本文件,用于管理抓取,不等于阻止收录或保护私密内容。

TimZhang踢木桩 Wiki术语信息

搜索与AI可见性 / 搜索基础

爬虫规则文件

robots.txt

术语信息

英文名称
robots.txt
内容类型
技术机制
适用主题
搜索与AI可见性 · 搜索基础

机制输入

  • 站点的公开路径与发布规则
  • 目标爬虫及需要控制的低价值路径
  • Sitemap 与页面索引策略

可检查的输出

  • 可复核的爬虫访问范围
  • 与索引和发现策略相协调的发布规则
  1. 01

  2. 02

  3. 03

  4. 04

采用与核验条件

  • /robots.txt 可直接访问,位于正确根目录并使用 UTF-8 文本。
  • 规则只阻断明确的低价值路径,重要产品页、资源和必要脚本保持可访问。
  • 需 noindex 的页面不被 robots.txt 阻断,页面或响应头能被爬虫读取。
  • Sitemap 指向完整 URL,迁移后同步检查主机和目录范围。

使用边界

何时值得纳入判断

  • 站点存在筛选、站内搜索、测试或重复路径,需要控制抓取预算。
  • 改版、域名迁移、生成 Sitemap 或调整可索引页面范围后。

判断时不宜据此推断

  • 阻止公开网页被搜索结果引用的可靠办法。
  • 保护报价、客户文件或后台数据的权限系统。
  • 把 Disallow 当成页面下架:URL 仍可能被外部链接发现,应改用 noindex、权限保护或删除。
  • 宽泛目录规则误拦 CSS、JavaScript 或产品页:会影响渲染与理解,应以真实 URL 样本回归测试。
  • 规则仅写在一个域名或协议上:不会自动覆盖其他主机,应逐个检查发布地址。

robots.txt 管理爬虫访问,不负责页面下架

robots.txt 告诉搜索引擎爬虫可访问哪些 URL,主要用于避免无价值路径带来过多请求。它可限制某些页面、文件或目录的抓取,但并不是让公开网页从 Google 搜索结果中消失的机制。

参考:Google Search Central

若其他网站仍链接到被阻止的 URL,搜索系统可能在未访问页面内容的情况下发现并显示该地址。真正需要移除公开页面时,应使用可被爬虫读取的 noindex、密码保护或删除资源,而不是仅添加 Disallow。

参考:Google Search Central;Google Search Central

规则按主机、爬虫和路径匹配

文件必须命名为 robots.txt 并放在站点根目录;它只影响所在协议、主机与端口下的 URL,不会自动覆盖子域名或其他协议。未被 Disallow 指定的路径默认允许抓取。

参考:Google Crawling Infrastructure

  1. 先列出需要控制的真实路径,例如站内搜索结果、临时预览目录或不重要的重复筛选 URL。
  2. 以 User-agent 定义目标爬虫,再使用 Disallow 限制目录;必要时用 Allow 放开被宽泛规则覆盖的子路径。
  3. 使用完整 URL 的 Sitemap 指令声明发现清单,并保留 UTF-8 编码与清晰注释。

把抓取、索引和渲染放在一次检查里

robots.txt 只解决爬虫是否请求资源。若页面需要 noindex,爬虫必须先能访问页面并读取 meta robots 或 X-Robots-Tag;同时设置 Disallow 和 noindex 往往会让 noindex 无法生效。

参考:Google Search Central

  • 直接访问 /robots.txt,确认返回的是可解析的 UTF-8 文本而非重定向、登录页或 HTML 错误页。
  • 抽查重要产品页、图片脚本和 Sitemap 是否没有被误拦,页面渲染仍保留必要资源。
  • 在 Search Console 的 URL Inspection 与索引报告中复核实际抓取、索引和 noindex 读取状态。

迁移和模板更新后重新验证规则

目录改名、语言站拆分、CMS 插件切换或新建下载中心后,旧规则可能继续阻断新页面或失去目标。把 robots.txt 与 URL 路由、Sitemap 生成和页面索引策略放在同一发布清单中,才能发现这种错配。

参考:Google Crawling Infrastructure

robots.txt 的规则由爬虫自愿遵守,不是安全边界。任何不能公开的客户资料、报价或后台接口,应通过登录、权限和服务器配置保护,而不是依赖抓取规则。

参考:Google Search Central

资料来源

以下资料支持本页的技术事实、口径或工作定义。

  1. 01
    Introduction to robots.txt

    Google Search Central · 核验于 2026年8月10日

  2. 02
    How to write and submit a robots.txt file

    Google Crawling Infrastructure · 核验于 2026年8月10日

  3. 03
    Block Search indexing with noindex

    Google Search Central · 核验于 2026年8月10日

作者与复核

作者:Tim Zhang

最后复核:2026年8月10日

相关概念