HandyTools Hub

Robots.txt 生成器

可视化构建 robots.txt,按爬虫设置抓取规则

User-Agent 规则

全局设置

生成的 robots.txt

 

无需背诵语法,可视化生成符合规范的 robots.txt。按爬虫添加规则、屏蔽或放行指定路径、设置抓取延迟、指向站点地图。全程在浏览器本地运行,数据不上传。

如何使用

  • 选择预设: 从「放行全部」或「屏蔽全部」开始,或使用默认的通配规则。
  • 添加 User-agent:* 匹配所有爬虫,或从建议中选择 Googlebot、Bingbot 等具名爬虫。
  • 填写路径: 每行一条 Disallow 或 Allow 路径,路径必须以 / 开头。
  • 设置全局选项: 可选填抓取延迟(秒)和站点地图 URL。
  • 复制或下载: 复制生成的内容,或直接下载 robots.txt 并上传到网站根目录。

功能特性

  • 可视化规则编辑器,支持任意数量的 User-agent 分组
  • 内置知名爬虫建议(Googlebot、Bingbot、GPTBot 等)
  • 一键「放行全部」/「屏蔽全部」预设
  • 可选 Crawl-delay 与 Sitemap 指令
  • 实时校验空 User-agent、重复规则、非法路径和错误的站点地图 URL
  • 100% 本地处理,配置不会离开浏览器

理解 robots.txt 语法

robots.txt 由若干分组构成。每个分组以一行 User-agent 开头,指明规则适用的爬虫——* 匹配所有爬虫——后跟若干 DisallowAllow 行。路径按前缀匹配,所以 Disallow: /admin 会同时屏蔽 /admin/admin/users/administrator。空的 Disallow: 表示不做任何屏蔽,是「放行全部」的标准写法。以 # 开头的是注释,爬虫会忽略。请注意 robots.txt 是公开文件,任何人都能查看,因此不要指望用它隐藏敏感 URL——敏感内容请用身份验证保护。

使用场景

  • 新站上线: 放行所有爬虫并声明站点地图,加快收录。
  • 测试环境: 屏蔽所有爬虫,避免测试站出现在搜索结果里。
  • 节省抓取配额: 屏蔽筛选页、站内搜索结果页或无限日历页。
  • 管理 AI 爬虫: 单独为 GPTBot 或 CCBot 设置规则,不影响 Googlebot。
  • 限制激进爬虫: 为频繁抓取服务器的爬虫设置抓取延迟。

相关工具

常见问题

什么是 robots.txt 文件?

robots.txt 是放在网站根目录下的纯文本文件(例如 https://example.com/robots.txt),用于告诉网络爬虫哪些页面或目录可以抓取。它遵循机器人排除协议,像 Googlebot 这样守规矩的爬虫在抓取前会首先请求这个文件。

如何屏蔽所有爬虫?

使用「屏蔽全部」预设。它会生成 「User-agent: *」 加 「Disallow: /」,即要求所有爬虫不要访问任何页面,常用于测试或开发环境站点。

Allow 和 Disallow 有什么区别?

Disallow 告诉爬虫不要访问某个路径,Allow 则明确允许访问。Allow 主要用于在被禁止的目录中开通例外——例如 disallow /private/,但 allow /private/notice.html。对 Google 来说,最长(最具体)的匹配规则优先。

所有搜索引擎都支持 Crawl-delay 吗?

不是。Crawl-delay 是非标准指令,Bing、Yandex 等部分爬虫支持,但 Google 会忽略它。要限制 Googlebot 的抓取频率,请使用 Google Search Console 中的抓取速率设置。

为什么要加 Sitemap 行?

Sitemap 指令可以把爬虫引导到你的 XML 站点地图,帮助它们更快发现所有重要页面。它必须是绝对 URL,例如 https://example.com/sitemap.xml,并且可以写多行。

robots.txt 能让我的页面不出现在 Google 搜索结果里吗?

不可靠。robots.txt 只控制抓取,不控制索引。被屏蔽的页面如果被其他网站链接,仍可能出现在搜索结果中(不含描述)。要阻止索引,请改用 noindex meta 标签或密码保护。