开发工具 125文本工具 40编码加密 40图片文件 66查询工具 46计算转换 57站长工具 57生活工具 55娱乐工具 39金融理财 45
首页/站长工具/robots.txt 检测

robots.txt 检测

在线 robots.txt 检测工具。粘贴 robots.txt 内容,自动按爬虫分组解析所有 Disallow、Allow、Crawl-delay 与 Sitemap 指令,标出语法错误、全站屏蔽风险与通配符用法是否合规。

本地运行 · 数据不上传 站长工具 免费 · 无需注册
粘贴 robots.txt 内容
处理结果

使用说明

  1. 把 robots.txt 的内容粘贴进来,点「开始分析」。
  2. 工具会按 User-agent 分组,统计每组的 Disallow、Allow 条数和 Crawl-delay 设置。
  3. 出现 Disallow: / 时会醒目提示「该块屏蔽了全站」——这是最常见的误操作,配错一个通配符就能让整站消失。
  4. 语法错误(少冒号、指令拼错、没有归属的规则)会单独列出来并标出行号。
  5. 最后检查 Sitemap 声明,没有的话会建议补上完整地址。

常见问题

为什么我的规则块被拆成了好几个?
robots.txt 的规则是「跟着最近的 User-agent 走」的。如果出现了一条规则,后面又写了新的 User-agent,就会开始新的一块。工具按这个真实语义解析,所以块的数量和你写的位置有关,合并连续的 User-agent 行可以少建块。
Allow 一定优先于 Disallow 吗?
在 Google 和 Bing 里是的,匹配最长的规则优先,长度相同时 Allow 优先。但百度对 Allow 的支持不如这两家完整。最保险的做法是别让两者产生冲突,把规则写得干脆一点。
通配符 * 和 $ 能用吗?
Google、Bing 完全支持;百度部分支持,行为不完全一致。如果只是屏蔽普通目录,用最朴素的路径写法兼容性最好。工具会在检测到通配符时提醒你这一点。
Crawl-delay 还有用吗?
Google 已明确声明忽略它;Yandex、Bing 部分支持;百度在抓取压力大时会参考。真正想控制抓取频率,应该在搜索资源平台里设置抓取频次,而不是依赖这个指令。
哪些是合法指令?
常见的就是 User-agent、Disallow、Allow、Sitemap、Crawl-delay,加上 Yandex 专用的 Host 和 Clean-param。其他指令写了搜索引擎会忽略,工具会把这些不认识的指令单独列出来提醒你。

相关工具

站长工具 · 该分类共 57 个工具,展开查看全部