Robots.txt 检查器
robots 策略检查
抓取站点 robots.txt,解析 User-agent 分组,并立即验证某个路径是否允许抓取。
在线检查 robots.txt,某条路径能不能抓马上看清。
相关推荐
适用场景
- 页面不收录时测试对应路径是否被 robots.txt 误封
- 网站改版后验证新爬虫规则是否按预期生效
- 提取 Sitemap 声明确认站点地图地址是否正确配置
- 检查 Host 指令是否指定了正确的首选域名
- 排查多个 User-agent 组之间规则冲突或覆盖问题
使用方法
- 输入网站 URL(如 https://geekformat.com)
- 设置要测试的 User-agent(如 Googlebot、*)和目标路径(如 /admin)
- 点击获取 robots.txt 查看解析结果
- 查看权限判断结果、匹配规则组和详细原因说明
- 检查 Sitemap 声明和完整规则结构用于 SEO 排查
功能特点
- 路径抓取权限测试:输入 User-agent 和路径,即时判断该爬虫是否允许访问并显示匹配规则
- 规则分组结构化展示:每个 User-agent 组独立展示,Allow/Disallow 规则逐条列出
- Sitemap 和 Host 声明提取:自动识别并单独展示站点地图地址和首选域名指令
- 预设一键切换:内置常用站点、爬虫名称和测试路径,点击即可填充快速测试
- 完整原始文件预览:支持原始 robots.txt 内容查看和一键复制
常见问题
怎么判断某个页面是否被 robots.txt 禁止抓取?
输入目标 URL、User-agent(如 Googlebot)和路径后,工具会结合当前规则判断该爬虫是否允许访问,并显示匹配的规则组和原因说明。
页面没收录,真的可能是 robots.txt 的问题吗?
有可能。如果 robots.txt 的 Disallow 规则禁止了相关目录或路径,搜索引擎爬虫将无法正常抓取页面内容。先检查规则是否误伤是很有必要的排查步骤。
如何查看站点声明的 Sitemap 地址?
工具会自动提取 robots.txt 中所有 Sitemap 声明并单独展示,方便确认站点地图地址是否正确配置,帮助搜索引擎更快发现全站结构。
匹配的规则组是什么意思?
robots.txt 中每个 User-agent 对应一组 Allow/Disallow 规则。工具会显示测试路径匹配到了哪些 User-agent 组的规则,帮助理解爬虫实际遵循的抓取策略。
适合网站上线后定期检查吗?
适合。尤其是站点改版、目录调整、CMS 更新后,建议重新检查 robots.txt 规则是否发生意外变化,避免重要页面被误封或敏感目录被暴露。
- Authentication Header Generator
- Cache-Control Parser
- Content-Disposition 解析器
- CORS Header Builder
- CORS跨域检查器
- CSP Builder
- cURL 转代码生成器
- DNS 全球传播检查
- DNS查询
- Forwarded Header Parser
- Hreflang Generator
- HSTS Analyzer
- HTTP Cookie解析器
- HTTP Headers Checker
- HTTP 请求测试器
- HTTP状态码查询
- IP 归属地查询
- IPv4 转换器
- IPv4 Range Expander
- IPv6 工具箱
- Link Header 解析器
- MX 查找
- 端口检查器
- URL 参数生成器
- Rate Limit Header 解析器
- 重定向链检查器
- Robots.txt 生成器
- Robots.txt 检查器
- Security Headers Checker
- Security.txt 生成器
- Set-Cookie解析器
- Site Network Audit
- Sitemap 生成器
- Sitemap Inspector
- SSL证书检测
- 子网计算器
- URL 解析器
- User-Agent解析器
- UTM 链接生成器
- WebSocket测试
- 我的 IP 是什么?
- WHOIS查询