SEO 与站长
robots.txt 生成与校验器
在浏览器中生成、校验和解析 robots.txt 爬虫规则,支持多个 User-agent 分组与 Sitemap URL。
生成规则
常用模板
User-agent 分组
粘贴并解析
调整规则后即可生成 robots.txt。
规则
如何使用 robots.txt 工具
在生成模式中编辑多个 User-agent 分组、Allow、Disallow 和 Crawl-delay,再添加多个 Sitemap;也可以填写非标准的 Host。粘贴现有文件后切换到解析模式,工具会保留标准规则的顺序、注释和重复分组,并对未知指令与结构问题给出提示。
语义与兼容性边界
robots.txt 是爬虫协定,不是权限、认证或安全控制。空的 Disallow 表示不禁止任何路径;Crawl-delay 并非所有爬虫支持;Host 不是标准指令,仅部分搜索引擎识别。
常见问题
空 Disallow 是什么意思?
例如 Disallow: 表示该 User-agent 没有被禁止的路径,相当于不添加 Disallow 限制;不要把它误读成屏蔽整个网站。
重复 User-agent 分组会怎样?
工具不会静默合并重复分组,会保留出现顺序并发出提示。不同爬虫对重复分组的处理可能不同,上线前请按目标爬虫文档确认。
Sitemap URL 有什么要求?
Sitemap 应是可公开访问的绝对 HTTP(S) URL,例如 https://example.com/sitemap.xml;相对路径和其他协议会被拒绝。