Robots.txt 生成器
为不同爬虫设置 allow 和 disallow 规则,可选择添加抓取延迟和站点地图引用,生成 robots.txt 文件。
规则
robots.txt
user-agent 填 * 可以让规则应用于所有爬虫,也可以填写具体的爬虫名称,例如
Googlebot。Disallow 会阻止某个路径被抓取,Allow 则明确允许某个路径(适合在被禁止的
文件夹中开放个别例外)。
常见问题
robots.txt 真的能阻止 Google 收录页面吗?
它阻止的是抓取,而不一定是收录。如果有其他网站链接到某个被禁止抓取的网址,它仍然可能出现在搜索结果中(只是没有描述文字)。如果要彻底不让页面出现在搜索结果中,应改用 noindex meta 标签,而这需要页面本身是可以被抓取的。
robots.txt 应该放在哪里?
必须放在域名根目录,也就是 https://example.com/robots.txt,不能放在其他位置。爬虫不会去子文件夹中查找它。
空的 Disallow 是什么意思?
Disallow: 后面什么都不写,表示“禁止什么都不禁止”,也就是允许该 user-agent 抓取所有内容。这也是本工具默认从 Allow: / 开始的原因。