Robots.txt 生成器

为不同爬虫设置 allow 和 disallow 规则,可选择添加抓取延迟和站点地图引用,生成 robots.txt 文件。

规则

robots.txt


          
        

user-agent 填 * 可以让规则应用于所有爬虫,也可以填写具体的爬虫名称,例如 Googlebot。Disallow 会阻止某个路径被抓取,Allow 则明确允许某个路径(适合在被禁止的 文件夹中开放个别例外)。

常见问题

robots.txt 真的能阻止 Google 收录页面吗?

它阻止的是抓取,而不一定是收录。如果有其他网站链接到某个被禁止抓取的网址,它仍然可能出现在搜索结果中(只是没有描述文字)。如果要彻底不让页面出现在搜索结果中,应改用 noindex meta 标签,而这需要页面本身是可以被抓取的。

robots.txt 应该放在哪里?

必须放在域名根目录,也就是 https://example.com/robots.txt,不能放在其他位置。爬虫不会去子文件夹中查找它。

空的 Disallow 是什么意思?

Disallow: 后面什么都不写,表示“禁止什么都不禁止”,也就是允许该 user-agent 抓取所有内容。这也是本工具默认从 Allow: / 开始的原因。