Генератор robots.txt
Создайте файл robots.txt с правилами allow и disallow для каждого робота, необязательной задержкой сканирования и ссылкой на sitemap.
Правила
robots.txt
Используйте * как user-agent, чтобы применить правило ко всем роботам, или укажите
конкретного бота, например Googlebot. Disallow блокирует сканирование пути, Allow
явно разрешает его (полезно для исключения внутри заблокированной папки).
Как это работает
Генератор группирует ваши правила по user-agent, поэтому три правила, написанные для Googlebot в трёх отдельных строках, объединяются под одной строкой User-agent: Googlebot, а каждая группа разделяется пустой строкой, как ожидают парсеры. Правила с пустым путём игнорируются. Если вы удалите все правила, результат вернётся к User-agent: * с пустым Disallow: — это правильный способ сказать «ничего не блокировать».
Две вещи о robots.txt обычно сбивают людей с толку. Во-первых, Crawl-delay есть в этом инструменте, потому что его учитывают Bing и Yandex, но Googlebot полностью его игнорирует — Google официально прекратил поддержку неподдерживаемых директив в 2019 году. Во-вторых, и это важнее: Disallow не убирает страницу из результатов поиска, он лишь останавливает сканирование. Заблокированный URL всё равно может быть проиндексирован из-за входящих ссылок, просто он появится без описания. Если нужно полностью убрать страницу из индекса, сделайте наоборот: разрешите сканирование и поставьте на этой странице тег noindex.
Файл полностью собирается в JavaScript этой страницы по мере ввода. Ваши пути и имена ботов никогда никуда не отправляются, что можно проверить во вкладке «Сеть» инструментов разработчика.
Частые вопросы
Действительно ли robots.txt блокирует страницы в Google?
Он блокирует сканирование, но не обязательно индексацию. Запрещённый (disallow) URL может по-прежнему появляться в результатах поиска (без описания), если на него ссылаются другие сайты. Чтобы полностью убрать страницу из результатов поиска, используйте мета-тег noindex, для которого страница должна оставаться доступной для сканирования.
Куда нужно поместить robots.txt?
В корень вашего домена, ровно по адресу https://example.com/robots.txt, и больше нигде. Роботы не будут искать его в подпапке.
Что означает пустой Disallow?
Disallow: без значения после двоеточия означает «ничего не блокировать», то есть разрешает всё для этого user-agent. Именно с таким значением по умолчанию этот инструмент запускается для Allow: /.