Generador de robots.txt
Crea un archivo robots.txt con reglas de allow y disallow por rastreador, un retraso de rastreo opcional y una referencia al sitemap.
Reglas
robots.txt
Usa * como user-agent para aplicar una regla a todos los rastreadores, o indica
un bot concreto como Googlebot. Disallow bloquea el rastreo de una ruta, Allow
lo permite explícitamente (útil para hacer una excepción dentro de una carpeta bloqueada).
Cómo funciona
El generador agrupa tus reglas por user-agent: si escribes tres reglas para Googlebot en filas
distintas, se combinan bajo una única línea User-agent: Googlebot, con cada grupo
separado por una línea en blanco tal como esperan los rastreadores. Las reglas con una ruta vacía
se omiten, y cada valor se limpia de saltos de línea antes de escribirse, para que pegar algo
inesperado en un campo no pueda inyectar una directiva adicional. La línea Sitemap va al final, y
el botón de descarga simplemente envuelve el texto en un Blob y simula un clic, sin ningún
servidor de por medio.
Dos cosas suelen confundir. Primero, Crawl-delay está aquí porque Bing y Yandex lo respetan, pero Googlebot lo ignora por completo desde que Google eliminó las directivas no compatibles en 2019; para Google, el ritmo de rastreo se gestiona desde Search Console. Segundo, y más importante: Disallow no elimina una página de los resultados de búsqueda, solo impide su rastreo. Una URL bloqueada puede seguir apareciendo indexada si otros sitios enlazan a ella, mostrada sin descripción. Si quieres que una página desaparezca del índice, haz lo contrario: deja que se rastree y añade una etiqueta noindex; bloquearla en robots.txt le impide a Google ver esa etiqueta.
Todo el archivo se genera en el JavaScript de esta página mientras escribes; nada se envía a ningún servidor, algo que puedes comprobar en la pestaña Red de las herramientas de desarrollador.
Preguntas frecuentes
¿El robots.txt bloquea realmente las páginas en Google?
Bloquea el rastreo, no necesariamente la indexación. Una URL no permitida (disallow) puede seguir apareciendo en los resultados de búsqueda (sin descripción) si otros sitios enlazan a ella. Para mantener una página completamente fuera de los resultados de búsqueda, usa en su lugar una meta etiqueta noindex, que requiere que la página sea rastreable.
¿Dónde tiene que ir el robots.txt?
En la raíz de tu dominio, exactamente en https://ejemplo.com/robots.txt, en ningún otro sitio. Los rastreadores no lo buscarán en una subcarpeta.
¿Qué significa un Disallow vacío?
Disallow: sin nada después significa "no bloquear nada", equivalente a permitir todo para ese user-agent. Ese es el valor por defecto con el que empieza esta herramienta para Allow: /.