Generador de robots.txt

Crea un archivo robots.txt con reglas de allow y disallow por rastreador, un retraso de rastreo opcional y una referencia al sitemap.

Reglas

robots.txt


          
        

Usa * como user-agent para aplicar una regla a todos los rastreadores, o indica un bot concreto como Googlebot. Disallow bloquea el rastreo de una ruta, Allow lo permite explícitamente (útil para hacer una excepción dentro de una carpeta bloqueada).

Cómo funciona

El generador agrupa tus reglas por user-agent: si escribes tres reglas para Googlebot en filas distintas, se combinan bajo una única línea User-agent: Googlebot, con cada grupo separado por una línea en blanco tal como esperan los rastreadores. Las reglas con una ruta vacía se omiten, y cada valor se limpia de saltos de línea antes de escribirse, para que pegar algo inesperado en un campo no pueda inyectar una directiva adicional. La línea Sitemap va al final, y el botón de descarga simplemente envuelve el texto en un Blob y simula un clic, sin ningún servidor de por medio.

Dos cosas suelen confundir. Primero, Crawl-delay está aquí porque Bing y Yandex lo respetan, pero Googlebot lo ignora por completo desde que Google eliminó las directivas no compatibles en 2019; para Google, el ritmo de rastreo se gestiona desde Search Console. Segundo, y más importante: Disallow no elimina una página de los resultados de búsqueda, solo impide su rastreo. Una URL bloqueada puede seguir apareciendo indexada si otros sitios enlazan a ella, mostrada sin descripción. Si quieres que una página desaparezca del índice, haz lo contrario: deja que se rastree y añade una etiqueta noindex; bloquearla en robots.txt le impide a Google ver esa etiqueta.

Todo el archivo se genera en el JavaScript de esta página mientras escribes; nada se envía a ningún servidor, algo que puedes comprobar en la pestaña Red de las herramientas de desarrollador.

Preguntas frecuentes

¿El robots.txt bloquea realmente las páginas en Google?

Bloquea el rastreo, no necesariamente la indexación. Una URL no permitida (disallow) puede seguir apareciendo en los resultados de búsqueda (sin descripción) si otros sitios enlazan a ella. Para mantener una página completamente fuera de los resultados de búsqueda, usa en su lugar una meta etiqueta noindex, que requiere que la página sea rastreable.

¿Dónde tiene que ir el robots.txt?

En la raíz de tu dominio, exactamente en https://ejemplo.com/robots.txt, en ningún otro sitio. Los rastreadores no lo buscarán en una subcarpeta.

¿Qué significa un Disallow vacío?

Disallow: sin nada después significa "no bloquear nada", equivalente a permitir todo para ese user-agent. Ese es el valor por defecto con el que empieza esta herramienta para Allow: /.