Skip to content
Generador de robots.txt
Tools

Generador de robots.txt

Nuevo

Crea un robots.txt válido con reglas allow/disallow y una línea de sitemap.

Quick presets
Generated robots.txt
Test a URL Check whether your rules allow or block a path — same longest-match logic Google uses.

Disallow blocks crawling, not indexing. A blocked URL can still appear in Google if other sites link to it. To remove a page from search results, keep it crawlable and add a noindex meta tag or X-Robots-Tag header. robots.txt is also a public file and is not a security measure — protect private pages with real authentication.

robots.txt syntax cheat-sheet
Directive What it does
User-agent: *Which crawler the rules apply to (* = all bots).
Disallow: /pathAsk crawlers not to crawl URLs that start with this path.
Allow: /pathPermit a path, typically an exception inside a disallowed area.
Crawl-delay: 10Seconds between requests. Bing & Yandex honor it; Google ignores it.
Sitemap: https://…Absolute URL of your sitemap. Can appear anywhere in the file.
*Wildcard — matches any sequence of characters in a path.
$Anchors a rule to the end of the URL, e.g. /*.pdf$.
#A comment — the rest of the line is ignored by crawlers.

Runs entirely in your browser. Nothing is uploaded.

Un generador de robots.txt gratuito que funciona en tu navegador

Este generador de robots.txt convierte un formulario sencillo en un archivo robots.txt válido — sin necesidad de memorizar la sintaxis ni instalar nada. Elige un preset o construye tus propias reglas de rastreo, observa cómo se ensambla el archivo en tiempo real, luego cópialo o descárgalo y colócalo en la raíz de tu sitio. Todo ocurre localmente en tu navegador, por lo que las reglas que escribes nunca se suben a ningún servidor.

Tanto si necesitas un ejemplo de robots.txt para empezar, un robots.txt personalizado para un rastreador específico, o un archivo ajustado para WordPress, Blogger o para bloquear bots de entrenamiento de IA, puedes tenerlo listo en segundos. El verificador de rutas integrado valida tus reglas antes de publicarlas — algo que la mayoría de los generadores de la competencia no ofrecen.

Construye reglas de rastreo sin memorizar la sintaxis

Cada grupo de reglas combina un User-agent con las rutas que deseas Allow (permitir) o Disallow (bloquear), más un Crawl-delay opcional. Usa * para apuntar a todos los rastreadores, o nombra un bot específico como Googlebot o Bingbot — empieza a escribir y el campo te sugiere los rastreadores más comunes. Añade tantos grupos como necesites para dar a cada bot reglas distintas.

Escribe una ruta por línea; la herramienta la formatea como una directiva Disallow: o Allow: correcta y une tus grupos en el orden adecuado. Añade la URL de tu Sitemap y se agrega como una línea Sitemap: absoluta que indica a los rastreadores todas las páginas que quieres que encuentren. El rastreador de Google recoge esta información y la usa junto con cualquier sitemap enviado directamente en Search Console.

Presets para WordPress, Blogger y bloqueo de bots de IA

Un clic carga un punto de partida listo para usar. Permitir todo y Bloquear todo cubren los dos extremos. WordPress carga el valor predeterminado recomendado: bloquear /wp-admin/ pero mantener abierto /wp-admin/admin-ajax.php para las llamadas AJAX que necesitan los plugins. Blogger carga la configuración sugerida por Google para Blogger: permitir todo excepto /search para evitar problemas de contenido duplicado.

El preset Bloquear bots de IA es útil si quieres que tu contenido permanezca en Google y Bing sin ser utilizado para entrenar modelos de IA. Bloquea GPTBot (OpenAI), CCBot (Common Crawl), Google-Extended (Gemini), ClaudeBot (Anthropic), PerplexityBot y otros — sin afectar a los rastreadores de búsqueda estándar. The New York Times, The Guardian y muchas grandes publicaciones añadieron bloqueos similares en 2023.

Prueba una URL antes de publicar

Un generador que no puede probarse a sí mismo solo hace la mitad del trabajo. El verificador de rutas integrado te permite introducir cualquier URL o ruta y un nombre de rastreador, y luego te indica si tus reglas actuales la permiten o la bloquean — y exactamente qué regla Allow o Disallow lo decide, usando la misma lógica de coincidencia más larga que aplica Google (la regla más específica gana, y Allow rompe un empate de igual longitud).

A medida que escribes, la herramienta también muestra advertencias en tiempo real sobre errores que rompen silenciosamente archivos robots.txt reales: una ruta sin su barra diagonal inicial, una URL de sitemap relativa, o un Crawl-delay dirigido a Googlebot (que lo ignora y requiere una configuración separada en Search Console). Corregir estos errores antes de publicar ahorra una vuelta de depuración a través de Google Search Console.

Rastreo vs indexación — y otros errores frecuentes

El mayor malentendido sobre robots.txt: Disallow elimina una página de Google. No es así. Detiene el rastreo, pero una URL bloqueada puede seguir apareciendo en los resultados de búsqueda si otras páginas enlazan a ella. Google incluso puede indexarla sin fragmento — solo una URL sin descripción. Para mantener una página fuera de la búsqueda, déjala rastreable y añade noindex en la propia página. Si la bloqueas en robots.txt, Google nunca podrá rastrear la página para ver ese noindex, y la URL puede permanecer en el índice indefinidamente.

Recuerda también que robots.txt es público y consultivo. Vive en una URL fija y legible, no es una barrera de seguridad, y solo los bots bien comportados la obedecen. Úsalo para gestionar el presupuesto de rastreo y ordenar las páginas duplicadas o de poco contenido — no para ocultar nada que realmente necesite protección. Para eso, usa autenticación. Este generador funciona completamente en tu navegador, por lo que las rutas internas de tu sitio nunca salen de tu dispositivo.

Frequently asked questions

¿Para qué sirve el archivo robots.txt?

robots.txt es un archivo de texto plano en la raíz de tu sitio que indica a los rastreadores de motores de búsqueda qué URLs pueden o no solicitar. Por ejemplo, Disallow: /carrito/ le pide a los rastreadores que omitan las páginas del carrito de compras para que gasten su presupuesto de rastreo en páginas que realmente importan para el SEO. Es parte del Protocolo de Exclusión de Robots (ahora estandarizado como RFC 9309) que respetan Google, Bing y otros rastreadores principales — pero controla el rastreo, no el acceso ni la seguridad. Cualquiera puede leer tu robots.txt en tusitio.com/robots.txt, por lo que no es una herramienta de privacidad.

¿Cómo creo un archivo robots.txt?

Usa el constructor de arriba: elige un preset o añade un grupo de reglas, establece el User-agent (usa * para todos los rastreadores), lista las rutas a Disallow o Allow, añade opcionalmente un Crawl-delay y pega la URL de tu Sitemap. La vista previa se actualiza mientras escribes — haz clic en Copiar o Descargar para guardarlo como robots.txt y luego súbelo a la carpeta raíz de tu sitio para que sea accesible en https://tusitio.com/robots.txt. No necesitas saber programar, y el verificador de rutas comprueba tus reglas antes de publicar.

¿Cómo se compara este generador con otros como technicalseo.com o seoptimer.com?

El generador de robots.txt de TechnicalSEO.com y SEOptimer producen archivos válidos, pero ninguno incluye un verificador de rutas integrado que muestre qué regla se aplica a una URL específica. Esta herramienta sí lo hace: introduce cualquier ruta y nombre de rastreador y te indica si tus reglas actuales la permiten o la bloquean, usando la misma lógica de coincidencia más larga que aplica Google. También detecta errores comunes en tiempo real — barras diagonales iniciales faltantes, URLs de sitemap relativas, Crawl-delay dirigido a Googlebot (que lo ignora). Todo funciona en tu navegador sin enviar datos a ningún servidor.

¿Dónde se coloca el archivo robots.txt?

Debe estar en el directorio raíz de tu dominio y servirse exactamente en https://tusitio.com/robots.txt — no en una subcarpeta como /blog/robots.txt, que los rastreadores ignoran. Cada subdominio necesita su propio archivo, por lo que blog.tusitio.com y tienda.tusitio.com requieren cada uno un robots.txt separado. En WordPress puedes subirlo por FTP o mediante el administrador de archivos de tu hosting (o usar un plugin como Yoast SEO que lo gestiona automáticamente). En Blogger lo activas bajo Configuración → Preferencias de búsqueda.

¿Qué es User-agent en robots.txt?

User-agent nombra al rastreador al que se aplica un bloque de reglas. User-agent: * apunta a todos los rastreadores, mientras que User-agent: Googlebot apunta solo al rastreador web principal de Google. Puedes tener varios grupos — por ejemplo, permitir a todos pero bloquear GPTBot — y cada rastreador obedece el grupo más específico que coincida con su nombre. Los valores más comunes incluyen Googlebot, Bingbot, Googlebot-Image, GPTBot (usado por OpenAI para entrenar ChatGPT), CCBot (Common Crawl, usado por muchos conjuntos de datos de entrenamiento de IA), Google-Extended (usado por Gemini de Google) y PerplexityBot.

¿Cuál es la diferencia entre Allow y Disallow?

Disallow le pide a un rastreador que no acceda a las URLs que coincidan; Allow las permite. Allow se usa principalmente para crear una excepción dentro de una carpeta bloqueada. Por ejemplo, Disallow: /wp-admin/ más Allow: /wp-admin/admin-ajax.php bloquea el área de administración de WordPress pero deja pasar el único archivo AJAX que los rastreadores necesitan. Cuando las reglas entran en conflicto, Google sigue la ruta de coincidencia más específica (más larga), y Allow gana un empate de igual longitud. Bing usa la misma lógica; Yandex es ligeramente diferente en casos límite.

¿Cómo añado un sitemap al robots.txt?

Añade una línea Sitemap: con la URL absoluta completa, por ejemplo Sitemap: https://ejemplo.com/sitemap.xml. Puede ir en cualquier parte del archivo y no está vinculada a ningún grupo User-agent, y puedes listar varios sitemaps en líneas separadas. Pega la URL en el campo Sitemap de arriba y la herramienta coloca la línea correctamente. La documentación de Google recomienda este enfoque junto con enviar el sitemap directamente en Search Console, ya que ambos métodos ayudan a Google a descubrir todas tus páginas.

¿Cómo bloqueo una página para que no aparezca en Google?

Para que Google no rastree una página, añade una regla Disallow: para su ruta, por ejemplo Disallow: /borrador-pagina/. Pero bloquear el rastreo no es lo mismo que eliminar una página de los resultados — una URL bloqueada puede seguir indexándose si otros sitios enlazan a ella. Para mantener realmente una página fuera de Google, añade una directiva noindex (meta name='robots' content='noindex') o una cabecera X-Robots-Tag, y no la bloquees en robots.txt, o Google no podrá rastrear la página para ver la instrucción noindex.

¿El robots.txt impide la indexación?

No. robots.txt controla el rastreo, no la indexación. Si bloqueas una URL con Disallow, Google no obtendrá su contenido, pero la URL en sí puede seguir apareciendo en los resultados — a menudo sin descripción — cuando está enlazada desde otro lugar. Para eliminar una página del índice, usa una directiva noindex en la propia página y deja la página rastreable para que Google pueda leer esa directiva. Este es uno de los errores SEO más comunes: la gente añade reglas Disallow para eliminar páginas de los resultados de búsqueda y luego se pregunta por qué siguen apareciendo.

¿Qué significa 'bloqueado por robots.txt' en Google Search Console?

En Google Search Console, 'Bloqueado por robots.txt' significa que Google descubrió una URL pero tu robots.txt le indicó que no rastreara esa URL, por lo que la página no se obtuvo ni se indexó en ese rastreo. Si la página debería ser pública, corrígelo eliminando o acotando la regla Disallow que coincide. Si el bloqueo es intencional — una ruta de administración, un entorno de staging o una página de poco contenido — es seguro dejarlo. Usa el verificador de rutas de este generador para ver exactamente qué regla está bloqueando una URL determinada antes de editar el archivo.

¿Qué es el crawl-delay?

Crawl-delay le pide a un rastreador que espere un número determinado de segundos entre solicitudes para aliviar la carga del servidor. Crawl-delay: 10 significa aproximadamente una solicitud cada 10 segundos. Bing y Yandex lo respetan; Googlebot ignora Crawl-delay por completo — configura la tasa de rastreo de Google en el informe de estadísticas de rastreo de Search Console. Solo añade Crawl-delay si tu servidor tiene problemas reales de carga por el rastreo, ya que un valor alto ralentiza la velocidad con la que se indexa tu sitio.

¿Cómo creo un robots.txt para WordPress o Blogger?

Haz clic en el preset de WordPress o Blogger de arriba. El archivo estándar de WordPress bloquea el área de administración pero mantiene el archivo Ajax que los rastreadores necesitan: User-agent: * / Disallow: /wp-admin/ / Allow: /wp-admin/admin-ajax.php. El valor predeterminado de Blogger permite todo excepto sus páginas de búsqueda: User-agent: * / Disallow: /search / Allow: /. Añade la URL de tu sitemap, luego copia el resultado en WordPress (mediante Yoast SEO o subiendo el archivo por FTP) o pégalo en Blogger bajo Configuración → Preferencias de búsqueda → robots.txt personalizado.

¿Cómo pruebo o valido mi robots.txt?

Usa el verificador de rutas de esta herramienta: introduce una URL o ruta (por ejemplo /blog/entrada-1) y un nombre de rastreador, y te indica si tus reglas actuales la permiten o la bloquean — y qué regla específica <code>Allow</code> o <code>Disallow</code> lo decide, usando la misma lógica de coincidencia más larga que aplica Google. El constructor también detecta errores comunes en tiempo real, como una ruta sin su barra diagonal inicial o una URL de sitemap relativa. Después de publicar, confirma el archivo activo en el informe de robots.txt de Google Search Console y usa la herramienta de inspección de URLs para comprobar páginas específicas.

¿Es seguro el robots.txt?

robots.txt es seguro de usar, pero no es una herramienta de seguridad. Es un archivo público que cualquiera puede leer en tusitio.com/robots.txt, así que listar una carpeta 'secreta' allí en realidad la anuncia a cualquiera que lo consulte. Los rastreadores bien comportados — Google, Bing, Apple — obedecen las reglas, pero los bots maliciosos pueden ignorarlas por completo. Para proteger páginas sensibles, usa autenticación real (inicio de sesión, contraseñas, lista de IPs permitidas) o controles de acceso en el servidor. Nunca te fíes de Disallow para ocultar datos privados.

¿Cómo bloqueo los bots de IA para que no entrenen con mi contenido?

Añade grupos User-agent separados para cada rastreador de entrenamiento de IA y Disallow: / para cada uno. Los principales son: GPTBot (OpenAI / ChatGPT), CCBot (Common Crawl, usado por muchos conjuntos de datos de entrenamiento de IA), Google-Extended (Gemini y Vertex AI de Google), ClaudeBot (Anthropic / Claude), PerplexityBot, Applebot-Extended y meta-externalagent (Meta / Llama). El preset 'Bloquear bots de IA' de este generador añade todos estos con un solo clic, sin afectar a los rastreadores de búsqueda normales (Googlebot, Bingbot) para que tu contenido siga indexado.