Generador de robots.txt: arma el archivo y prueba cada regla
Elige el tipo de sitio, ajusta las rutas y llévate el robots.txt listo para la raíz del dominio. Justo abajo, un probador te dice qué pasa con una URL concreta: qué grupo decidió, qué regla ganó y por qué. Gratis, sin registro, y nada sale de tu navegador.
Tu robots.txt
Probar una URL contra este archivo
-
Pega la ruta o la URL completa. El veredicto sigue la regla del protocolo: grupo más específico primero, luego patrón más largo.
El archivo en números
- - grupos
- - reglas
- - bloqueos
- - excepciones
- - sitemaps
- - tamaño
Comprobaciones
Todo corre en tu navegador: ni las rutas ni el archivo salen de aquí, y no se visita ninguna URL. El probador aplica las reglas del protocolo sobre el texto generado, igual que hace el rastreador. Recuerda que robots.txt controla el RASTREO, no la indexación: una URL bloqueada aquí todavía puede aparecer en la búsqueda si alguien la enlaza.
Para quién es esta página: para quien necesita controlar qué rutas del sitio pueden rastrearse, ya sea para sacar los filtros del catálogo, la búsqueda interna y el área de cuenta del camino del buscador, ya sea para cerrar un entorno de staging. Si tu pregunta es la otra, qué robots de IA pueden entrenar, citar o buscar tu contenido, el lugar correcto es el generador de robots.txt para bots de IA, que trata el mismo archivo desde el ángulo de la política de acceso. Las dos páginas generan un robots.txt completo porque el archivo es uno solo; lo que cambia es la decisión que cada una ayuda a tomar. Para el resto del head de la página, usa el generador de meta tags.
La regla que decide no es la primera, es la más larga
Casi todo generador de robots.txt entrega un bloque de texto y desaparece. El problema es que el archivo no se lee de arriba abajo como un guion: es un conjunto de patrones que compiten entre sí, y quien lo escribe a mano lo descubre tarde, cuando una sección entera del sitio desapareció del índice y nadie sabe qué línea lo hizo. Por eso esta herramienta tiene dos mitades. La de arriba arma el archivo; la de abajo responde la pregunta que de verdad importa, que es qué pasa con una URL concreta.
Tres reglas explican casi todo comportamiento inesperado. La primera: un rastreador obedece un solo grupo, el más específico que casa con su nombre, e ignora los demás por completo. La segunda: dentro del grupo gana el patrón más largo, con el Allow llevándose el empate. La tercera: la ausencia de regla es permiso, o sea, lo que nadie prohibió está permitido. Juntas explican por qué mover líneas de lugar nunca arregla nada y por qué abrir un grupo para un bot puede liberar justo lo que querías cerrar.
Cómo usarla
- Elige el tipo de sitio. El preset rellena la lista con el borrador de esa plataforma, y es punto de partida, no verdad: cada instalación tiene sus rutas.
- Ajusta las rutas bloqueadas, una por línea. Puedes pegar la URL entera y la ruta se extrae sola, lo que evita el error clásico de escribir una regla que empieza con https.
- Usa las excepciones para abrir una dirección dentro de una carpeta cerrada. Ganan al bloqueo porque el patrón es más largo, no por estar en otra línea.
- Declara el sitemap con URL absoluta. Esa línea no pertenece a ningún grupo y vale para todos los rastreadores.
- Prueba en el cuadro de abajo: elige un rastreador, pega una ruta y lee el veredicto. Repite con las URLs que no puedes fallar, como la página de producto, el sitemap y un archivo CSS del tema.
Cómo funciona: el emparejamiento de patrones, término a término
El probador aplica el algoritmo del protocolo sobre el texto que está en el cuadro de salida, y no sobre los campos del formulario. Es a propósito: pruebas el archivo que vas a publicar, con las mismas ambigüedades que encontrará el rastreador.
El largo del patrón es literal, contado carácter a carácter. Disallow: /wp-admin/ tiene 10 caracteres; Allow: /wp-admin/admin-ajax.php tiene 24. Como 24 es mayor que 10, ese archivo concreto queda abierto dentro de una carpeta cerrada, y vale aunque el Allow esté escrito después. Guarda ese número: es lo que ves en el probador cuando dos reglas compiten.
Ejemplo trabajado (reproduce el resultado por defecto)
La herramienta abre con el preset de WordPress y un sitemap declarado. Revisando el panel de números, ítem por ítem:
- 1 grupo y 5 reglas: solo existe el User-agent asterisco, con cuatro bloqueos y una excepción.
- 4 bloqueos: la carpeta de administración, la pantalla de login, la búsqueda interna y el parámetro de respuesta a comentarios, que es el multiplicador silencioso de URLs duplicadas en WordPress.
- 1 excepción y 1 sitemap. Ninguna comprobación encendida, porque nada aquí está en conflicto.
Ahora mira el probador, que ya viene con Googlebot y la ruta /wp-admin/admin-ajax.php. El veredicto es Permitido, decidido por Allow: /wp-admin/admin-ajax.php, y la línea de abajo informa que 2 reglas casaron. Esas dos son el Disallow de la carpeta y el Allow del archivo: ganó la más larga. Ese es el mecanismo entero en una sola línea.
Cambia la ruta por /wp-admin/options.php, sin tocar nada más. El veredicto pasa a Bloqueado, decidido por Disallow: /wp-admin/, y ahora solo una regla casó, porque la excepción es específica de un archivo. Cámbiala otra vez por /blog/entrada-nueva/ y el veredicto vuelve a Permitido, esta vez sin ninguna regla involucrada: el cuadro dice que nada casó, que es la tercera regla del protocolo en acción.
Por último, agrega la línea /*.css a la lista de bloqueadas, un intento habitual de ahorrar rastreo. Los números pasan a 6 reglas y 5 bloqueos, y se enciende una comprobación en rojo que nombra dos recursos de la muestra que quedaron inaccesibles: la hoja de estilos del tema y el CSS de build. Es el aviso más útil de la página, porque ese error no genera ningún error en ninguna parte: solo cambia lo que ve el buscador.
Cómo interpretar cada número
Grupos es cuántos bloques de User-agent tiene el archivo. Mientras sea 1, todo rastreador sigue las mismas reglas y el archivo es fácil de mantener. A partir de 2, revisa agente por agente en el probador, porque cada grupo nuevo apaga el general para quien cae en él.
Bloqueos contra excepciones describe la forma del archivo. Muchas excepciones suelen ser síntoma de un bloqueo demasiado amplio más arriba: en vez de cerrar una carpeta entera y reabrir cinco direcciones, casi siempre es más simple cerrar las cinco rutas que de verdad estorban.
Tamaño rara vez importa, pero tiene techo: Google lee los primeros 500 KB e ignora el resto. Un archivo cerca de eso se convirtió en una lista de exclusión generada por script, y esa lógica pertenece a los patrones de URL, no al robots.txt.
Las comprobaciones no restan ninguna nota, porque aquí no hay nota. Bloquear el checkout no es mejor ni peor que permitirlo: depende del sitio. Lo que la herramienta verifica es coherencia, o sea, los casos en que el archivo hace algo distinto de lo que quisiste decir.
Límites conocidos
La herramienta comprueba lógica, no existencia. No visita tu sitio, no sabe si /carrito/ existe y no sabe si esa ruta ya lleva un noindex. Después de publicar, confirma en el informe de indexación de páginas de Search Console y en la prueba de URL en vivo, que es donde aparece el rastreo real.
También conviene saber qué no hace el archivo. No quita nada del índice, no protege ningún área privada y no es obligatorio: quien quiera ignorarlo lo ignora, porque la obediencia es voluntaria y solo los rastreadores serios se comprometen. Y distingue mayúsculas de minúsculas en las rutas, así que /Blog/ y /blog/ son cosas distintas para una regla, aunque tu servidor trate ambas como la misma página.
Por último, el emparejamiento que aplica esta página es el de Google, que es también el publicado como RFC 9309. Bing y Yandex siguen el mismo diseño en lo esencial, con diferencias en puntos secundarios, y el Crawl-delay es justamente uno de ellos. Si tu tráfico viene de un buscador fuera de esa lista, pruébalo también en su herramienta oficial antes de confiar en este resultado.
Del archivo publicado a la prueba en vivo
Controlar el rastreo es el comienzo. Lo que decide el resultado es qué pasa con quien llega:
- Decide la política de entrenamiento y citación por IA en el generador de robots.txt para bots de IA, el mismo archivo desde el otro ángulo.
- Entrega a los modelos el mapa curado de tu sitio con el generador de llms.txt.
- Si el sitio tiene versiones en más de un idioma, arma la malla en el generador de hreflang.
- Mira cómo aparece tu resultado en la búsqueda, con el punto exacto del corte, en el simulador de SERP.
- Antes de cambiar una página por otra creyendo que convierte más, revisa cuánto tráfico exige la prueba en la calculadora de tamaño de muestra.
Preguntas frecuentes
- ¿Bloquear una página en robots.txt la saca de Google?
- No necesariamente, y esta es la confusión más cara del archivo. El robots.txt controla el rastreo, no la indexación: le pide al rastreador que no descargue esa URL. Si otras páginas la enlazan, la dirección todavía puede aparecer en la búsqueda, sin descripción y con el aviso de que el contenido no pudo leerse. Para sacar una página del índice el instrumento es la meta robots con noindex, o la cabecera X-Robots-Tag. Y hay una trampa al combinar los dos: si bloqueas la URL en el robots.txt, el rastreador nunca descargará la página y nunca verá el noindex que pusiste en ella. Para eliminarla, permite el rastreo y aplica noindex; solo después de que la eliminación ocurra tiene sentido bloquear la ruta.
- ¿El orden de las líneas cambia el resultado?
- No lo cambia. Dentro de un grupo gana la regla cuyo patrón es más largo, no la que aparece primero. Un empate exacto entre un Allow y un Disallow del mismo tamaño se resuelve a favor del Allow. Por eso Allow: /wp-admin/admin-ajax.php abre ese archivo aunque esté escrito después de Disallow: /wp-admin/, y por eso también mover líneas de lugar para arreglar un comportamiento nunca funciona. Lo que cambia el resultado es el largo del patrón. El probador de esta página muestra qué regla ganó y cuántas compitieron, justamente para que dejes de adivinar.
- ¿Qué pasa si abro un grupo para Googlebot?
- Pasa a obedecer solo ese grupo e ignora el grupo general por completo. Esta es la regla que más rompe archivos en la práctica: alguien quiere darle a Googlebot un permiso extra, escribe un grupo de dos líneas y sin notarlo le abre toda el área privada que estaba cerrada en el User-agent asterisco. Si de verdad necesitas un grupo específico, repite dentro de él los bloqueos que deben seguir valiendo. En el probador, elige el agente y lee la línea del grupo aplicado: dice qué grupo decidió la URL.
- ¿Puedo usar expresiones regulares en las rutas?
- No. Existen exactamente dos comodines: el asterisco, que casa con cualquier secuencia de caracteres, y el signo de dólar, que ancla el final de la URL. Todo lo demás es literal, incluidos el punto, la interrogación, los paréntesis y los corchetes. Eso significa que /*.pdf no es lo mismo que /*.pdf$: el primero también casa con /manual.pdf.html, porque sin el ancla el patrón solo necesita aparecer en algún punto de la ruta. Un asterisco al final del patrón es inofensivo e inútil, ya que el emparejamiento siempre fue por prefijo. La herramienta señala los dos casos.
- ¿Bloquear CSS y JavaScript ahorra rastreo?
- Ahorra ancho de banda y cuesta posiciones, lo que rara vez compensa. El buscador renderiza la página como un navegador para saber qué muestra de verdad: sin hoja de estilos y sin scripts ve un esqueleto que puede no tener el contenido principal, puede parecer roto en la prueba de móvil y puede perder bloques enteros cargados en el cliente. El efecto no es inmediato ni aparece como error; llega semanas después, como una caída sin causa visible. Esta herramienta prueba una muestra de rutas típicas de tema, de carpeta de assets y de build, y avisa cuando alguna regla atrapó una de ellas.
- ¿Crawl-delay funciona en Google?
- No. Google ignora la directiva y ajusta la tasa de rastreo por su cuenta, mirando cómo responde tu servidor; cuando de verdad quieras reducirla, el lugar es Search Console. Bing y Yandex sí respetan la línea. Conviene recordar que Crawl-delay es el remedio equivocado para un servidor lento: espacia al bot que obedece y no hace nada con el tráfico real, que suele ser la causa. Si el problema es carga, el lugar de resolverlo es la caché y la infraestructura.
- ¿El robots.txt sirve para proteger un área privada?
- No sirve, y usarlo así empeora las cosas. El archivo es público, vive en una dirección fija y es lo primero que abre cualquier persona curiosa en tu sitio. Listar /admin-secreto/ ahí es publicar un mapa de los lugares que quieres esconder, y los rastreadores malintencionados simplemente ignoran el pedido, porque obedecer es voluntario. Un área que no puede verse se protege con autenticación, no con una línea de texto pidiendo amablemente que no entren.
- ¿Necesito declarar el sitemap aquí si ya lo envié en Search Console?
- Sí, y es barato. La línea Sitemap no pertenece a ningún grupo: vale para todos los rastreadores, incluidos los que no tienen panel donde puedas enviar nada, como Bing, DuckDuckGo y los agentes de IA que hoy traen tráfico. Enviarlo en Search Console lo resuelve solo para Google. La línea exige una URL absoluta, con protocolo y dominio, y es el único ítem del archivo que ayuda activamente a quien rastrea bien, en vez de solo restringir.
- ¿Lo que escribo aquí queda guardado en algún lado?
- No. Todo corre en JavaScript en tu navegador: el archivo se arma, se vuelve a leer y se prueba en tu máquina, sin ninguna llamada de red, y nada se guarda ni se registra. La herramienta tampoco visita tu sitio, o sea, comprueba la lógica de las reglas que escribiste y no la existencia de las rutas. Eso importa cuando la lista revela la estructura interna de un proyecto que todavía no salió al aire. Puedes confirmarlo abriendo la pestaña de red mientras escribes: no sale ninguna petición.
Sigue leyendo
Para entender qué cambia entre optimizar para búsqueda y optimizar para conversión, sigue por CRO y SEO, qué cambia en cada uno, mira la guía de GEO en 2026 y aprende a armar bloques citables en FAQ para citación por IA.