Herramienta

Generador de robots.txt para bots de IA

Elige qué puede hacer cada agente de IA con tu sitio: entrenar un modelo, indexarte para que las respuestas te citen con enlace, o buscar la página cuando una persona pregunta. Cubre 25 agentes documentados, escribe el archivo entero y avisa cuando tu política dice una cosa y el archivo hace otra. Gratis, sin registro, y nada sale de tu navegador.

Generador de robots.txt para bots de IA
Empieza por una postura
El preset solo rellena la tabla de abajo. Después cada agente es tuyo: marca para permitir, desmarca para bloquear.

Entrenamiento de modelos

Rastrean para formar corpus de entrenamiento. No recibes visita ni crédito: es el único grupo en el que bloquear no cuesta tráfico.

  • entrenamiento y respuesta
  • solo rechaza entrenamiento
  • puede ignorar el archivo

Búsqueda y citación

Indexan para responder con un enlace hacia ti. Por aquí llega el tráfico que viene de la IA, así que bloquear cuesta visibilidad.

  • búsqueda clásica
  • búsqueda clásica
  • búsqueda clásica

Búsqueda a pedido de una persona

Abren tu página porque alguien preguntó en ese instante. Es lo más parecido a una visita que existe en este mundo.

  • solo cuando lo piden
  • solo cuando lo piden
  • solo cuando lo pidenpuede ignorar el archivo
  • solo cuando lo piden
  • solo cuando lo piden

Qué hace esta política

  • - agentes que pueden citarte, permitidos
  • - rastreadores de entrenamiento bloqueados
  • - grupos en el archivo
  • - tamaño

Tu robots.txt

Todo corre en tu navegador: nada se envía y no se visita ninguna URL. El archivo repite las rutas privadas dentro de cada grupo permitido a propósito: un rastreador obedece a un solo grupo, el más específico, y sin esa repetición tu área privada quedaría abierta justo para quien permitiste.

Esta página trata el robots.txt desde el ángulo de los agentes de IA: quién puede entrenar, quién puede citar y quién puede buscar a pedido de una persona. Genera el archivo completo, reglas generales incluidas, porque el robots.txt es un archivo único y entregar la mitad sería entregar algo roto. Si tu pregunta es más amplia, si el sitio entero está listo para ser citado por IA, el lugar correcto es el checklist de preparación GEO, donde el acceso del rastreador es 1 ítem de 16.

Cómo usarla

  1. Haz clic en una postura para rellenar la tabla de una vez. La recomendada para quien publica contenido es bloquear entrenamiento y mantener citación, que ya viene marcada.
  2. Ajusta agente por agente en los tres bloques. Cada fila trae el token exacto del user-agent, el proveedor y las etiquetas que cambian la consecuencia: búsqueda clásica, entrenamiento y respuesta, puede ignorar el archivo.
  3. Escribe tus rutas privadas, una por línea. Valen para todos, incluidos los agentes que permitiste, y puedes pegar la URL completa: la herramienta extrae la ruta.
  4. Completa el sitemap. Es la línea más barata del archivo y la única que ayuda activamente a quien rastrea bien.
  5. Lee las alertas antes de copiar. No juzgan tu elección, muestran su consecuencia, como bloquear un token que también es el buscador tradicional.
  6. Descarga y publica en tusitio.com/robots.txt, en la raíz y como texto plano. Compruébalo en una ventana privada.

Cómo funciona: tres propósitos, no un bloque

El snippet que circula por internet trata a todo bot de IA como la misma cosa y manda Disallow a quince user-agents. El resultado es un sitio que desaparece de las respuestas de IA sin ganar nada, porque entre esos quince estaban los agentes que citan con enlace. Los proveedores separaron sus agentes por propósito, y una política honesta sigue esa separación.

entrenamiento: rastrea para formar corpus. Sin visita, sin crédito. Bloquear no cuesta tráfico
búsqueda y citación: indexa para responder con enlace. Bloquear cuesta visibilidad
a pedido del usuario: abre la página porque alguien preguntó ahora. Casi una visita
superficie de citación = agentes permitidos de búsqueda + a pedido del usuario

La misma marca aparece en los tres bloques con tokens diferentes. OpenAI separa GPTBot, OAI-SearchBot y ChatGPT-User. Anthropic separa ClaudeBot, Claude-SearchBot y Claude-User. Perplexity separa PerplexityBot y Perplexity-User. Google y Apple lo hacen distinto: el token de rechazo de entrenamiento es propio (Google-Extended, Applebot-Extended) y la indexación sigue en el rastreador de siempre. Por eso la tabla muestra el proveedor junto al token: la decisión es por propósito, no por marca.

La regla de agrupación que casi todo generador falla

Un rastreador lee el robots.txt y obedece a un solo grupo, el más específico que casa con su nombre. Todos los demás grupos dejan de existir para él. Eso crea una trampa silenciosa: si abres un grupo para OAI-SearchBot escribiendo solo Allow barra, los Disallow del grupo general dejan de valer para ese agente, y tu carpeta de checkout queda abierta justo para el rastreador que permitiste.

Esta herramienta repite las rutas privadas dentro de cada grupo permitido por ese motivo. El Allow barra entra después y no anula nada: por la regla del camino más largo, /admin/ tiene 7 caracteres y gana a la barra sola, que tiene 1. Es la misma lógica que hace que una excepción específica pese más que una prohibición genérica.

Ejemplo trabajado (reproduce el resultado por defecto)

Los valores que vienen rellenados aplican la postura recomendada a un sitio con tres rutas privadas y un sitemap. El archivo generado tiene 51 líneas y 4 grupos, y el resumen muestra:

Haz clic en permitir todo y el resumen pasa a 0 de 12 bloqueados con el aviso de que el archivo no cambia nada. Haz clic en cerrar a la IA y la superficie de citación cae a 3 de 13, que son exactamente los buscadores clásicos que la herramienta deja marcados a propósito, porque desmarcar Googlebot no cierra la puerta a la IA, cierra la puerta a la búsqueda entera.

Cómo interpretarlo y dónde el archivo engaña

La primera trampa es creer que el robots.txt protege contenido. No lo protege. Es un pedido publicado en un archivo de texto sin ninguna autenticación, que reduce la recolección de quien elige obedecer y nada más. No impide la copia manual, no retira tu texto de bases ya distribuidas y no crea derechos que no tuvieras. Si el bloqueo tiene que valer, vive en el servidor, en el CDN o en el WAF, por user-agent y por los rangos de IP que publica el proveedor.

La segunda es bloquear por susto. Bloquear entrenamiento cuesta casi nada, y bloquear búsqueda cuesta tráfico que nunca verás desaparecer en un informe, porque no existe una línea llamada la visita que no ocurrió. Antes de cerrar la puerta de la citación, mira cuánto de tu tema ya se responde en pantalla sin clic, con el método del guía de GEO en 2026.

La tercera es confundir capas. Permitir al rastreador no genera citación: todavía tiene que encontrar un fragmento recortable cuando llegue. Con el acceso resuelto, pasa el texto por el verificador de contenido citable por IA y señala tu contenido canónico con el generador de llms.txt. Acceso, recorte y señal de confianza son tres problemas distintos, y resolver el primero solo no mueve nada.

La cuarta es olvidar que la lista envejece. Cada trimestre nace un agente nuevo, y un archivo escrito en 2024 ya no cubre la mitad de lo que existe hoy. Pon la revisión del robots.txt al mismo ritmo que la revisión del menú del sitio.

De la política a la evidencia

Cambiar la política de bots es una apuesta sobre cómo terceros tratan tu contenido, y una apuesta sin medición se convierte en folclore de equipo. El camino corto y honesto:

Preguntas frecuentes

¿Bloquear GPTBot me saca de ChatGPT?
No como la mayoría imagina. OpenAI usa tokens distintos para tareas distintas: GPTBot rastrea para entrenamiento de modelos, OAI-SearchBot indexa para la búsqueda de ChatGPT y ChatGPT-User busca la página cuando un usuario lo pide en ese momento. Bloquear solo GPTBot rechaza el entrenamiento y mantiene las dos puertas que traen citación con enlace. Quien quiera desaparecer de verdad de las respuestas tiene que bloquear los tres, y ahí pierde el tráfico junto. Esa es exactamente la distinción que la herramienta te obliga a hacer antes de escribir el archivo.
¿Cuál es la diferencia entre Google-Extended y Googlebot?
Googlebot es el rastreador de la búsqueda: alimenta el índice de Google, y el índice alimenta tanto los resultados azules como las vistas generales creadas con IA dentro de la búsqueda. Google-Extended no es un rastreador, es un token de control que dice si tu contenido puede usarse en el entrenamiento de Gemini y en sus respuestas fundamentadas. La consecuencia práctica cuesta de aceptar: bloquear Google-Extended no te saca de las vistas generales de la búsqueda, y bloquear Googlebot para lograrlo te sacaría de Google entero. Hoy no existe un control separado para esas vistas.
¿Tiene sentido bloquear entrenamiento y permitir citación?
Lo tiene, y es la postura estándar de quien vive de publicar. Las dos tienen economías opuestas: en el entrenamiento tu texto se convierte en pesos del modelo, sin visita y sin crédito; en la citación aparece como fuente con enlace, que es tráfico y autoridad. Como la mayoría de los proveedores separó sus agentes, puedes rechazar una y aceptar la otra en el mismo archivo. La excepción honesta son los agentes que no separan, como el CCBot de Common Crawl: ahí es todo o nada, y conviene recordar que su corpus ya circula en bases publicadas antes de tu bloqueo.
¿Los bots respetan de verdad el robots.txt?
Los grandes proveedores documentan que sí, y hay evidencia independiente de que los agentes con token público obedecen en la práctica. Pero el archivo es un pedido, no un candado: no hay autenticación, y cualquier cliente puede ignorar la regla o cambiar de user-agent. Algunos agentes que actúan a pedido del usuario, como Perplexity-User, están documentados como fuera del alcance del robots.txt justamente porque quien disparó la petición fue una persona. Si el bloqueo tiene que valer de verdad, tiene que existir en el servidor, en el CDN o en el WAF, por user-agent y por los rangos de IP que publica el proveedor.
¿Por qué la herramienta repite las rutas privadas dentro de cada grupo permitido?
Porque un rastreador obedece a un solo grupo, el más específico que casa con su nombre, e ignora todos los demás. Eso crea una trampa silenciosa: si abres un grupo para OAI-SearchBot con solo Allow barra, los Disallow que escribiste en el grupo User-agent asterisco dejan de valer para él, y tu carpeta de checkout queda abierta justo para el agente que permitiste. Repetir las rutas privadas en cada grupo es la corrección correcta y el error más común de los generadores genéricos. El Allow barra entra después y no anula nada, porque la regla del camino más largo hace que /admin/ gane a /.
¿Dónde publico el archivo y cómo compruebo que vale?
En la raíz del dominio, en tusitio.com/robots.txt, servido como texto plano. Vale por host y por protocolo: un subdominio tiene su propio archivo, y el de www no cubre el dominio raíz si los dos responden por separado. Después de publicar, abre la dirección en una ventana privada y confirma que aparece el texto crudo. Para probar regla por regla, el informe de robots.txt de Search Console muestra qué línea casa con qué URL para Googlebot. Para los agentes de IA no hay probador oficial: lo que queda es leer el log del servidor y ver quién dejó de tocar la puerta.
¿Bloquear la IA protege mi contenido de ser copiado?
No. El robots.txt reduce la recolección automatizada de quien elige obedecer, y nada más. No impide la copia manual, no impide un scraper anónimo, no retira tu contenido de bases ya publicadas y no crea ningún derecho que no tuvieras antes. Tratar el archivo como protección jurídica o como barrera técnica es el error más caro de esta discusión, porque cambia visibilidad real por una seguridad que no existe. Decide por la economía de tu operación, no por la sensación de estar cerrando la puerta.
Incorporar esta herramienta en tu sitio

Pega este código donde quieras mostrar el generador. El enlace de crédito bajo el marco nos ayuda y eres libre de mantenerlo.

Continúa

Con el archivo publicado, el paso siguiente es la capa que él no resuelve: texto recortable, dato verificable y señal de autoría. El método completo está en el guía de GEO en 2026, y lo que cambia en el trabajo de conversión cuando la respuesta llega antes del clic está en CRO en la era de la IA.

Herramientas relacionadas

Ver todas las herramientas →