Ferramenta

Gerador de robots.txt para bots de IA

Escolha o que cada agente de IA pode fazer com o seu site: treinar modelo, indexar para citar você com link, ou buscar a página quando uma pessoa pergunta. São 25 agentes documentados, a ferramenta monta o arquivo pronto e avisa quando a política diz uma coisa e o arquivo faz outra. Grátis, sem cadastro, e nada sai do seu navegador.

Gerador de robots.txt para bots de IA
Comece por uma postura
O preset só preenche a tabela abaixo. Depois disso cada agente é seu: marque para liberar, desmarque para bloquear.

Treino de modelo

Rastreiam para formar corpus de treinamento. Você não recebe visita nem crédito: é o único grupo em que bloquear não custa tráfego.

  • treino e resposta
  • só recusa treino
  • pode ignorar o arquivo

Busca e citação

Indexam para responder com link para você. É por aqui que chega o tráfego vindo de IA, então bloquear custa visibilidade.

  • busca clássica
  • busca clássica
  • busca clássica

Busca a pedido de uma pessoa

Abrem a sua página porque alguém perguntou naquele instante. É o mais parecido com uma visita que existe nesse mundo.

  • só quando pedem
  • só quando pedem
  • só quando pedempode ignorar o arquivo
  • só quando pedem
  • só quando pedem

O que esta política faz

  • - agentes que podem citar você, liberados
  • - rastreadores de treino bloqueados
  • - grupos no arquivo
  • - tamanho

Seu robots.txt

Tudo roda no seu navegador: nada é enviado e nenhuma URL é visitada. O arquivo repete os caminhos privados dentro de cada grupo liberado de propósito: um rastreador obedece a um grupo só, o mais específico, e sem essa repetição a sua área privada ficaria aberta justamente para quem você liberou.

Esta página trata do robots.txt sob a ótica dos agentes de IA: quem pode treinar, quem pode citar e quem pode buscar a pedido de uma pessoa. Ela gera o arquivo inteiro, incluindo as regras gerais, porque robots.txt é um arquivo só e entregar metade seria entregar algo quebrado. Se a sua pergunta é mais ampla, se o site como um todo está pronto para ser citado por IA, o lugar certo é o checklist de prontidão GEO, onde o acesso do rastreador é 1 item de 16.

Como usar

  1. Clique numa postura para preencher a tabela de uma vez. A recomendada para quem publica conteúdo é bloquear treino e manter citação, que já vem marcada.
  2. Ajuste agente por agente nos três blocos. Cada linha traz o token exato do user-agent, o fornecedor e as etiquetas que mudam a consequência: busca clássica, treino e resposta, pode ignorar o arquivo.
  3. Escreva os caminhos privados, um por linha. Eles valem para todo mundo, inclusive para os agentes que você liberou, e podem ser colados como URL completa: a ferramenta extrai só o caminho.
  4. Preencha o sitemap. É a linha mais barata do arquivo e a única que ajuda ativamente quem rastreia direito.
  5. Leia os alertas antes de copiar. Eles não julgam a sua escolha, eles mostram a consequência dela, como bloquear um token que também é o buscador tradicional.
  6. Baixe e publique em seusite.com/robots.txt, na raiz e como texto puro. Confira numa aba anônima.

Como funciona: três propósitos, não um bloco só

O snippet que circula na internet trata todo bot de IA como a mesma coisa e manda Disallow em quinze user-agents. O resultado é um site que some das respostas de IA sem ganhar nada, porque no meio daqueles quinze estavam os agentes que citam com link. Os fornecedores separaram os agentes por propósito, e a política honesta segue essa separação.

treino: rastreia para formar corpus. Sem visita, sem crédito. Bloquear não custa tráfego
busca e citação: indexa para responder com link. Bloquear custa visibilidade
a pedido do usuário: abre a página porque alguém perguntou agora. É quase uma visita
superfície de citação = agentes liberados de busca + a pedido do usuário

A mesma marca aparece nos três blocos com tokens diferentes. A OpenAI separa GPTBot, OAI-SearchBot e ChatGPT-User. A Anthropic separa ClaudeBot, Claude-SearchBot e Claude-User. A Perplexity separa PerplexityBot e Perplexity-User. Google e Apple fazem diferente: o token de recusa de treino é próprio (Google-Extended, Applebot-Extended) e a indexação continua no rastreador de sempre. Por isso a tabela mostra o fornecedor ao lado do token: a decisão é por propósito, não por marca.

A regra de agrupamento que quase todo gerador erra

Um rastreador lê o robots.txt e obedece a um grupo só, o mais específico que casa com o nome dele. Todos os outros grupos deixam de existir para ele. Isso cria uma armadilha silenciosa: se você abre um grupo para o OAI-SearchBot escrevendo apenas Allow com barra, os Disallow que estavam no grupo geral param de valer para esse agente, e a sua pasta de checkout fica aberta justamente para quem você liberou.

Esta ferramenta repete os caminhos privados dentro de cada grupo liberado por causa disso. O Allow com barra entra depois e não anula nada: na regra do caminho mais longo, /admin/ tem 7 caracteres e vence a barra sozinha, que tem 1. É a mesma lógica que faz uma exceção específica valer mais que uma proibição genérica.

Exemplo trabalhado (reproduz o resultado padrão)

Os valores que já vêm preenchidos aplicam a postura recomendada num site com três caminhos privados e um sitemap. O arquivo gerado tem 51 linhas e 4 grupos, e o resumo mostra:

Clique em liberar tudo e o resumo vira 0 de 12 bloqueados com o aviso de que o arquivo não muda nada. Clique em fechar para IA e a superfície de citação cai para 3 de 13, que são exatamente os buscadores clássicos que a ferramenta deixa marcados de propósito, porque desmarcar o Googlebot não fecha a porta para IA, fecha a porta para a busca inteira.

Como interpretar e onde o arquivo engana

A primeira armadilha é achar que robots.txt protege conteúdo. Ele não protege. É um pedido publicado num arquivo de texto sem autenticação nenhuma, que reduz a coleta de quem escolhe obedecer e não faz mais nada. Não impede cópia manual, não retira o seu texto de corpus já distribuídos e não cria direito que você não tivesse. Se o bloqueio precisa valer de verdade, ele mora no servidor, no CDN ou no WAF, por user-agent e por faixa de IP publicada pelo fornecedor.

A segunda é bloquear no susto. O custo de bloquear treino é próximo de zero, e o de bloquear busca é tráfego que você não vai ver sumir num relatório, porque não existe linha chamada visita que não aconteceu. Antes de fechar a porta da citação, olhe quanto do seu tema já é respondido direto na tela sem clique: o método está em otimização para busca zero-click.

A terceira é confundir camadas. Liberar o crawler não gera citação: ele ainda precisa achar um trecho recortável quando chegar. Depois de resolver o acesso, passe o texto pelo verificador de conteúdo citável por IA e aponte o conteúdo canônico com o gerador de llms.txt. Acesso, recorte e sinal de confiança são três problemas diferentes, e resolver o primeiro sozinho não move nada.

A quarta é esquecer que a lista envelhece. Agente novo nasce todo trimestre, e um arquivo escrito em 2024 já não cobre metade do que existe hoje. Coloque a revisão do robots.txt no mesmo ritmo da revisão do menu do site.

Da política à evidência

Mudar a política de bots é uma aposta sobre como terceiros tratam o seu conteúdo, e aposta sem medição vira folclore de equipe. O caminho curto e honesto:

Perguntas frequentes

Bloquear GPTBot tira meu site do ChatGPT?
Não do jeito que a maioria imagina. A OpenAI usa tokens diferentes para coisas diferentes: GPTBot rastreia para treinamento de modelo, OAI-SearchBot indexa para a busca do ChatGPT e ChatGPT-User busca a página quando um usuário pede naquele momento. Bloquear só o GPTBot recusa o treinamento e mantém as duas portas que trazem citação com link. Quem quer sumir mesmo das respostas precisa bloquear os três, e aí perde o tráfego junto. É exatamente essa distinção que a ferramenta obriga você a fazer antes de gerar o arquivo.
Qual é a diferença entre Google-Extended e Googlebot?
Googlebot é o rastreador da busca: ele alimenta o índice do Google, e o índice alimenta tanto os resultados azuis quanto as visões gerais geradas por IA na própria busca. Google-Extended não é um rastreador, é um token de controle que diz se o seu conteúdo pode ser usado no treinamento do Gemini e nas respostas fundamentadas dele. A consequência prática é dura de engolir: bloquear Google-Extended não tira você das visões gerais da busca, e bloquear Googlebot para conseguir isso tiraria você do Google inteiro. Não existe hoje um controle separado para as visões gerais.
Faz sentido bloquear treinamento e liberar citação?
Faz, e é a postura padrão de quem vive de publicar. As duas coisas têm economias opostas: no treinamento o seu texto vira peso de modelo, sem visita e sem crédito; na citação ele aparece como fonte com link, que é tráfego e autoridade. Como a maioria dos fornecedores separou os agentes, dá para recusar um e aceitar o outro no mesmo arquivo. A exceção honesta são os agentes que não separam, como o CCBot da Common Crawl: bloquear ali é tudo ou nada, e vale lembrar que o corpus dele já circula em bases publicadas antes do bloqueio.
Os bots realmente respeitam o robots.txt?
Os grandes fornecedores documentam que sim, e há evidência independente de que os agentes com token público obedecem na prática. Mas o arquivo é um pedido, não um cadeado: não existe autenticação, e qualquer cliente pode ignorar a regra ou mudar de user-agent. Alguns agentes de busca a pedido do usuário, como o Perplexity-User, são documentados como fora do escopo do robots.txt justamente porque quem disparou a requisição foi uma pessoa. Se o bloqueio precisa valer de verdade, ele tem que existir no servidor, no CDN ou no WAF, por user-agent e por faixa de IP publicada pelo fornecedor.
Por que a ferramenta repete os caminhos privados dentro de cada grupo liberado?
Porque um rastreador obedece a um grupo só, o mais específico que casa com o nome dele, e ignora todos os outros. Se você abre um grupo para o OAI-SearchBot com apenas Allow: barra, os Disallow que você escreveu no grupo User-agent asterisco deixam de valer para ele: a sua área de checkout fica aberta justamente para o agente que você liberou. Repetir os caminhos privados em cada grupo é o jeito certo e o erro mais comum dos geradores genéricos. O Allow: barra entra depois e não anula nada, porque a regra do caminho mais longo faz /admin/ vencer /.
Onde publico o arquivo e como confiro se está valendo?
Na raiz do domínio, em seusite.com/robots.txt, servido como texto puro. Ele vale por host e por protocolo: subdomínio tem o seu próprio arquivo, e o de www não vale para o apex se os dois responderem separado. Depois de publicar, abra o endereço numa aba anônima e confira que aparece o texto cru. Para testar regra a regra, o testador de robots.txt do Search Console mostra qual linha casa com qual URL para o Googlebot. Para os agentes de IA não existe testador oficial: o que resta é ler o log do servidor e ver quem parou de bater na porta.
Bloquear IA protege meu conteúdo de ser copiado?
Não. O robots.txt reduz a coleta automatizada de quem escolhe obedecer, e só isso. Ele não impede cópia manual, não impede scraper anônimo, não retira o seu conteúdo de corpus já publicados e não cria direito nenhum que você não tivesse antes. Tratar o arquivo como proteção jurídica ou como barreira técnica é o erro mais caro dessa discussão, porque ele custa visibilidade real em troca de uma segurança que não existe. Decida pela economia da sua operação, não pela sensação de estar trancando a porta.
Incorporar esta ferramenta no seu site

Cole este código onde quiser exibir o gerador. O link de crédito abaixo do quadro nos ajuda e é livre para manter.

Continue

Com o arquivo publicado, o próximo passo é a camada que ele não resolve: texto recortável, dado verificável e sinal de autoria. O método completo está em GEO em 2026, e o que muda no trabalho de conversão quando a resposta chega antes do clique está em CRO na era da IA.

Ferramentas relacionadas

Ver todas as ferramentas →