Gerador de robots.txt para bots de IA
Escolha o que cada agente de IA pode fazer com o seu site: treinar modelo, indexar para citar você com link, ou buscar a página quando uma pessoa pergunta. São 25 agentes documentados, a ferramenta monta o arquivo pronto e avisa quando a política diz uma coisa e o arquivo faz outra. Grátis, sem cadastro, e nada sai do seu navegador.
Treino de modelo
Rastreiam para formar corpus de treinamento. Você não recebe visita nem crédito: é o único grupo em que bloquear não custa tráfego.
- treino e resposta
- só recusa treino
- pode ignorar o arquivo
Busca e citação
Indexam para responder com link para você. É por aqui que chega o tráfego vindo de IA, então bloquear custa visibilidade.
- busca clássica
- busca clássica
- busca clássica
Busca a pedido de uma pessoa
Abrem a sua página porque alguém perguntou naquele instante. É o mais parecido com uma visita que existe nesse mundo.
- só quando pedem
- só quando pedem
- só quando pedempode ignorar o arquivo
- só quando pedem
- só quando pedem
O que esta política faz
- - agentes que podem citar você, liberados
- - rastreadores de treino bloqueados
- - grupos no arquivo
- - tamanho
Alertas
Seu robots.txt
Tudo roda no seu navegador: nada é enviado e nenhuma URL é visitada. O arquivo repete os caminhos privados dentro de cada grupo liberado de propósito: um rastreador obedece a um grupo só, o mais específico, e sem essa repetição a sua área privada ficaria aberta justamente para quem você liberou.
Esta página trata do robots.txt sob a ótica dos agentes de IA: quem pode treinar, quem pode citar e quem pode buscar a pedido de uma pessoa. Ela gera o arquivo inteiro, incluindo as regras gerais, porque robots.txt é um arquivo só e entregar metade seria entregar algo quebrado. Se a sua pergunta é mais ampla, se o site como um todo está pronto para ser citado por IA, o lugar certo é o checklist de prontidão GEO, onde o acesso do rastreador é 1 item de 16.
Como usar
- Clique numa postura para preencher a tabela de uma vez. A recomendada para quem publica conteúdo é bloquear treino e manter citação, que já vem marcada.
- Ajuste agente por agente nos três blocos. Cada linha traz o token exato do user-agent, o fornecedor e as etiquetas que mudam a consequência: busca clássica, treino e resposta, pode ignorar o arquivo.
- Escreva os caminhos privados, um por linha. Eles valem para todo mundo, inclusive para os agentes que você liberou, e podem ser colados como URL completa: a ferramenta extrai só o caminho.
- Preencha o sitemap. É a linha mais barata do arquivo e a única que ajuda ativamente quem rastreia direito.
- Leia os alertas antes de copiar. Eles não julgam a sua escolha, eles mostram a consequência dela, como bloquear um token que também é o buscador tradicional.
- Baixe e publique em seusite.com/robots.txt, na raiz e como texto puro. Confira numa aba anônima.
Como funciona: três propósitos, não um bloco só
O snippet que circula na internet trata todo bot de IA como a mesma coisa e manda Disallow em quinze user-agents. O resultado é um site que some das respostas de IA sem ganhar nada, porque no meio daqueles quinze estavam os agentes que citam com link. Os fornecedores separaram os agentes por propósito, e a política honesta segue essa separação.
A mesma marca aparece nos três blocos com tokens diferentes. A OpenAI separa GPTBot, OAI-SearchBot e ChatGPT-User. A Anthropic separa ClaudeBot, Claude-SearchBot e Claude-User. A Perplexity separa PerplexityBot e Perplexity-User. Google e Apple fazem diferente: o token de recusa de treino é próprio (Google-Extended, Applebot-Extended) e a indexação continua no rastreador de sempre. Por isso a tabela mostra o fornecedor ao lado do token: a decisão é por propósito, não por marca.
A regra de agrupamento que quase todo gerador erra
Um rastreador lê o robots.txt e obedece a um grupo só, o mais específico que casa com o nome dele. Todos os outros grupos deixam de existir para ele. Isso cria uma armadilha silenciosa: se você abre um grupo para o OAI-SearchBot escrevendo apenas Allow com barra, os Disallow que estavam no grupo geral param de valer para esse agente, e a sua pasta de checkout fica aberta justamente para quem você liberou.
Esta ferramenta repete os caminhos privados dentro de cada grupo liberado por causa disso. O Allow com barra entra depois e não anula nada: na regra do caminho mais longo, /admin/ tem 7 caracteres e vence a barra sozinha, que tem 1. É a mesma lógica que faz uma exceção específica valer mais que uma proibição genérica.
Exemplo trabalhado (reproduz o resultado padrão)
Os valores que já vêm preenchidos aplicam a postura recomendada num site com três caminhos privados e um sitemap. O arquivo gerado tem 51 linhas e 4 grupos, e o resumo mostra:
- Treino: os 12 de 12 rastreadores de treinamento entram num único grupo com Disallow com barra. Um grupo pode listar vários user-agents antes das regras, e isso encurta o arquivo sem mudar o significado.
- Citação: 13 de 13 agentes capazes de citar você continuam liberados, sendo 8 de busca e 5 a pedido do usuário. A superfície de citação fica inteira.
- Cada um desses dois grupos liberados repete os três Disallow privados antes do Allow com barra, o que explica por que o arquivo tem 4 grupos e não 2.
- Dois alertas aparecem, e nenhum dos dois é erro: o Google-Extended bloqueado avisa que você também sai das respostas fundamentadas do Gemini, e o Bytespider avisa que o fornecedor não se compromete com o arquivo.
Clique em liberar tudo e o resumo vira 0 de 12 bloqueados com o aviso de que o arquivo não muda nada. Clique em fechar para IA e a superfície de citação cai para 3 de 13, que são exatamente os buscadores clássicos que a ferramenta deixa marcados de propósito, porque desmarcar o Googlebot não fecha a porta para IA, fecha a porta para a busca inteira.
Como interpretar e onde o arquivo engana
A primeira armadilha é achar que robots.txt protege conteúdo. Ele não protege. É um pedido publicado num arquivo de texto sem autenticação nenhuma, que reduz a coleta de quem escolhe obedecer e não faz mais nada. Não impede cópia manual, não retira o seu texto de corpus já distribuídos e não cria direito que você não tivesse. Se o bloqueio precisa valer de verdade, ele mora no servidor, no CDN ou no WAF, por user-agent e por faixa de IP publicada pelo fornecedor.
A segunda é bloquear no susto. O custo de bloquear treino é próximo de zero, e o de bloquear busca é tráfego que você não vai ver sumir num relatório, porque não existe linha chamada visita que não aconteceu. Antes de fechar a porta da citação, olhe quanto do seu tema já é respondido direto na tela sem clique: o método está em otimização para busca zero-click.
A terceira é confundir camadas. Liberar o crawler não gera citação: ele ainda precisa achar um trecho recortável quando chegar. Depois de resolver o acesso, passe o texto pelo verificador de conteúdo citável por IA e aponte o conteúdo canônico com o gerador de llms.txt. Acesso, recorte e sinal de confiança são três problemas diferentes, e resolver o primeiro sozinho não move nada.
A quarta é esquecer que a lista envelhece. Agente novo nasce todo trimestre, e um arquivo escrito em 2024 já não cobre metade do que existe hoje. Coloque a revisão do robots.txt no mesmo ritmo da revisão do menu do site.
Da política à evidência
Mudar a política de bots é uma aposta sobre como terceiros tratam o seu conteúdo, e aposta sem medição vira folclore de equipe. O caminho curto e honesto:
- Guarde o arquivo anterior e a data da troca. Sem linha de base, qualquer variação depois vira interpretação livre.
- Acompanhe o log do servidor por user-agent, não só o painel de busca. É lá que dá para ver quem parou de bater na porta.
- Acompanhe menção e citação em resposta de IA, com o método do guia de GEO em 2026, e a estrutura de FAQ que mais rende citação em FAQ para citação por IA.
- Quando a mudança também mexer na página, e não só no arquivo, meça com teste A/B antes de espalhar. A relação entre otimizar para IA e converter gente está em teste A/B e citação por IA.
Perguntas frequentes
- Bloquear GPTBot tira meu site do ChatGPT?
- Não do jeito que a maioria imagina. A OpenAI usa tokens diferentes para coisas diferentes: GPTBot rastreia para treinamento de modelo, OAI-SearchBot indexa para a busca do ChatGPT e ChatGPT-User busca a página quando um usuário pede naquele momento. Bloquear só o GPTBot recusa o treinamento e mantém as duas portas que trazem citação com link. Quem quer sumir mesmo das respostas precisa bloquear os três, e aí perde o tráfego junto. É exatamente essa distinção que a ferramenta obriga você a fazer antes de gerar o arquivo.
- Qual é a diferença entre Google-Extended e Googlebot?
- Googlebot é o rastreador da busca: ele alimenta o índice do Google, e o índice alimenta tanto os resultados azuis quanto as visões gerais geradas por IA na própria busca. Google-Extended não é um rastreador, é um token de controle que diz se o seu conteúdo pode ser usado no treinamento do Gemini e nas respostas fundamentadas dele. A consequência prática é dura de engolir: bloquear Google-Extended não tira você das visões gerais da busca, e bloquear Googlebot para conseguir isso tiraria você do Google inteiro. Não existe hoje um controle separado para as visões gerais.
- Faz sentido bloquear treinamento e liberar citação?
- Faz, e é a postura padrão de quem vive de publicar. As duas coisas têm economias opostas: no treinamento o seu texto vira peso de modelo, sem visita e sem crédito; na citação ele aparece como fonte com link, que é tráfego e autoridade. Como a maioria dos fornecedores separou os agentes, dá para recusar um e aceitar o outro no mesmo arquivo. A exceção honesta são os agentes que não separam, como o CCBot da Common Crawl: bloquear ali é tudo ou nada, e vale lembrar que o corpus dele já circula em bases publicadas antes do bloqueio.
- Os bots realmente respeitam o robots.txt?
- Os grandes fornecedores documentam que sim, e há evidência independente de que os agentes com token público obedecem na prática. Mas o arquivo é um pedido, não um cadeado: não existe autenticação, e qualquer cliente pode ignorar a regra ou mudar de user-agent. Alguns agentes de busca a pedido do usuário, como o Perplexity-User, são documentados como fora do escopo do robots.txt justamente porque quem disparou a requisição foi uma pessoa. Se o bloqueio precisa valer de verdade, ele tem que existir no servidor, no CDN ou no WAF, por user-agent e por faixa de IP publicada pelo fornecedor.
- Por que a ferramenta repete os caminhos privados dentro de cada grupo liberado?
- Porque um rastreador obedece a um grupo só, o mais específico que casa com o nome dele, e ignora todos os outros. Se você abre um grupo para o OAI-SearchBot com apenas Allow: barra, os Disallow que você escreveu no grupo User-agent asterisco deixam de valer para ele: a sua área de checkout fica aberta justamente para o agente que você liberou. Repetir os caminhos privados em cada grupo é o jeito certo e o erro mais comum dos geradores genéricos. O Allow: barra entra depois e não anula nada, porque a regra do caminho mais longo faz /admin/ vencer /.
- Onde publico o arquivo e como confiro se está valendo?
- Na raiz do domínio, em seusite.com/robots.txt, servido como texto puro. Ele vale por host e por protocolo: subdomínio tem o seu próprio arquivo, e o de www não vale para o apex se os dois responderem separado. Depois de publicar, abra o endereço numa aba anônima e confira que aparece o texto cru. Para testar regra a regra, o testador de robots.txt do Search Console mostra qual linha casa com qual URL para o Googlebot. Para os agentes de IA não existe testador oficial: o que resta é ler o log do servidor e ver quem parou de bater na porta.
- Bloquear IA protege meu conteúdo de ser copiado?
- Não. O robots.txt reduz a coleta automatizada de quem escolhe obedecer, e só isso. Ele não impede cópia manual, não impede scraper anônimo, não retira o seu conteúdo de corpus já publicados e não cria direito nenhum que você não tivesse antes. Tratar o arquivo como proteção jurídica ou como barreira técnica é o erro mais caro dessa discussão, porque ele custa visibilidade real em troca de uma segurança que não existe. Decida pela economia da sua operação, não pela sensação de estar trancando a porta.
Continue
Com o arquivo publicado, o próximo passo é a camada que ele não resolve: texto recortável, dado verificável e sinal de autoria. O método completo está em GEO em 2026, e o que muda no trabalho de conversão quando a resposta chega antes do clique está em CRO na era da IA.