Ferramenta

Gerador de robots.txt: monte o arquivo e teste cada regra

Escolha o tipo de site, ajuste os caminhos e leve o robots.txt pronto para a raiz do domínio. Do lado, um testador diz o que acontece com uma URL específica: qual grupo decidiu, qual regra venceu e por quê. Grátis, sem cadastro, e nada sai do seu navegador.

Gerador de robots.txt com testador de regra

Seu robots.txt

Testar uma URL contra este arquivo

-

Cole o caminho ou a URL completa. A decisão sai pela mesma regra do protocolo: grupo mais específico, depois padrão mais longo.

O arquivo em números

  • - grupos
  • - regras
  • - bloqueios
  • - exceções
  • - sitemaps
  • - tamanho

Tudo roda no seu navegador: nem os caminhos nem o arquivo saem daqui, e nenhuma URL é visitada. O testador aplica as regras do protocolo sobre o texto gerado, do mesmo jeito que o rastreador faz. Lembre que robots.txt controla RASTREIO, não indexação: URL bloqueada aqui ainda pode aparecer na busca se alguém apontar um link para ela.

Para quem é esta página: quem precisa controlar quais caminhos do site podem ser rastreados, seja para tirar filtro de catálogo, busca interna e área de conta do caminho do buscador, seja para fechar um ambiente de homologação. Se a sua pergunta é outra, a de quais robôs de IA podem treinar, citar ou buscar o seu conteúdo, o lugar certo é o gerador de robots.txt para bots de IA, que trata do mesmo arquivo pelo ângulo de política de acesso. As duas páginas geram um robots.txt completo porque o arquivo é um só; o que muda é a decisão que cada uma ajuda a tomar. Para o resto do head da página, use o gerador de meta tags.

A regra que decide não é a primeira, é a mais longa

Quase todo gerador de robots.txt entrega um bloco de texto e some. O problema é que o arquivo não é lido de cima para baixo como um roteiro: ele é um conjunto de padrões que competem entre si, e quem escreve na mão descobre isso tarde, quando uma seção inteira do site sumiu do índice sem ninguém saber qual linha fez aquilo. Por isso esta ferramenta tem duas metades. A de cima monta o arquivo; a de baixo responde a pergunta que interessa de verdade, que é o que acontece com uma URL específica.

Três regras explicam praticamente todo comportamento inesperado. A primeira: um rastreador obedece a um grupo só, o mais específico que casa com o nome dele, e ignora os outros por completo. A segunda: dentro do grupo, vence o padrão mais longo, com o Allow ganhando o empate. A terceira: ausência de regra é permissão, ou seja, o que ninguém proibiu está liberado. As três juntas explicam por que trocar linhas de lugar nunca conserta nada e por que abrir um grupo para um bot pode liberar justamente o que você queria fechar.

Como usar

  1. Escolha o tipo de site. O preset preenche a lista com o rascunho daquela plataforma, e é ponto de partida, não verdade: cada instalação tem caminho próprio.
  2. Ajuste os caminhos bloqueados, um por linha. Pode colar a URL inteira que o caminho é extraído sozinho, o que evita o erro clássico de escrever uma regra começando com https.
  3. Use as exceções para liberar um endereço dentro de uma pasta fechada. Elas vencem o bloqueio quando o padrão é mais longo, e não por estarem em outra linha.
  4. Declare o sitemap com URL absoluta. Essa linha não pertence a grupo nenhum e vale para todos os rastreadores.
  5. Teste no quadro de baixo: escolha o rastreador, cole um caminho e leia o veredito. Repita com as URLs que você não pode errar, como a página de produto, o sitemap e um arquivo de CSS do tema.

Como funciona: o casamento de padrão, termo a termo

O testador aplica exatamente o algoritmo do protocolo sobre o texto que está no quadro de saída, e não sobre os campos do formulário. É de propósito: você testa o arquivo que vai publicar, com as mesmas ambiguidades que o rastreador vai encontrar.

1. grupo aplicado = token de User-agent mais longo que casa com o nome do rastreador; se nenhum casar, vale o grupo asterisco
2. regra vencedora = maior comprimento de padrão entre as regras que casam; empate no comprimento resolve a favor de Allow
3. nenhuma regra casou = liberado (ausência de proibição é permissão)
curingas: asterisco = qualquer sequência · cifrão = fim da URL · todo o resto é caractere literal
Disallow com valor vazio não casa com nada, e é o jeito canônico de dizer "libere tudo"

O comprimento do padrão é literal, contado caractere a caractere. Disallow: /wp-admin/ tem 10 caracteres; Allow: /wp-admin/admin-ajax.php tem 24. Como 24 é maior que 10, o arquivo específico fica liberado dentro de uma pasta fechada, e isso vale mesmo que o Allow esteja escrito depois. Guarde esse número: ele é o que você vê no testador quando duas regras concorrem.

Exemplo trabalhado (reproduz o resultado padrão)

A ferramenta abre com o preset de WordPress e um sitemap declarado. Conferindo o painel de números, item por item:

Agora olhe o testador, que já vem com o Googlebot e o caminho /wp-admin/admin-ajax.php. O veredito é Liberado, decidido por Allow: /wp-admin/admin-ajax.php, e a linha de baixo informa que 2 regras casaram. As duas são o Disallow da pasta e o Allow do arquivo: venceu a mais longa. Esse é o mecanismo inteiro numa linha.

Troque o caminho por /wp-admin/options.php, sem mexer em mais nada. O veredito vira Bloqueado, decidido por Disallow: /wp-admin/, e agora só uma regra casou, porque a exceção é específica de um arquivo. Troque de novo para /blog/post-novo/ e o veredito volta a Liberado, dessa vez sem regra nenhuma envolvida: o quadro diz que nada casou, e é a terceira regra do protocolo em ação.

Por fim, acrescente a linha /*.css na lista de bloqueados, que é uma tentativa comum de economizar rastreio. Os números vão para 6 regras e 5 bloqueios, e acende uma conferência em vermelho apontando dois recursos da amostra que ficaram inacessíveis: a folha de estilo do tema e o CSS de build. É o aviso mais útil da página, porque esse erro não gera erro nenhum em lugar nenhum: ele só muda o que o buscador enxerga.

Como interpretar cada número

Grupos é quantos blocos de User-agent o arquivo tem. Enquanto for 1, todo rastreador segue a mesma regra e o arquivo é fácil de manter. A partir de 2, confira agente por agente no testador, porque cada grupo novo desliga o geral para quem cai nele.

Bloqueios contra exceções conta a forma do arquivo. Muitas exceções costumam ser sintoma de bloqueio largo demais lá em cima: em vez de fechar uma pasta inteira e reabrir cinco endereços, quase sempre é mais simples fechar os cinco caminhos que realmente atrapalham.

Tamanho raramente importa, mas tem um teto: o Google lê os primeiros 500 KB e ignora o resto. Arquivo que chega perto disso virou lista de exclusão gerada por script, e o lugar dessa lógica é o padrão de URL, não o robots.txt.

As conferências não descontam nota nenhuma, porque aqui não existe nota. Bloquear o checkout não é melhor nem pior que liberar: depende do site. O que a ferramenta verifica é coerência, ou seja, quando o arquivo faz algo diferente do que você quis dizer.

Limites conhecidos

A ferramenta confere lógica, não existência. Ela não visita o seu site, não sabe se /carrinho/ existe e não sabe se aquele caminho já está com noindex. Depois de publicar, confirme no relatório de páginas do Search Console e no teste de URL ao vivo, que é onde o rastreio real aparece.

Também vale saber o que o arquivo não faz. Ele não remove nada do índice, não protege área privada e não é obrigatório: quem quiser ignorar, ignora, porque a obediência é voluntária e só os rastreadores sérios se comprometem. E ele diferencia maiúsculas de minúsculas nos caminhos, então /Blog/ e /blog/ são coisas diferentes para a regra, mesmo que o seu servidor trate as duas como a mesma página.

Por fim, o casamento de padrão que esta página aplica é o do Google, que é também o do padrão publicado como RFC 9309. Bing e Yandex seguem o mesmo desenho no essencial, com diferenças em pontos secundários, e o Crawl-delay é justamente um deles. Se o seu tráfego vem de um buscador fora dessa lista, teste também na ferramenta oficial dele antes de confiar no resultado.

Do arquivo publicado ao teste no ar

Controlar rastreio é o começo. O que decide resultado é o que acontece com quem chega:

Perguntas frequentes

Bloquear no robots.txt tira a página do Google?
Não necessariamente, e essa é a confusão mais cara do arquivo. O robots.txt controla rastreio, não indexação: ele pede que o rastreador não baixe aquela URL. Se outras páginas apontarem links para ela, o endereço ainda pode aparecer na busca, sem descrição, com o aviso de que o conteúdo não pôde ser lido. Para tirar uma página do índice o instrumento é a meta robots com noindex, ou o cabeçalho X-Robots-Tag. E existe uma armadilha na combinação dos dois: se você bloquear a URL no robots.txt, o rastreador nunca vai baixar a página e nunca vai ver o noindex que você colocou nela. Para remover, libere o rastreio e aplique o noindex; só depois de a remoção acontecer é que faz sentido bloquear o caminho.
A ordem das linhas muda o resultado?
Não muda. Dentro de um grupo, vence a regra cujo padrão é mais longo, e não a que aparece primeiro. Empate exato entre um Allow e um Disallow do mesmo tamanho é resolvido a favor do Allow. É por isso que Allow: /wp-admin/admin-ajax.php libera esse arquivo mesmo estando escrito depois de Disallow: /wp-admin/, e é por isso também que trocar linhas de lugar para consertar um comportamento nunca funciona. O que muda o resultado é o tamanho do padrão. O testador desta página mostra qual regra ganhou e quantas concorreram, justamente para você parar de adivinhar.
O que acontece se eu abrir um grupo para o Googlebot?
Ele passa a obedecer só aquele grupo e ignora o grupo geral por completo. Essa é a regra que mais quebra arquivo na prática: alguém quer dar uma permissão extra ao Googlebot, cria um grupo com duas linhas, e sem perceber libera para ele toda a área privada que estava fechada no User-agent asterisco. Se você precisa mesmo de um grupo específico, repita nele os bloqueios que devem continuar valendo. No testador, escolha o agente e olhe a linha do grupo aplicado: ela diz qual grupo decidiu a URL.
Posso usar expressão regular nos caminhos?
Não. Existem exatamente dois curingas: o asterisco, que casa com qualquer sequência de caracteres, e o cifrão, que ancora o fim da URL. Todo o resto é literal, inclusive ponto, interrogação, parênteses e colchetes. Isso significa que /*.pdf não é a mesma coisa que /*.pdf$: o primeiro casa também com /manual.pdf.html, porque sem a âncora o padrão só precisa aparecer em algum ponto do caminho. Asterisco no fim do padrão é inofensivo e inútil, já que o casamento sempre foi por prefixo. A ferramenta aponta os dois casos.
Bloquear CSS e JavaScript economiza rastreio?
Economiza banda e custa posição, o que raramente compensa. O buscador renderiza a página como um navegador para saber o que ela mostra de verdade: sem folha de estilo e sem script, ele vê um esqueleto que pode não ter o conteúdo principal, pode parecer quebrado no teste de mobile e pode perder blocos inteiros carregados no cliente. O efeito não é imediato nem aparece como erro; ele chega semanas depois, como queda sem causa aparente. Esta ferramenta testa uma amostra de caminhos típicos de tema, de pasta de assets e de build, e avisa quando alguma regra pegou um deles.
Crawl-delay funciona no Google?
Não. O Google ignora a diretiva e ajusta a taxa de rastreio sozinho, olhando a resposta do seu servidor; quando quiser mesmo reduzir, o caminho é o próprio Search Console. Bing e Yandex respeitam a linha. Vale lembrar que Crawl-delay é remédio errado para servidor lento: ele espaça o rastreio do bot que obedece e não faz nada com o tráfego real, que costuma ser a causa. Se o problema é carga, o lugar de resolver é cache e infraestrutura.
Robots.txt serve para proteger área privada?
Não serve, e usar assim piora a situação. O arquivo é público, fica em um endereço fixo e é a primeira coisa que qualquer pessoa curiosa abre no seu site. Listar /admin-secreto/ ali é publicar um mapa dos lugares que você quer esconder, e rastreadores mal-intencionados simplesmente ignoram o pedido, porque obedecer é voluntário. Área que não pode ser vista se protege com autenticação, e não com uma linha de texto pedindo educadamente que não entrem.
Preciso mesmo declarar o sitemap aqui, se já enviei no Search Console?
Precisa, e é barato. A linha Sitemap não pertence a nenhum grupo: ela vale para todos os rastreadores, inclusive os que não têm painel onde você possa enviar nada, como Bing, DuckDuckGo e os agentes de IA que hoje trazem tráfego. Enviar no Search Console resolve só para o Google. A linha exige URL absoluta, com protocolo e domínio, e é o único item do arquivo que ajuda ativamente quem rastreia direito, em vez de apenas restringir.
O que eu digito aqui fica salvo em algum lugar?
Não. Tudo roda em JavaScript no seu navegador: o arquivo é montado, lido de volta e testado na sua máquina, sem nenhuma chamada de rede, e nada é salvo nem registrado. A ferramenta também não visita o seu site, ou seja, ela confere a lógica das regras que você escreveu e não a existência dos caminhos. Isso importa quando a lista revela estrutura interna de um projeto que ainda não foi ao ar. Dá para confirmar abrindo a aba de rede do navegador enquanto digita: nenhuma requisição sai.
Incorporar esta ferramenta no seu site

Cole este código onde quiser exibir o gerador. O link de crédito abaixo do quadro nos ajuda e é livre para manter.

Continue

Para entender o que muda entre otimizar para busca e otimizar para conversão, siga por CRO e SEO, o que muda em cada um, veja o guia de GEO em 2026 e aprenda a montar blocos citáveis em FAQ para citação por IA.

Ferramentas relacionadas

Ver todas as ferramentas →