Gerador de Robots.txt - Portal WebEngine
Voltar para Ferramentas

Gerador de Robots.txt

Gere arquivos robots.txt para controlar crawlers

Espaço para Anúncio

O que é Robots.txt e como funciona?

O robots.txt é um arquivo de texto colocado na raiz do site (ex: seusite.com/robots.txt) que instrui os bots de rastreamento (crawlers) sobre quais páginas e diretórios devem ou não ser rastreados. É a primeira coisa que um crawler visita ao acessar seu site, seguindo o padrão estabelecido pelo Robots Exclusion Protocol.

O arquivo usa diretrizes simples: User-agent define para qual bot a regra se aplica, Disallow bloqueia o acesso a caminhos específicos, e Allow permite acesso a subcaminhos que estavam bloqueados. Por exemplo, bloquear /admin/ mas permitir /admin/public/. Um Disallow: vazio (sem caminho) permite tudo.

O robots.txt também é o local correto para declarar a localização do sitemap XML, usando a directiva Sitemap:. Isso ajuda os crawlers a encontrar todas as páginas do site. Cuidado: o robots.txt bloqueia apenas o rastreamento, não a indexação. Uma página bloqueada pode ser indexada se tiver links apontando para ela em outros sites.

Boas Práticas e Erros Comuns

  • Sempre inclua o Sitemap: apontando para o XML sitemap na raiz do robots.txt.
  • NÃO bloqueie CSS e JavaScript — os crawlers modernos precisam desses recursos para renderizar a página corretamente.
  • Use Disallow: / com cuidado — isso bloqueia todo o site de ser rastreado.
  • Subdiretórios herdam as regras do diretório pai. Declare regras específicas quando necessário.
  • Após alterar, teste no Google Search Console para verificar se as regras estão corretas.
  • Bots maliciosos ignoram o robots.txt — ele não é mecanismo de segurança, apenas de cooperação.

Perguntas Frequentes

Robots.txt impede a indexação de páginas no Google?

Não necessariamente. Robots.txt bloqueia o RASTREAMENTO (crawl), mas se outra página linking para a bloqueada, o Google pode indexá-la sem ler o conteúdo. Para garantir não indexação, use a meta tag noindex na página ou o header HTTP X-Robots-Tag: noindex.

Posso bloquear bots específicos como crawlers de IA?

Sim. Você pode adicionar regras para user-agents específicos como GPTBot, CCBot, anthropic-ai ou Google-Extended. Exemplo: User-agent: GPTBot + Disallow: /. Porém, bots de IA respeitam o robots.txt de forma voluntária — não há garantia legal.

Qual a diferença entre robots.txt e meta robots?

Robots.txt é um arquivo global na raiz do site, controlando o rastreamento de caminhos. Meta robots (<meta name="robots" content="noindex">) é por página, controlando indexação e follow. Use robots.txt para controlar o crawl e meta robots para controle granular por página.

Onde devo colocar o arquivo robots.txt?

Na raiz do domínio: https://seusite.com/robots.txt. Ele deve ser acessível publicamente e retornar status HTTP 200. Nunca bloqueie o robots.txt ele mesmo comDisallow: /robots.txt — os crawlers precisam acessá-lo primeiro.

Robots.txt afeta o crawl budget do Google?

Sim, positivamente. Bloquear páginas desnecessárias (painéis admin, páginas de filtro, parâmetros de URL) economiza o crawl budget — o limite de páginas que o Google rastreia por período. Isso é especialmente importante para sites grandes (10.000+ páginas).