O que é Robots.txt e como funciona?
O robots.txt é um arquivo de texto colocado na raiz do site (ex: seusite.com/robots.txt) que instrui os bots de rastreamento (crawlers) sobre quais páginas e diretórios devem ou não ser rastreados. É a primeira coisa que um crawler visita ao acessar seu site, seguindo o padrão estabelecido pelo Robots Exclusion Protocol.
O arquivo usa diretrizes simples: User-agent define para qual bot a regra se aplica, Disallow bloqueia o acesso a caminhos específicos, e Allow permite acesso a subcaminhos que estavam bloqueados. Por exemplo, bloquear /admin/ mas permitir /admin/public/. Um Disallow: vazio (sem caminho) permite tudo.
O robots.txt também é o local correto para declarar a localização do sitemap XML, usando a directiva Sitemap:. Isso ajuda os crawlers a encontrar todas as páginas do site. Cuidado: o robots.txt bloqueia apenas o rastreamento, não a indexação. Uma página bloqueada pode ser indexada se tiver links apontando para ela em outros sites.
Boas Práticas e Erros Comuns
- Sempre inclua o
Sitemap:apontando para o XML sitemap na raiz do robots.txt. - NÃO bloqueie CSS e JavaScript — os crawlers modernos precisam desses recursos para renderizar a página corretamente.
- Use
Disallow: /com cuidado — isso bloqueia todo o site de ser rastreado. - Subdiretórios herdam as regras do diretório pai. Declare regras específicas quando necessário.
- Após alterar, teste no Google Search Console para verificar se as regras estão corretas.
- Bots maliciosos ignoram o robots.txt — ele não é mecanismo de segurança, apenas de cooperação.
Perguntas Frequentes
Robots.txt impede a indexação de páginas no Google?
Não necessariamente. Robots.txt bloqueia o RASTREAMENTO (crawl), mas se outra página linking para a bloqueada, o Google pode indexá-la sem ler o conteúdo. Para garantir não indexação, use a meta tag noindex na página ou o header HTTP X-Robots-Tag: noindex.
Posso bloquear bots específicos como crawlers de IA?
Sim. Você pode adicionar regras para user-agents específicos como GPTBot, CCBot, anthropic-ai ou Google-Extended. Exemplo: User-agent: GPTBot + Disallow: /. Porém, bots de IA respeitam o robots.txt de forma voluntária — não há garantia legal.
Qual a diferença entre robots.txt e meta robots?
Robots.txt é um arquivo global na raiz do site, controlando o rastreamento de caminhos. Meta robots (<meta name="robots" content="noindex">) é por página, controlando indexação e follow. Use robots.txt para controlar o crawl e meta robots para controle granular por página.
Onde devo colocar o arquivo robots.txt?
Na raiz do domínio: https://seusite.com/robots.txt. Ele deve ser acessível publicamente e retornar status HTTP 200. Nunca bloqueie o robots.txt ele mesmo comDisallow: /robots.txt — os crawlers precisam acessá-lo primeiro.
Robots.txt afeta o crawl budget do Google?
Sim, positivamente. Bloquear páginas desnecessárias (painéis admin, páginas de filtro, parâmetros de URL) economiza o crawl budget — o limite de páginas que o Google rastreia por período. Isso é especialmente importante para sites grandes (10.000+ páginas).
Este gerador cria robots.txt básico. Para sites complexos com múltiplos user-agents e regras avançadas, consulte a documentação do Google sobre robots.txt. Após publicar, valide com a ferramenta de teste do Google Search Console.
