SEO TÉCNICO

Robots.txt.

O arquivo que decide, antes de qualquer coisa, o que os robôs de busca têm permissão para acessar no seu site.

01 — O QUE É

Regras de acesso, não de indexação.

O robots.txt é um arquivo de texto público, publicado na raiz do domínio (/robots.txt), que declara quais partes do site cada robô tem permissão para rastrear. Ele é o primeiro arquivo que crawlers bem-comportados consultam antes de acessar qualquer outra página.

O erro mais comum é confundi-lo com uma ferramenta de privacidade ou de controle de indexação — ele não impede que uma URL apareça na busca se outras páginas linkam para ela, e não protege informação sensível, já que o próprio arquivo é público.

02 — SINTAXE

As diretivas mais usadas.

  • User-agent: define para qual robô a regra seguinte se aplica (* para todos).
  • Disallow: bloqueia o rastreamento de um caminho específico.
  • Allow: libera uma exceção dentro de um caminho bloqueado.
  • Sitemap: aponta a URL completa do sitemap XML — pode ficar em qualquer linha do arquivo.

Além do Googlebot tradicional, vale revisar as diretivas para crawlers de IA — GPTBot, OAI-SearchBot, Google-Extended e PerplexityBot têm comportamentos diferentes, detalhados no guia de robots para IA da pillar page de GEO.

FAQ

Perguntas frequentes.

Robots.txt e a tag noindex fazem a mesma coisa?

Não. Robots.txt impede o rastreamento — o Googlebot nem chega a acessar a página. Noindex permite o rastreamento, mas instrui a não guardar a página no índice. Para remover algo da busca com segurança, use noindex, não robots.txt.

Um erro no robots.txt pode tirar o site inteiro do Google?

Sim — uma regra "Disallow: /" bloqueia o site inteiro para aquele robô. É um dos erros técnicos mais comuns e mais graves, geralmente causado por configuração de ambiente de testes esquecida em produção.

Preciso de um robots.txt mesmo se quero que tudo seja rastreado?

Não é obrigatório, mas é uma boa prática ter um arquivo simples (mesmo que só com "User-agent: * / Allow: /") e referenciar o sitemap nele — evita ambiguidade e ajuda outros crawlers a encontrar o sitemap.

CONTINUE NO SEO KNOWLEDGE HUB

O canonical resolve o que o robots.txt não consegue: conteúdo duplicado já indexado.

Ver o guia de Canonical