CodeKitHub
Português
Ferramentas para webmasters

Gerador de arquivos robots.txt

Crie um arquivo robots.txt válido em segundos: comece com uma predefinição (permitir tudo, bloquear tudo ou bloquear especificamente os rastreadores de treino de IA, mantendo a indexação do Google/Bing), adicione os seus próprios caminhos proibidos e o URL do mapa do site e, em seguida, copie ou descarregue o arquivo.

O que é esta ferramenta?

O robots.txt é um arquivo de texto simples localizado na raiz do seu site que indica aos rastreadores da Web a que partes do site podem ou não aceder. Os motores de busca como o Google e o Bing respeitam-no para efeitos de indexação; em 2026, é também a forma padrão através da qual os sites optam por não permitir que o seu conteúdo seja utilizado para treinar modelos de IA, através de nomes específicos de bots como GPTBot, CCBot e Google-Extended.

É importante que a sintaxe esteja exatamente correta — um caminho «Disallow» errado pode, acidentalmente, impedir o acesso dos motores de busca a todo o seu site, ou uma regra de bloqueio de IA definida incorretamente pode acabar por não bloquear nada. Este gerador produz resultados sintaticamente corretos para cada cenário.

Por que usar?

  • Uma predefinição específica para bloquear rastiladores de IA, que abrange o GPTBot, o ChatGPT-User, o CCBot, o Google-Extended, o ClaudeBot, o Bytespider e o anthropic-ai — mantendo, ao mesmo tempo, explicitamente o acesso aos motores de busca.
  • Defina caminhos personalizados a proibir para o conteúdo que pretende ocultar de todos os rastreadores.
  • Campo «URL do mapa do site» — um pequeno acréscimo que ajuda os motores de busca a encontrar as suas páginas mais rapidamente.
  • Sintaxe sempre correta — sem risco de um erro ortográfico acidental bloquear todo o seu site.
  • Gratuito e imediato: descarregue o arquivo diretamente ou copie o texto.

Como usar

  1. Escolha uma predefinição: permitir tudo, bloquear tudo ou bloquear apenas os rastreadores de IA.
  2. Opcionalmente, adicione caminhos personalizados que não são permitidos, um por linha (por exemplo, /admin/).
  3. Se quiser, adicione o URL do seu mapa do site.
  4. Clique em «Copiar» ou «Descarregar» e, em seguida, carregue o arquivo na raiz do seu site com o nome /robots.txt.

Exemplo

Entrada

Preset: Block AI crawlers, keep search engines. Sitemap: https://example.com/sitemap.xml

Resultado

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

...

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Cada rastreador de IA tem o seu próprio bloco explícito, enquanto a regra curinga no final mantém aberto o acesso normal aos motores de busca.

Deve bloquear este robô de rastreamento?

Nem todos os bots têm a mesma finalidade — bloquear o bot errado pode reduzir o tráfego de pesquisa, em vez de apenas excluir esse bot do treino da IA.

rastreadorO que fazBloqueia-o se…
Googlebot, BingbotIndexa o seu site para os resultados de pesquisaNunca — bloquear estes resultados faz com que você deixe de aparecer completamente nos resultados de pesquisa do Google/Bing.
GPTBot, Utilizador do ChatGPTOs rastreadores da OpenAI — o GPTBot treina modelos, enquanto o ChatGPT-User recupera as páginas que um utilizador pediu ao ChatGPT para visitarNão quer que o seu conteúdo seja utilizado para o treino de IA, mas tenha em atenção que o facto de um utilizador do ChatGPT navegar numa página para a qual outro utilizador colocou um link é um caso diferente, que alguns sites optam por permitir.
Google-ExtendedDetermina se a Google utiliza o seu conteúdo para o treino do Gemini/IA — independentemente da indexação de pesquisa do GooglebotQuer continuar a utilizar a Pesquisa do Google, mas não quer contribuir para o treino da IA do Google — esta configuração permite-lhe fazer exatamente isso sem prejudicar as classificações.
CCBot, Bytespider, anthropic-ai, ClaudeBotCommon Crawl (alimenta muitos conjuntos de dados de IA), ByteDance, os rastreadores da AnthropicO mesmo raciocínio que no GPTBot — bloqueie se não quiser que o conteúdo faça parte dos conjuntos de treino da IA.

Perguntas frequentes

O arquivo robots.txt impede realmente a IA de utilizar o meu conteúdo?

Funciona com base num sistema de confiança — os rastreadores de empresas de IA conceituadas respeitam-no (é por isso que o GPTBot, o CCBot, etc., existem como agentes de utilizador distintos e documentados, precisamente para que os sites possam optar por não participar). Não impede os rastreadores que ignoram a norma e não tem qualquer efeito sobre o conteúdo já extraído antes de ter adicionado o bloqueio.

O facto de bloquear os rastreadores de IA prejudicará a minha classificação nos resultados de pesquisa do Google/Bing?

Não — a predefinição do rastreador de IA bloqueia especificamente apenas os bots de IA mencionados e deixa um curinga «Allow: /» para todos os outros, pelo que o Googlebot e o Bingbot não são afetados.

Onde devo colocar o arquivo robots.txt?

Na raiz do seu domínio, para que seja acessível exatamente em yourdomain.com/robots.txt — e não numa subpasta. A maioria dos serviços de alojamento de sites e geradores de sites estáticos dispõe de uma pasta «public» ou «root» específica para este fim.

Para que serve a linha do mapa do site?

Indica aos rastreadores o seu arquivo sitemap.xml, que lista todas as suas páginas indexáveis. É opcional, mas geralmente recomendado — uma linha adicional que pode acelerar a descoberta de novas páginas.

Posso combinar caminhos de exclusão personalizados com a predefinição de bloqueio por IA?

Sim — a predefinição de bloqueio de IA bloqueia primeiro os bots de IA e, em seguida, aplica os seus caminhos de exclusão personalizados (se existirem) ao abrigo da regra geral de curinga que continua a permitir o acesso aos motores de busca.

Ferramentas relacionadas