Lista de rastreadores de IA: GPTBot, ClaudeBot, PerplexityBot e como permiti-los
As empresas de IA leem a web com rastreadores nomeados (cada um tem um nome de «user-agent»). Conhecê-los permite uma escolha deliberada: permita aqueles por quem você quer ser citado e bloqueie os que não quer. Estes são os principais no momento.
Os principais rastreadores de IA
- GPTBot (OpenAI) — o rastreador geral da OpenAI, usado para reunir conteúdo para os modelos dela.
- OAI-SearchBot (OpenAI) — busca páginas para exibi-las e linká-las nos resultados de busca do ChatGPT.
- ChatGPT-User (OpenAI) — busca uma página sob demanda quando um usuário pede ao ChatGPT para visitar um link específico.
- ClaudeBot (Anthropic) — o rastreador da Anthropic para o Claude.
- PerplexityBot (Perplexity) — rastreia páginas para o Perplexity responder com elas e citá-las.
- Google-Extended (Google) — não é um rastreador separado, mas um token de
robots.txtque controla se o seu conteúdo é usado para a IA generativa do Google (Gemini). O rastreio normal continua sendo feito pelo Googlebot.
O Copilot da Microsoft se apoia bastante no índice do Bing, então o Bingbot padrão também conta ali.
Como permiti-los (robots.txt)
Se você quer ser legível e citável, a regra mais simples é permitir todos (o padrão se você não tem robots.txt). Para ser explícito:
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
Como bloquear um
Se você prefere que um rastreador específico não use o seu conteúdo, bloqueie-o pelo nome:
User-agent: GPTBot
Disallow: /
Para o uso específico na IA generativa do Google, adicione o token (isso não afeta a busca normal do Google):
User-agent: Google-Extended
Disallow: /
Bloquear rastreadores de treinamento é uma escolha legítima — mas saiba que também pode reduzir a frequência com que a IA daquela empresa lê e cita você. Decida rastreador por rastreador.
Um aviso: os nomes mudam
Os rastreadores de IA são novos, e seus nomes e comportamentos mudam. Use isto como ponto de partida e consulte a documentação oficial de cada empresa para o user-agent e as regras atuais. Um erro de digitação no robots.txt — como bloquear / para todos sem querer — pode deixar você invisível, então confira depois de editar.
Em resumo
Conheça os rastreadores e escolha de forma deliberada: permita as IAs em que você quer ser encontrado, bloqueie as que não quer e revise bem o seu robots.txt. Para ver como o robots.txt funciona em detalhe, veja robots.txt para rastreadores de IA, ou a introdução ao GEO para o quadro geral.
Experimente nossa ferramenta gratuita: Gerador de robots.txt e llms.txt →