Lista de rastreadores de IA: GPTBot, ClaudeBot, PerplexityBot y cómo permitirlos
Las empresas de IA leen la web con rastreadores con nombre (cada uno tiene un nombre de «user-agent»). Conocerlos te permite tomar una decisión deliberada: permitir aquellos por los que quieres que te citen y bloquear los que no. Estos son los principales al momento de escribir esto.
Los principales rastreadores de IA
- GPTBot (OpenAI): el rastreador general de OpenAI, usado para reunir contenido para sus modelos.
- OAI-SearchBot (OpenAI): descarga páginas para mostrarlas y enlazarlas en los resultados de búsqueda de ChatGPT.
- ChatGPT-User (OpenAI): descarga una página bajo demanda cuando un usuario le pide a ChatGPT que visite un enlace concreto.
- ClaudeBot (Anthropic): el rastreador de Anthropic para Claude.
- PerplexityBot (Perplexity): rastrea páginas para que Perplexity pueda responder con ellas y citarlas.
- Google-Extended (Google): no es un rastreador aparte, sino un token de
robots.txtque controla si tu contenido se usa para la IA generativa de Google (Gemini). El rastreo normal lo sigue haciendo Googlebot.
El Copilot de Microsoft se apoya en gran medida en el índice de Bing, así que el Bingbot estándar también cuenta ahí.
Cómo permitirlos (robots.txt)
Si quieres ser legible y citable, la regla más simple es permitir a todos (lo predeterminado si no tienes robots.txt). Para ser explícito:
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
Cómo bloquear uno
Si prefieres que un rastreador concreto no use tu contenido, bloquéalo por su nombre:
User-agent: GPTBot
Disallow: /
Para el uso específico en la IA generativa de Google, añade el token (esto no afecta a la búsqueda normal de Google):
User-agent: Google-Extended
Disallow: /
Bloquear a los rastreadores de entrenamiento es una decisión legítima, pero ten en cuenta que también puede reducir con qué frecuencia te lee y te cita la IA de esa empresa. Decide rastreador por rastreador.
Una advertencia: los nombres cambian
Los rastreadores de IA son nuevos, y sus nombres y comportamientos cambian. Tómalo como un punto de partida y consulta la documentación oficial de cada empresa para conocer el user-agent y las reglas actuales. Un error tipográfico en el robots.txt —como bloquear / para todos sin querer— puede dejarte invisible, así que verifícalo después de editarlo.
En resumen
Conoce los rastreadores y luego elige de forma deliberada: permite las IA en las que quieres aparecer, bloquea las que no y revisa bien tu robots.txt. Para ver cómo funciona robots.txt en detalle, lee robots.txt para rastreadores de IA, o la introducción al GEO para la visión de conjunto.
Prueba nuestra herramienta gratuita: Generador de robots.txt y llms.txt →