Lista de rastreadores de IA: GPTBot, ClaudeBot, PerplexityBot y cómo permitirlos

Las empresas de IA leen la web con rastreadores con nombre (cada uno tiene un nombre de «user-agent»). Conocerlos te permite tomar una decisión deliberada: permitir aquellos por los que quieres que te citen y bloquear los que no. Estos son los principales al momento de escribir esto.

Los principales rastreadores de IA

El Copilot de Microsoft se apoya en gran medida en el índice de Bing, así que el Bingbot estándar también cuenta ahí.

Cómo permitirlos (robots.txt)

Si quieres ser legible y citable, la regla más simple es permitir a todos (lo predeterminado si no tienes robots.txt). Para ser explícito:

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

Cómo bloquear uno

Si prefieres que un rastreador concreto no use tu contenido, bloquéalo por su nombre:

User-agent: GPTBot
Disallow: /

Para el uso específico en la IA generativa de Google, añade el token (esto no afecta a la búsqueda normal de Google):

User-agent: Google-Extended
Disallow: /

Bloquear a los rastreadores de entrenamiento es una decisión legítima, pero ten en cuenta que también puede reducir con qué frecuencia te lee y te cita la IA de esa empresa. Decide rastreador por rastreador.

Una advertencia: los nombres cambian

Los rastreadores de IA son nuevos, y sus nombres y comportamientos cambian. Tómalo como un punto de partida y consulta la documentación oficial de cada empresa para conocer el user-agent y las reglas actuales. Un error tipográfico en el robots.txt —como bloquear / para todos sin querer— puede dejarte invisible, así que verifícalo después de editarlo.

En resumen

Conoce los rastreadores y luego elige de forma deliberada: permite las IA en las que quieres aparecer, bloquea las que no y revisa bien tu robots.txt. Para ver cómo funciona robots.txt en detalle, lee robots.txt para rastreadores de IA, o la introducción al GEO para la visión de conjunto.

← Todas las guías