robots.txt para rastreadores de IA: ¿deberías permitir GPTBot y ClaudeBot?
robots.txt es un pequeño archivo de texto que indica a los rastreadores qué partes de tu sitio pueden leer. Los rastreadores de IA lo respetan, así que este único archivo puede decidir si ChatGPT, Claude y Perplexity tienen permiso para usar tu contenido siquiera.
Qué hace robots.txt
Vive en la raíz de tu sitio (tusitio.com/robots.txt) y enumera reglas para cada rastreador. Cada rastreador se identifica con un nombre de «user-agent», y puedes permitir o bloquear rutas para cada uno.
Los principales rastreadores de IA
- GPTBot — el rastreador de OpenAI.
- OAI-SearchBot — el rastreador de OpenAI para los resultados de búsqueda de ChatGPT.
- ChatGPT-User — descarga una página cuando un usuario le pide a ChatGPT que abra un enlace.
- ClaudeBot — el rastreador de Anthropic (Claude).
- PerplexityBot — el rastreador de Perplexity.
- Google-Extended — controla si Google puede usar tu contenido para sus productos de IA, de forma independiente a la búsqueda normal de Google.
¿Permitir o bloquear?
- Si quieres que te citen en las respuestas de IA, permítelos. Que te lean es la forma de aparecer como fuente.
- Bloquear también es una opción válida. Algunos editores bloquean a los rastreadores de IA para proteger su contenido. No pasa nada, siempre que sea una decisión deliberada. El verdadero problema es bloquearlos por accidente, como un
Disallow: /demasiado amplio que quedó de un sitio de pruebas.
Un ejemplo para copiar y pegar (dar la bienvenida a la IA)
User-agent: *
Allow: /
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
Sitemap: https://tusitio.com/sitemap.xml
Para bloquear en cambio a un rastreador concreto, dale su propio bloque:
User-agent: GPTBot
Disallow: /
Errores frecuentes
- Un
Disallow: /olvidado que bloquea a todos sin que te des cuenta. - Bloquear una carpeta de la que tu contenido depende en realidad.
- Olvidar la línea
Sitemap:: es como los rastreadores descubren todas tus páginas.
En resumen
robots.txt es la puerta de entrada y una de las cuatro capas de nuestra introducción al GEO. Abre tusitio.com/robots.txt, asegúrate de que los rastreadores de IA no estén bloqueados por accidente y añade una línea Sitemap:. Lleva dos minutos y decide si la IA puede leerte siquiera.
Prueba nuestra herramienta gratuita: Generador de robots.txt y llms.txt →