noindex y X-Robots-Tag: la etiqueta que te oculta de la búsqueda con IA
Puedes tener un contenido perfecto, HTML limpio y todos los rastreadores de IA permitidos, y aun así ser completamente invisible. Una pequeña instrucción, noindex, les dice a los buscadores y a los indexadores de IA que dejen una página fuera por completo. Es el problema de GEO más fácil de pasar por alto, porque nada en la página parece estar mal.
Esta guía explica qué hace noindex, los dos lugares donde se esconde y cómo comprobar si una de ellas te está borrando en silencio.
Qué hace realmente noindex
robots.txt controla si un rastreador puede descargar una página. noindex es distinto: el rastreador lee la página y luego ve una instrucción que dice «no guardes esto en tu índice». Así que la página se descarga y se entiende, y después se descarta. No aparecerá en los resultados de Google, y los sistemas de IA que se apoyan en un índice de búsqueda la tratan igual: no es apta para mostrarse ni citarse.
Por eso noindex es más peligroso que un bloqueo en robots.txt. Un bloqueo es ruidoso y evidente. noindex es silencioso: la página carga bien para las personas y simplemente desaparece de la búsqueda.
Los dos lugares donde se esconde
noindex se puede poner de dos formas, y tienes que comprobar ambas.
1. Una etiqueta meta en el <head> del HTML:
<meta name="robots" content="noindex">
2. Una cabecera de respuesta HTTP (X-Robots-Tag):
X-Robots-Tag: noindex
La cabecera es la traicionera. No está en el HTML en absoluto: viaja con la respuesta del servidor, así que «Ver código fuente» no la revela. Una sola línea en la configuración del servidor o en una regla del CDN puede aplicar noindex a toda una sección del sitio.
Por qué tan a menudo se queda activada por accidente
- Herencia de staging. Los equipos ponen
noindexen un sitio de pruebas o de pre-lanzamiento para mantenerlo privado, y luego olvidan quitarlo cuando el sitio sale a producción. Es el clásico. - Una casilla del CMS. Muchas plataformas tienen un interruptor de «Disuadir a los buscadores» que añade
noindexen todo el sitio sin que te des cuenta. - Un valor por defecto de la plantilla. Un
noindexen una plantilla compartida se aplica en silencio a cada página que la usa. - Un plugin o una regla. Los plugins de SEO y las reglas del CDN pueden añadir una cabecera
X-Robots-Tagque nunca ves en el marcado.
Cómo comprobarlo
- Etiqueta meta: abre «Ver código fuente» en la página y busca
noindex. Si encuentras<meta name="robots" content="noindex">, esa página está excluida. - Cabecera: la cabecera no aparece en el HTML. Mira la pestaña «Red» de tu navegador (las cabeceras de respuesta de la página), o ejecuta
curl -I https://tusitio.comy busca una líneaX-Robots-Tag.
Si comprobar cabeceras a mano te parece engorroso, es justo el tipo de cosa que una comprobación automática detecta de una pasada.
Cuándo noindex es correcto (no lo quites a ciegas)
noindex no siempre es un error. Lo quieres en páginas que no deberían estar en la búsqueda: páginas de agradecimiento y de confirmación, resultados de búsqueda internos, zonas de administración, versiones duplicadas para imprimir. El objetivo no es «no usar nunca noindex», sino asegurarte de que no esté en las páginas que de verdad quieres que se encuentren.
En resumen
Antes de preocuparte por la optimización avanzada, confirma que tus páginas importantes siquiera están permitidas en el índice. Revisa la etiqueta <meta name="robots"> y la cabecera X-Robots-Tag, quita cualquier noindex perdido de las páginas que quieres mostrar y consérvalo solo donde lo quieres de verdad. Es uno de los pasos para «dejar entrar a la IA» de nuestra introducción al GEO, y el error de invisibilidad más barato de corregir una vez que lo encuentras.