noindex et X-Robots-Tag : la balise qui vous cache de la recherche par IA
Vous pouvez avoir un contenu parfait, un HTML propre et tous les robots d’IA autorisés — et rester complètement invisible. Une petite instruction, noindex, dit aux moteurs de recherche et aux indexeurs d’IA de laisser une page entièrement de côté. C’est le problème de GEO le plus facile à manquer, car rien sur la page ne semble anormal.
Ce guide explique ce que fait noindex, les deux endroits où il se cache, et comment vérifier si l’un d’eux vous efface en silence.
Ce que fait vraiment noindex
robots.txt contrôle si un robot peut récupérer une page. noindex est différent : le robot lit la page, puis voit une instruction qui dit « ne garde pas ceci dans ton index ». La page est donc téléchargée et comprise — puis écartée. Elle n’apparaîtra pas dans les résultats de Google, et les systèmes d’IA bâtis sur un index de recherche la traitent de la même façon : pas éligible à être affichée ou citée.
Voilà pourquoi noindex est plus dangereux qu’un blocage dans robots.txt. Un blocage est bruyant et évident. noindex est silencieux — la page se charge très bien pour les humains et disparaît simplement de la recherche.
Les deux endroits où il se cache
noindex peut être posé de deux façons, et vous devez vérifier les deux.
1. Une balise méta dans le <head> du HTML :
<meta name="robots" content="noindex">
2. Un en-tête de réponse HTTP (X-Robots-Tag) :
X-Robots-Tag: noindex
L’en-tête est le sournois. Il n’est pas du tout dans le HTML — il voyage avec la réponse du serveur, donc « Afficher le code source » ne le révèle pas. Une seule ligne dans une configuration serveur ou une règle de CDN peut appliquer noindex à toute une section du site.
Pourquoi il reste si souvent activé par accident
- Héritage de préproduction. Les équipes mettent
noindexsur un site de préproduction ou de pré-lancement pour le garder privé, puis oublient de le retirer à la mise en ligne. Le classique. - Une case du CMS. Beaucoup de plateformes ont un interrupteur « Décourager les moteurs de recherche » qui ajoute discrètement un
noindexsur tout le site. - Une valeur par défaut du gabarit. Un
noindexdans une mise en page partagée s’applique en silence à chaque page qui l’utilise. - Un plugin ou une règle. Les plugins SEO et les règles de CDN peuvent ajouter un en-tête
X-Robots-Tagque vous ne voyez jamais dans le balisage.
Comment vérifier
- Balise méta : ouvrez « Afficher le code source » sur la page et cherchez
noindex. Si vous trouvez<meta name="robots" content="noindex">, cette page est exclue. - En-tête : l’en-tête n’apparaît pas dans le HTML. Regardez l’onglet Réseau de votre navigateur (les en-têtes de réponse de la page), ou exécutez
curl -I https://votresite.fret cherchez une ligneX-Robots-Tag.
Si vérifier les en-têtes à la main vous semble fastidieux, c’est exactement le genre de chose qu’une vérification automatique attrape en une passe.
Quand noindex est correct (ne le retirez pas à l’aveugle)
noindex n’est pas toujours une erreur. Vous le voulez sur les pages qui ne doivent pas être dans la recherche : pages de remerciement et de confirmation, résultats de recherche internes, espaces d’administration, versions imprimables en double. Le but n’est pas de « ne jamais utiliser noindex » — c’est de s’assurer qu’il n’est pas posé sur les pages que vous voulez vraiment faire trouver.
En résumé
Avant de vous soucier d’optimisation avancée, confirmez que vos pages importantes sont au moins autorisées dans l’index. Vérifiez la balise <meta name="robots"> et l’en-tête X-Robots-Tag, retirez tout noindex oublié des pages que vous voulez afficher, et gardez-le seulement là où vous le voulez. C’est l’un des « laisser entrer l’IA » de notre introduction au GEO — et le bug d’invisibilité le moins cher à corriger une fois trouvé.