noindex e X-Robots-Tag: a tag que esconde você da busca por IA
Você pode ter conteúdo perfeito, HTML limpo e todos os rastreadores de IA permitidos — e ainda assim ficar completamente invisível. Uma pequena instrução, noindex, diz aos buscadores e aos indexadores de IA para deixar uma página totalmente de fora. É o problema de GEO mais fácil de passar despercebido, porque nada na página parece errado.
Este guia explica o que o noindex faz, os dois lugares onde ele se esconde, e como verificar se um deles está apagando você em silêncio.
O que o noindex realmente faz
robots.txt controla se um rastreador pode baixar uma página. noindex é diferente: o rastreador lê a página e então vê uma instrução que diz «não guarde isto no seu índice». A página é baixada e entendida — e depois descartada. Ela não aparece nos resultados do Google, e os sistemas de IA que se apoiam em um índice de busca a tratam do mesmo jeito: não elegível para ser exibida ou citada.
Por isso o noindex é mais perigoso que um bloqueio no robots.txt. Um bloqueio é barulhento e óbvio. O noindex é silencioso — a página carrega bem para as pessoas e simplesmente some da busca.
Os dois lugares onde se esconde
noindex pode ser definido de duas formas, e você precisa checar as duas.
1. Uma tag meta no <head> do HTML:
<meta name="robots" content="noindex">
2. Um cabeçalho de resposta HTTP (X-Robots-Tag):
X-Robots-Tag: noindex
O cabeçalho é o traiçoeiro. Ele não está no HTML — viaja com a resposta do servidor, então «Exibir código-fonte» não o revela. Uma única linha em uma configuração de servidor ou regra de CDN pode aplicar noindex a uma seção inteira do site.
Por que tantas vezes fica ativo por acidente
- Herança de staging. As equipes colocam
noindexem um site de testes ou de pré-lançamento para mantê-lo privado, e depois esquecem de remover na hora do lançamento. O clássico. - Uma caixa do CMS. Muitas plataformas têm um botão «Desencorajar mecanismos de busca» que adiciona
noindexem todo o site sem você perceber. - Um padrão do template. Um
noindexem um layout compartilhado se aplica em silêncio a cada página que o usa. - Um plugin ou uma regra. Plugins de SEO e regras de CDN podem adicionar um cabeçalho
X-Robots-Tagque você nunca vê no código.
Como verificar
- Tag meta: abra «Exibir código-fonte» na página e procure por
noindex. Se você encontrar<meta name="robots" content="noindex">, essa página está excluída. - Cabeçalho: o cabeçalho não aparece no HTML. Veja a aba Rede do seu navegador (os cabeçalhos de resposta da página), ou rode
curl -I https://seusite.com.bre procure uma linhaX-Robots-Tag.
Se checar cabeçalhos na mão parece trabalhoso, é exatamente o tipo de coisa que uma verificação automática pega em uma passada.
Quando o noindex está correto (não remova às cegas)
noindex nem sempre é um erro. Você o quer em páginas que não devem estar na busca: páginas de agradecimento e confirmação, resultados de busca internos, áreas de administração, versões duplicadas para impressão. A meta não é «nunca usar noindex» — é garantir que ele não esteja nas páginas que você realmente quer que sejam encontradas.
Em resumo
Antes de se preocupar com otimização avançada, confirme que as suas páginas importantes estão ao menos permitidas no índice. Confira a tag <meta name="robots"> e o cabeçalho X-Robots-Tag, remova qualquer noindex esquecido das páginas que você quer exibir, e mantenha-o só onde você quer. É um dos passos de «deixar a IA entrar» da nossa introdução ao GEO — e o bug de invisibilidade mais barato de corrigir depois de encontrado.