Sitemaps e URLs canônicas: ajudar a IA a achar suas páginas e confiar nelas
A IA só consegue citar uma página que ela acha — e se confunde quando o mesmo conteúdo vive em vários endereços. Duas ferramentas antigas e sem glamour resolvem os dois problemas: o sitemap (uma lista das suas páginas) e a tag canonical (a única URL verdadeira de uma página). Juntas, elas ajudam a IA a descobrir o seu conteúdo e a não dividir a confiança entre duplicatas.
O que um sitemap faz
Um sitemap.xml é uma lista simples das URLs que você quer que sejam achadas, normalmente servida em /sitemap.xml. Os rastreadores — de busca e de IA — o leem para descobrir páginas que de outro modo perderiam, sobretudo em sites grandes ou páginas com poucos links internos. Ele não melhora o ranqueamento; melhora a descoberta.
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url><loc>https://example.com/</loc></url>
<url><loc>https://example.com/guide/</loc></url>
</urlset>
Depois aponte para ele a partir do robots.txt para os rastreadores o acharem automaticamente:
Sitemap: https://example.com/sitemap.xml
O que a canonical faz
Quando a mesma página é alcançável em várias URLs — links de rastreamento (?ref=...), http vs https, com ou sem barra final, versões para impressão —, as máquinas podem tratar cada uma como uma página distinta e dividir o crédito. Uma tag canonical nomeia a única URL verdadeira:
<link rel="canonical" href="https://example.com/guide/what-is-geo">
Coloque-a no <head> de cada página, apontando para o endereço preferido daquela página. As duplicatas então se consolidam em uma URL em vez de competir entre si.
O erro comum
Não aponte a canonical de toda página para a sua página inicial. É um erro de copiar e colar muito comum que, na prática, diz aos rastreadores «todas as minhas páginas são na verdade a página inicial» e esconde o resto. A canonical de cada página deve apontar para ela mesma — para a própria URL preferida.
Em resumo
Sitemaps e tags canonical são sem glamour, mas removem dois obstáculos reais: páginas que a IA nunca acha e confiança dividida entre URLs duplicadas. Adicione um sitemap.xml, vincule-o pelo robots.txt e dê a cada página uma canonical que aponta para ela mesma. É a camada «ser descoberto» da nossa introdução ao GEO.