Sitemaps et URL canoniques : aider l'IA à trouver vos pages et à leur faire confiance

L’IA ne peut citer qu’une page qu’elle trouve — et elle s’embrouille quand le même contenu vit à plusieurs adresses. Deux vieux outils sans éclat résolvent les deux : le sitemap (une liste de vos pages) et la balise canonical (l’unique URL véritable d’une page). Ensemble, ils aident l’IA à découvrir votre contenu et à ne pas disperser sa confiance entre des doublons.

Ce que fait un sitemap

Un sitemap.xml est une simple liste des URL que vous voulez faire trouver, en général servie à /sitemap.xml. Les robots — de recherche comme d’IA — le lisent pour découvrir des pages qu’ils manqueraient autrement, surtout sur les grands sites ou les pages avec peu de liens internes. Il n’augmente pas le classement ; il améliore la découvrabilité.

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url><loc>https://example.com/</loc></url>
  <url><loc>https://example.com/guide/</loc></url>
</urlset>

Pointez ensuite vers lui depuis le robots.txt pour que les robots le trouvent automatiquement :

Sitemap: https://example.com/sitemap.xml

Ce que fait canonical

Quand la même page est accessible à plusieurs URL — liens de suivi (?ref=...), http vs https, avec ou sans barre oblique finale, versions imprimables —, les machines peuvent traiter chacune comme une page distincte et diviser le crédit. Une balise canonical nomme l’unique vraie URL :

<link rel="canonical" href="https://example.com/guide/what-is-geo">

Mettez-la dans le <head> de chaque page, pointant vers l’adresse préférée de cette page. Les doublons se regroupent alors sur une seule URL au lieu de se concurrencer.

L’erreur fréquente

Ne pointez pas la canonical de chaque page vers votre page d’accueil. C’est une erreur de copier-coller fréquente qui dit en pratique aux robots « toutes mes pages sont en réalité la page d’accueil » et cache le reste. La canonical de chaque page doit pointer vers elle-même — vers sa propre URL préférée.

En résumé

Les sitemaps et les balises canonical sont sans éclat, mais ils suppriment deux vrais obstacles : des pages que l’IA ne trouve jamais, et une confiance divisée entre des URL en double. Ajoutez un sitemap.xml, liez-le depuis le robots.txt, et donnez à chaque page une canonical qui pointe vers elle-même. C’est la couche « être trouvable » de notre introduction au GEO.

← Tous les guides