On parle beaucoup de contenu, de mots-clés et de réputation. Tout cela compte, mais intervient après une étape qu'on oublie : la lecture. Un robot qui ne peut pas accéder à une page ne la classera pas. Un assistant qui ne comprend pas qui vous êtes ne vous citera pas, ou vous citera mal.
La bonne nouvelle : ce que les moteurs lisent de votre site se vérifie, souvent en quelques minutes et sans outil payant.
1. L'indexabilité : la page a-t-elle le droit d'être lue ?
Trois réglages décident si une page peut apparaître dans Google. Le fichier robots.txt, à la racine du site, qui autorise ou bloque l'exploration. La balise noindex, qui demande de ne pas indexer une page. Et la balise canonique, qui désigne la version de référence quand plusieurs adresses affichent le même contenu.
Une erreur classique après une refonte : la balise noindex posée sur le site de préproduction part en ligne avec lui. Le site est neuf, soigné, et invisible. Dans la Search Console, le rapport sur l'indexation des pages indique pour chaque adresse si elle est indexée, et sinon pourquoi.
2. Le sitemap : la liste que vous tendez aux moteurs
Le fichier sitemap.xml liste les pages que vous souhaitez voir indexées, avec leur date de dernière modification. Il n'oblige pas Google à les indexer, mais il l'aide à les trouver et à repérer ce qui a changé.
Trois vérifications suffisent : le sitemap existe et il est déclaré dans la Search Console ; il ne contient que des pages réellement en ligne, sans redirection ni erreur ; ses dates de modification sont justes. Un sitemap qui liste des pages supprimées ou oublie les nouvelles envoie des signaux contradictoires.
3. Les données structurées : dire ce qu'est la page
Un humain comprend une page d'un coup d'œil : un article, une fiche produit, une adresse. Pour une machine, rien n'est évident. Les données structurées, au format schema.org, le disent explicitement : cette page est un Article publié à telle date, cette entreprise est une Organization avec tel logo, ce produit a tel prix et tels avis.
Google s'en sert pour certains résultats enrichis, et c'est le type de signal qui aide un moteur à relier une page à une entité identifiable. Le test des résultats enrichis de Google indique, page par page, ce qu'il a compris et ce qui est invalide.
4. Le fichier llms.txt : une présentation écrite pour les IA
Proposé récemment, le format llms.txt désigne un fichier texte placé à la racine du site, rédigé en Markdown, qui présente votre activité et liste vos pages clés à l'intention des modèles de langage. Ce n'est pas un standard officiel, et rien ne garantit qu'un assistant donné le lise. Mais il ne coûte presque rien, et il oblige à formuler clairement ce que vous faites — ce qui sert aussi votre site.
Le nôtre est en ligne à l'adresse /llms.txt : il dit qui nous sommes, où nous travaillons, et ce qu'il ne faut pas nous attribuer.
Ce qui échappe encore aux robots
- Le texte dans les images. Un titre ou un tarif écrit dans une image n'est pas lu comme du texte.
- Le contenu qui n'apparaît qu'après un script. Google exécute le JavaScript, mais en différé, et plusieurs robots d'IA ne l'exécutent pas du tout. Ce qui compte doit figurer dans le HTML.
- Les informations contradictoires. Une adresse différente sur le site, la fiche Google et les annuaires brouille l'entité que les moteurs essaient de reconstituer.
Vérifier votre site
Ces vérifications tiennent en une heure avec la Search Console et le test des résultats enrichis. Notre page d'audit en lance une partie automatiquement — indexabilité, sitemap, balisage, lisibilité par les IA — et vous donne un premier relevé gratuit en quelques secondes.