Bloquer GPTBot ne te retire pas de ChatGPT. GPTBot sert à l'entraînement ; ce qui va chercher une page pour la citer dans une réponse s'appelle OAI-SearchBot, et ce qui l'ouvre quand un utilisateur le demande s'appelle ChatGPT-User. Le module classe chaque robot par usage et dit ce que coûte chaque blocage. Bloquer l'entraînement est un choix défendable ; bloquer la citation est presque toujours un accident.
Ton robots.txt n'est pas ce qui décide. Les pare-feux applicatifs proposent depuis 2024 une option « bloquer les robots d'IA », souvent activée par défaut, et elle prime sur le fichier. Aucun outil de référencement ne la voit, parce qu'ils se présentent tous comme un navigateur. Le module pose la question sous l'identité de chaque robot (en-tête User-Agent reprenant le nom du robot, suivi de TockCheck pour que la requête soit reconnaissable dans les journaux du site) et compare avec ce qu'obtient un navigateur. C'est le constat acces-reel, et c'est la première cause de disparition des citations.
Une IA ne voit que le HTML servi. Elle n'exécute pas ton JavaScript. Une application rendue côté navigateur est une page blanche pour elle, même si Google finit par l'indexer. Les outils de SEO classiques ne le voient pas : ils rendent la page avant de juger. Le module compte les mots du HTML tel qu'il arrive, et ne parle de rendu tardif que si le texte est court et qu'un marqueur d'application cliente est présent — une page de contact de vingt mots n'est pas accusée.
Un constat « indéterminé » n'est pas un constat vert. Quand la sonde n'a pas pu répondre, ou quand le quota s'est épuisé avant une vérification, le module le dit au lieu de conclure. Une condition de citation peut valoir null : cela veut dire « pas encore vérifié », jamais « satisfait ».
Les liens morts ne sont affirmés que sur des pages réellement lues. Le module ne déclare pas mortes les adresses qu'il n'a pas visitées. Le chiffre est donc inférieur à celui d'un explorateur exhaustif, et il est exact.
Le suivi de positions n'existe pas ici, et c'est délibéré. Il n'y a pas de source honnête : interroger un moteur pour relever un classement est à la fois contraire à ses conditions d'usage et faux, puisque les résultats sont personnalisés, localisés et changeants. Ce que le module mesure à la place, ce sont les arrivées réelles par source, mesurées par la balise du module Stats — un chiffre qui appartient au site, et non une estimation achetée à un tiers.
`llms.txt` n'est pas un standard. Aucun éditeur de modèle ne s'est engagé à le lire. Le module le signale en « attention » et jamais en « sérieux » : il coûte dix minutes, il ne peut pas nuire, et il n'est pas une obligation.
Une page sans `canonical` ne va pas mal. L'absence est verte : la page vaut pour elle-même. Ce qui est grave, c'est un canonical vers un autre domaine — le site déclare alors que sa vraie version est ailleurs, et se fait désindexer au profit de cette autre adresse.
Les sources d'arrivée exigent la balise de Stats. Sans elle, le module sait dire si une IA *peut* lire le site ; il ne peut pas dire si elle l'*envoie* des visiteurs. Les deux moitiés de la question sont distinctes, et l'écran ne fait jamais passer l'une pour l'autre.