Par page — le noindex (balise et en-tête X-Robots-Tag), le titre et sa longueur, la meta description, le plan des titres (h1 unique, niveaux non sautés), l'adresse canonique (absente, vers une autre page, vers un autre domaine, illisible), la langue déclarée, le JSON-LD (présence, validité, @type exploitable), les balises Open Graph et Twitter, les hreflang (codes valides, auto-référence, x-default), la chaîne de redirections, le texte de remplacement des images, le poids du document, l'interdiction éventuelle de la page par le robots.txt du site, et le nombre de mots réellement lisibles sans exécuter le JavaScript.
Par site — ce que le serveur répond aux robots d'IA sous leur identité, le robots.txt robot par robot (entraînement contre citation), les lignes du robots.txt que personne ne lira, le sitemap (présence, déclaration, adresses hors domaine ou en http), les adresses du sitemap qui répondent en erreur, les liens internes cassés parmi les pages lues, les titres et descriptions dupliqués d'une page à l'autre, et le llms.txt.
Dans le temps — les visiteurs venus de chaque moteur et de chaque assistant, jour par jour, avec une alerte quand une source s'effondre par rapport aux mêmes jours des semaines passées ; une gravité par jour et par vérification, pour répondre à « depuis quand ? » ; et la comparaison de deux audits successifs, qui ne rend que ce qui a changé.