Le paradoxe du blocage involontaire
Le cas le plus fréquent que je rencontre en audit n'est pas un site mal optimisé. C'est un site qui interdit l'accès aux robots des IA sans que personne ne l'ait décidé.
Trois causes reviennent. Une extension de sécurité qui bloque les agents inconnus par défaut. Un pare-feu applicatif configuré contre le scraping, qui ne distingue pas un aspirateur d'un robot légitime. Et une directive ajoutée dans robots.txt lors d'un pic de charge, jamais retirée depuis.
Le point commun de ces trois causes : personne n'a pris de décision, et personne ne sait que le blocage existe. D'où l'intérêt de commencer par cette grille plutôt que par la production de contenu.
Famille 1 : l'accès (points 1 à 6)
| # | Point de contrôle | Comment vérifier |
|---|---|---|
| 1 | robots.txt n'interdit pas les robots IA | Lire le fichier ligne à ligne, chercher les Disallow globaux |
| 2 | Aucune balise meta robots restrictive sur les pages clés | Inspecter le code source, chercher noindex ou noai |
| 3 | Le pare-feu applicatif ne filtre pas par agent | Consulter les règles, tester avec un agent déclaré |
| 4 | Le CDN ne renvoie pas de challenge aux robots | Vérifier les journaux de rejets |
| 5 | Aucun contenu clé derrière une authentification | Naviguer en session déconnectée |
| 6 | Aucune redirection ne renvoie les robots vers l'accueil | Tester dix URL profondes, vérifier qu'elles répondent en 200 |
Le point 3 est celui qui échappe le plus souvent aux équipes marketing, parce qu'il relève de l'infrastructure et non du site. Il exige une question précise à l'hébergeur ou à la DSI, pas une vérification depuis un navigateur.
La liste des robots à autoriser et leur évolution sont traitées dans la lisibilité par les robots IA.
Je mesure votre taux de citation dans ChatGPT, Gemini, Perplexity et le mode IA, et je vous livre le plan.
Famille 2 : le rendu (points 7 à 12)
| # | Point de contrôle | Comment vérifier |
|---|---|---|
| 7 | Le contenu principal est présent dans le HTML source | Afficher le code source, désactiver JavaScript |
| 8 | Les titres Hn sont de vraies balises, pas des div stylées | Inspecter la structure |
| 9 | Les tableaux sont en HTML, pas en image | Tenter de sélectionner le texte |
| 10 | Les contenus en accordéon sont dans le DOM initial | Chercher le texte replié dans le source |
| 11 | Les images porteuses d'information ont un texte alternatif | Contrôler les alt des schémas et infographies |
| 12 | Les vidéos et podcasts disposent d'une transcription | Vérifier la présence d'un texte associé |
Le point 7 est le plus discriminant. Un site dont le contenu s'affiche uniquement après exécution de JavaScript reste lisible par Google, dont l'infrastructure de rendu est mature. Il l'est beaucoup moins par les robots des assistants, dont beaucoup se contentent du HTML brut. Testez systématiquement avec JavaScript désactivé : ce que vous voyez est, en première approximation, ce qu'ils voient.
Le point 12 prend de l'importance à mesure que les modèles exploitent les transcriptions. Une conférence d'une heure sans transcription est un contenu invisible.
Je dévoile ma méthode complète pour être cité par les IA
Retrouvez toutes mes vidéos sur la page vidéos ou sur ma chaîne YouTube.
Famille 3 : la performance (points 13 à 16)
| # | Point de contrôle | Seuil indicatif |
|---|---|---|
| 13 | Temps de réponse du serveur | Sous 600 ms |
| 14 | Poids de la page principale | Raisonnable pour le contenu servi |
| 15 | Absence de redirections en chaîne | Un saut maximum |
| 16 | Sitemap XML à jour et déclaré | Sans URL en erreur |
Les robots des assistants sont moins patients que ceux des moteurs classiques. Beaucoup abandonnent une page lente plutôt que de réessayer, sans que vous en soyez informé : contrairement à la Search Console, aucun tableau de bord ne vous signale ces abandons. C'est un angle mort qu'il faut compenser par la mesure directe.
Famille 4 : la fraîcheur (points 17 à 20)
| # | Point de contrôle |
|---|---|
| 17 | Les dates de publication et de modification sont visibles sur la page |
| 18 | Le dateModified du balisage correspond à la réalité |
| 19 | Aucune page stratégique n'a plus de dix-huit mois sans révision |
| 20 | Les chiffres cités portent leur date et leur source |
Le point 20 est celui qui pèse le plus sur la citabilité, et le plus négligé. Un chiffre sans date ne peut pas être repris par un modèle prudent, parce qu'il n'a aucun moyen d'en évaluer la validité. Le même chiffre daté et sourcé devient citable immédiatement.
Attention au point 18 : antidater les modifications pour simuler de la fraîcheur se retourne rapidement. Les moteurs croisent la date déclarée avec l'évolution réelle du contenu, et une incohérence répétée dégrade la confiance accordée au site entier.
Vous préférez qu'on s'en charge ?
J'applique cette méthode pour mes clients depuis 2024. Trois formats, selon que vous vouliez un diagnostic, un accompagnement ou monter en compétence.
Voir le détail des tarifs ou réserver 30 minutes pour en parler.
Que faire des résultats
Traitez dans l'ordre : d'abord les blocages d'accès, qui annulent tout le reste ; ensuite les problèmes de rendu, qui rendent le contenu partiellement invisible ; enfin la performance et la fraîcheur, qui relèvent de l'optimisation.
Un site qui passe les six premiers points est déjà dans une situation acceptable. Un site qui échoue au point 1 ou au point 3 n'a aucun intérêt à investir dans la production de contenu tant que le blocage persiste : il écrit pour des lecteurs que personne ne vient chercher.
Cet audit technique se distingue de l'audit SEO classique, qui couvre l'indexation et le positionnement, et de la cartographie de votre territoire de requêtes, qui mesure votre visibilité. Les trois sont complémentaires et ne se remplacent pas.
Trente minutes en visio, sans engagement : je regarde ce que les IA disent de vous et je vous dis par où commencer.