SEO technique
Spider trap
Un spider trap, ou piège à robot, est une configuration qui génère un nombre illimité d’adresses distinctes. Le robot les explore l’une après l’autre sans jamais terminer, et il consomme son budget sur des pages sans valeur.
Le site fonctionne parfaitement pour un visiteur, qui ne rencontre jamais le piège.
Les configurations qui en produisent
Cinq, par fréquence.
Le calendrier. Un agenda dont chaque mois est un lien vers le suivant génère des adresses jusqu’en l’an 3000. C’est le cas d’école, et il existe encore.
Les filtres combinables. Trois filtres à dix valeurs produisent mille combinaisons, quatre filtres en produisent dix mille. Sur un catalogue, le nombre d’adresses dépasse rapidement le nombre de produits par plusieurs ordres de grandeur.
Les identifiants de session dans l’adresse. Chaque visite du robot crée une adresse neuve.
Les chemins relatifs mal formés. Un lien qui répète un segment produit une adresse plus longue à chaque saut, indéfiniment.
La recherche interne indexable, où chaque requête possible devient une page.
Comment les détecter
Trois signaux, du plus accessible au plus précis.
Un nombre d’adresses connues de Google très supérieur au nombre de pages réelles, visible dans le rapport d’indexation.
Une proportion importante de pages classées « découverte, actuellement non indexée », signe que le robot trouve plus qu’il n’accepte de lire.
Les journaux du serveur, qui montrent exactement quelles adresses le robot visite. C’est la seule source qui nomme le piège, et le motif y saute aux yeux : des milliers de visites sur des combinaisons de paramètres. La méthode est décrite côté analyse de logs.
Comment les fermer
Par ordre d’efficacité.
Bloquer dans le fichier robots les motifs d’adresses qui ne doivent jamais être explorés. C’est le seul levier qui empêche réellement l’exploration.
Ne pas produire les liens. Un filtre dont les combinaisons ne génèrent pas de lien cliquable n’est pas découvert.
Borner. Un calendrier qui s’arrête à la dernière date réelle cesse d’être un piège.
La balise canonique ne résout pas ce problème : elle regroupe les signaux et laisse le robot visiter. Le sujet relève du budget de crawl.
FAQ