Référencement naturel
Robots.txt : fichier d'exploration
Le fichier robots.txt se place à la racine du site et indique aux robots des moteurs quelles parties ils peuvent explorer. C’est une convention respectée par les moteurs sérieux, pas un mécanisme de sécurité.
La syntaxe minimale
User-agent: * Disallow: /admin/ Allow: /admin/public/ Sitemap: https://exemple.fr/sitemap.xml
User-agent désigne le robot concerné, l’astérisque valant pour tous. Disallow interdit un chemin. Allow réautorise un sous-chemin. Sitemap déclare l’emplacement du plan XML.
Les règles s’appliquent par préfixe de chemin, et la règle la plus spécifique l’emporte.
Ce qu’il bloque, et ce qu’il ne bloque pas
Il bloque l’exploration, pas l’indexation. C’est la nuance qui cause le plus de dégâts.
Une page bloquée par robots.txt mais vers laquelle pointent des liens externes peut apparaître dans les résultats, sans description, avec une mention indiquant que le contenu n’a pas pu être lu.
Pour empêcher l’indexation, il faut une balise noindex, ce qui suppose que Google puisse lire la page. Bloquer la page dans robots.txt empêche justement Google de voir le noindex. Les deux se contredisent.
La règle pratique : bloquer dans robots.txt ce qui ne doit pas consommer de temps d’exploration, poser un noindex sur ce qui ne doit pas apparaître.
Il ne protège rien. Le fichier est public et lisible par tous. Y lister ses répertoires sensibles revient à publier leur adresse.
Les erreurs qui coûtent cher
Le Disallow: / oublié après une mise en ligne. L’environnement de test bloque tout, la ligne part en production, et le site disparaît en quelques jours. C’est l’incident le plus classique du métier.
Bloquer les fichiers de style et de script. Google a besoin de les charger pour comprendre la page. Les bloquer produit un rendu incomplet, sujet traité côté SEO et JavaScript.
Bloquer une page qu’on veut désindexer. Le blocage empêche Google de voir la consigne de désindexation.
Le fichier absent ou en erreur. Une erreur serveur sur robots.txt peut faire suspendre l’exploration entière du site.
Ce qu’il faut y bloquer
Les résultats de recherche interne, les paniers, les espaces de compte, les combinaisons de filtres qui produisent des milliers d’adresses presque identiques. Ce dernier point est le plus rentable sur un catalogue, sujet traité côté contenu dupliqué.
FAQ