Référencement naturel

Robots.txt : fichier d'exploration

Le fichier robots.txt se place à la racine du site et indique aux robots des moteurs quelles parties ils peuvent explorer. C’est une convention respectée par les moteurs sérieux, pas un mécanisme de sécurité.

La syntaxe minimale

User-agent: * Disallow: /admin/ Allow: /admin/public/ Sitemap: https://exemple.fr/sitemap.xml

User-agent désigne le robot concerné, l’astérisque valant pour tous. Disallow interdit un chemin. Allow réautorise un sous-chemin. Sitemap déclare l’emplacement du plan XML.

Les règles s’appliquent par préfixe de chemin, et la règle la plus spécifique l’emporte.

Ce qu’il bloque, et ce qu’il ne bloque pas

Il bloque l’exploration, pas l’indexation. C’est la nuance qui cause le plus de dégâts.

Une page bloquée par robots.txt mais vers laquelle pointent des liens externes peut apparaître dans les résultats, sans description, avec une mention indiquant que le contenu n’a pas pu être lu.

Pour empêcher l’indexation, il faut une balise noindex, ce qui suppose que Google puisse lire la page. Bloquer la page dans robots.txt empêche justement Google de voir le noindex. Les deux se contredisent.

La règle pratique : bloquer dans robots.txt ce qui ne doit pas consommer de temps d’exploration, poser un noindex sur ce qui ne doit pas apparaître.

Il ne protège rien. Le fichier est public et lisible par tous. Y lister ses répertoires sensibles revient à publier leur adresse.

Les erreurs qui coûtent cher

Le Disallow: / oublié après une mise en ligne. L’environnement de test bloque tout, la ligne part en production, et le site disparaît en quelques jours. C’est l’incident le plus classique du métier.

Bloquer les fichiers de style et de script. Google a besoin de les charger pour comprendre la page. Les bloquer produit un rendu incomplet, sujet traité côté SEO et JavaScript.

Bloquer une page qu’on veut désindexer. Le blocage empêche Google de voir la consigne de désindexation.

Le fichier absent ou en erreur. Une erreur serveur sur robots.txt peut faire suspendre l’exploration entière du site.

Ce qu’il faut y bloquer

Les résultats de recherche interne, les paniers, les espaces de compte, les combinaisons de filtres qui produisent des milliers d’adresses presque identiques. Ce dernier point est le plus rentable sur un catalogue, sujet traité côté contenu dupliqué.

FAQ

Questions fréquentes sur le robots.txt

01

Où doit-il se trouver ?

À la racine exacte du domaine, à l'adresse `/robots.txt`. Ailleurs, il est ignoré.
02

Faut-il un fichier par sous-domaine ?

Oui. Chaque sous-domaine a le sien, un fichier ne couvre pas les autres.
03

Comment vérifier qu'il fonctionne ?

Search Console propose un outil de test qui indique si une adresse donnée est autorisée ou bloquée, et par quelle règle.
04

Peut-on bloquer les robots d'intelligence artificielle ?

Certains déclarent un nom d'agent et respectent le fichier. D'autres non. Le blocage fonctionne donc partiellement, et il se décide en connaissant ce que l'on perd en visibilité, sujet traité côté consultant GEO.