Référencement naturel
TF-IDF
TF-IDF est une mesure statistique qui évalue l’importance d’un mot dans un document, rapportée à l’ensemble des documents d’un corpus.
Elle combine deux termes. La fréquence du mot dans le document, et l’inverse de sa fréquence dans le corpus entier.
Ce que la formule dit
L’intuition est simple. Un mot qui apparaît souvent dans un document est important pour ce document. Mais s’il apparaît dans tous les documents, il ne le distingue pas.
Le mot « le » a une fréquence énorme et une valeur nulle : il est partout. Le mot « désaveu » a une fréquence faible et une valeur élevée sur une page de netlinking : il est rare ailleurs.
La mesure identifie donc les termes qui caractérisent un document par rapport à ses voisins.
Ce que les outils SEO en font
Plusieurs outils comparent le TF-IDF d’une page à celui des pages bien classées sur la même requête, et proposent une liste de termes à ajouter ou à retirer.
L’information produite est utile, et son interprétation est presque toujours fausse.
Ce que l’outil mesure réellement est ce que les pages concurrentes traitent et que la vôtre n’aborde pas. Un mot manquant signale un angle absent, pas un mot à insérer.
Écrire pour faire monter une note produit des phrases construites autour d’un terme, ce qui se lit immédiatement.
Ce que Google fait
C’est le point qui rend l’usage direct obsolète.
Le moteur emploie depuis longtemps des approches bien plus riches, fondées sur des représentations du sens plutôt que sur des comptages de mots. Le principe est décrit côté recherche vectorielle.
La conséquence pratique est qu’une page peut se positionner sans employer l’expression exacte, si elle traite réellement le sujet. Et qu’une page saturée du bon vocabulaire ne se positionne pas si elle n’explique rien.
Cela rejoint la mise au point faite côté LSI, dont le TF-IDF partage le sort dans le vocabulaire du secteur : une technique réelle, mal appliquée au référencement contemporain.
Comment s’en servir correctement
Deux usages tiennent.
Lire la sortie de l’outil comme une liste d’angles manquants, puis décider lesquels méritent d’être traités.
Repérer une sur-optimisation : un terme dont la fréquence dépasse largement celle des pages concurrentes signale un bourrage qui dessert la page.
Le travail de fond reste la couverture du sujet, décrite côté champ sémantique.
FAQ