Recherche generative et IA
Embeddings
Un embedding, ou plongement vectoriel, est la représentation d’un texte sous forme d’une suite de nombres. Cette suite situe le sens du texte dans un espace où les contenus proches se retrouvent voisins.
Deux phrases qui disent la même chose avec des mots différents produisent des vecteurs proches. C’est ce qui permet de retrouver par le sens plutôt que par la correspondance de mots.
Comment ils sont produits
Par un modèle entraîné sur de très grands volumes de texte, qui a appris quels mots apparaissent dans quels contextes.
Le modèle ne comprend pas au sens humain. Il a observé des régularités statistiques suffisamment fines pour que la proximité numérique corresponde à une proximité de sens.
La dimension du vecteur, plusieurs centaines de nombres, permet d’encoder bien plus qu’une thématique : le registre, la précision, le point de vue.
À quoi ils servent
Trois usages, du plus visible au plus discret.
La recherche par le sens, décrite côté recherche vectorielle. Une question retrouve un document qui n’emploie pas ses mots.
La sélection de passages dans les systèmes qui vont chercher avant de répondre, mécanisme expliqué côté RAG.
Le regroupement automatique. Rassembler des requêtes qui expriment la même intention, ou des demandes clients qui décrivent le même problème. C’est un usage pratique et sous-exploité en analyse de mots clés.
Ce que la représentation capture
Trois propriétés expliquent pourquoi elle fonctionne, et elles sont contre-intuitives.
La proximité n’est pas la synonymie. Deux textes peuvent être voisins sans partager un seul mot, et deux textes employant le même vocabulaire peuvent être éloignés si leur propos diffère.
Les relations se calculent. Dans un espace bien construit, la différence entre deux vecteurs encode une relation, ce qui permet des rapprochements que le comptage de mots ne produit jamais.
Le modèle décide de ce qui compte. Un modèle entraîné sur des textes généraux et un modèle entraîné sur un domaine technique ne situent pas les mêmes textes au même endroit. C’est pourquoi deux outils donnent des résultats différents sur le même corpus.
Les conséquences pour la rédaction sont détaillées côté recherche vectorielle.
Ce que ce n’est pas
Ce n’est pas quelque chose à mettre en place sur son site. Les embeddings sont produits du côté des moteurs, à partir de ce que vous publiez.
Le seul cas où l’on en produit soi-même est un moteur de recherche interne, sur un site à gros catalogue ou à documentation étendue.
FAQ