Recherche generative et IA

Embeddings

Un embedding, ou plongement vectoriel, est la représentation d’un texte sous forme d’une suite de nombres. Cette suite situe le sens du texte dans un espace où les contenus proches se retrouvent voisins.

Deux phrases qui disent la même chose avec des mots différents produisent des vecteurs proches. C’est ce qui permet de retrouver par le sens plutôt que par la correspondance de mots.

Comment ils sont produits

Par un modèle entraîné sur de très grands volumes de texte, qui a appris quels mots apparaissent dans quels contextes.

Le modèle ne comprend pas au sens humain. Il a observé des régularités statistiques suffisamment fines pour que la proximité numérique corresponde à une proximité de sens.

La dimension du vecteur, plusieurs centaines de nombres, permet d’encoder bien plus qu’une thématique : le registre, la précision, le point de vue.

À quoi ils servent

Trois usages, du plus visible au plus discret.

La recherche par le sens, décrite côté recherche vectorielle. Une question retrouve un document qui n’emploie pas ses mots.

La sélection de passages dans les systèmes qui vont chercher avant de répondre, mécanisme expliqué côté RAG.

Le regroupement automatique. Rassembler des requêtes qui expriment la même intention, ou des demandes clients qui décrivent le même problème. C’est un usage pratique et sous-exploité en analyse de mots clés.

Ce que la représentation capture

Trois propriétés expliquent pourquoi elle fonctionne, et elles sont contre-intuitives.

La proximité n’est pas la synonymie. Deux textes peuvent être voisins sans partager un seul mot, et deux textes employant le même vocabulaire peuvent être éloignés si leur propos diffère.

Les relations se calculent. Dans un espace bien construit, la différence entre deux vecteurs encode une relation, ce qui permet des rapprochements que le comptage de mots ne produit jamais.

Le modèle décide de ce qui compte. Un modèle entraîné sur des textes généraux et un modèle entraîné sur un domaine technique ne situent pas les mêmes textes au même endroit. C’est pourquoi deux outils donnent des résultats différents sur le même corpus.

Les conséquences pour la rédaction sont détaillées côté recherche vectorielle.

Ce que ce n’est pas

Ce n’est pas quelque chose à mettre en place sur son site. Les embeddings sont produits du côté des moteurs, à partir de ce que vous publiez.

Le seul cas où l’on en produit soi-même est un moteur de recherche interne, sur un site à gros catalogue ou à documentation étendue.

FAQ

Questions fréquentes sur les embeddings

01

Faut-il en générer pour son site ?

Seulement pour une recherche interne. Pour être trouvé par les moteurs externes, ce sont eux qui s'en chargent.
02

Cela remplace-t-il les mots clés ?

Non. Les mots clés restent la façon dont la demande s'exprime et guident le sujet à traiter. Ce qui devient inutile, c'est leur répétition.
03

Comment savoir si mon contenu est bien situé ?

Aucun outil grand public ne le mesure. Le test praticable reste de poser la question à un moteur de réponse et de regarder qui est cité.