Aller au contenu

LexiqueÉtage 1 · Le Modèleun bloc plein, seul : la machine à prédireÉtage 1 · Le Modèle

embedding (plongement)

053 · v2026-08EN : embedding

Un embedding est la traduction d’un texte en une longue liste de nombres, arrangée de sorte que deux textes de sens voisin donnent des listes voisines. Comme des coordonnées sur une carte, où les villes proches parlent de choses proches.

Ce que ce n’est pas

Un embedding n’est pas un résumé : on ne peut pas le relire, et rien ne permet de reconstituer le texte d’origine à partir de lui. Ce n’est pas non plus une base de données : il ne stocke rien, il représente ; c’est la base vectorielle qui range ces représentations et sait retrouver les plus proches. Et ce n’est pas un moteur de recherche par mots-clés déguisé : il ignore les mots exacts au profit du sens, ce qui est sa force et parfois son défaut.

En profondeur

Le principe tient dans la géométrie. Chaque texte devient un point dans un espace à plusieurs centaines ou milliers de dimensions, et la distance entre deux points mesure leur parenté de sens. Une question et le paragraphe qui y répond se retrouvent ainsi voisins même sans partager un seul mot : « comment résilier mon abonnement » trouve « procédure de fin de contrat ». C’est exactement ce qu’une recherche par mots-clés ne sait pas faire, et c’est ce qui rend le procédé si utile pour retrouver de l’information mal indexée.

La contrepartie est que la ressemblance de sens n’est pas la pertinence. Deux textes peuvent être très proches et pourtant sans rapport avec le besoin : une clause qui interdit quelque chose et une clause qui l’autorise se ressemblent beaucoup, puisqu’elles parlent du même objet. C’est pourquoi les systèmes sérieux ne s’arrêtent pas au plus proche voisin : ils combinent la recherche par sens et la recherche par mots exacts, puis font trier les résultats une seconde fois par un modèle plus coûteux mais plus fin.

Deux règles pratiques évitent les erreurs les plus fréquentes. La première : les embeddings d’un modèle ne sont comparables qu’entre eux ; changer de modèle oblige à tout recalculer, car les espaces n’ont aucune raison de coïncider. La seconde : le découpage du texte avant calcul détermine la qualité de la recherche autant que le modèle lui-même. Un paragraphe entier donne un point moyen, donc flou ; un fragment trop court perd son contexte. C’est un réglage éditorial autant que technique.

Relations où vivent les voisins

Vérifier 3 questions · cliquez votre réponse

Niveau 1 · Reconnaître

Peut-on retrouver le texte d’origine à partir de son embedding ?

Niveau 2 · Distinguer

Une recherche vectorielle remonte une clause qui interdit exactement ce que l’utilisateur voulait autoriser. Pourquoi ?

Niveau 2 · Distinguer

Vous changez de modèle d’embedding. Que devez-vous faire de vos vecteurs existants ?

053 · v2026-08 · première rédaction

Lexigraph, « Embedding (plongement) », v2026-08, https://lexigraph.org/fr/embedding, CC BY 4.0.