Qu'est-ce qu'un embedding ?
Comment une machine compare des sens plutôt que des mots, pourquoi c’est la brique de toute recherche intelligente, et ce que ça change pour vos documents.
La réponse en une phrase : un embedding transforme un texte en une liste de nombres qui représente son sens — c’est ce qui permet à une recherche de trouver « automobile » quand vous tapez « voiture ».
L’idée, sans mathématiques
Imaginez une carte où chaque texte est un point. Deux textes qui parlent de la même chose se retrouvent côte à côte, même s’ils n’emploient aucun mot commun. « Le chat dort » et « le félin fait la sieste » atterrissent au même endroit ; « le chat dort » et « le chat de la cheminée est bouché » se retrouvent loin l’un de l’autre, alors qu’ils partagent le mot « chat ».
Cette carte a beaucoup plus de deux dimensions — souvent plusieurs centaines. La liste de nombres qui donne la position d’un texte sur cette carte, c’est l’embedding.
À quoi ça sert concrètement
- Chercher dans vos documents sans connaître les mots exacts employés.
- Regrouper automatiquement des avis clients ou des tickets par sujet.
- Détecter les doublons qui ne sont pas écrits pareil.
- Alimenter un RAG — c’est l’usage principal. Voir le RAG expliqué.
Ce que ça change pour vous
Si vous voulez qu’une IA réponde sur vos documents, vous avez deux chemins : tout lui coller dans la conversation, ou construire un index d’embeddings et ne lui donner que les passages utiles.
Le premier est simple, mais limité par la taille du contexte, et vous payez chaque token à chaque question. Le second demande une mise en place, puis coûte une fraction du premier sur la durée.
Combien ça coûte
Les modèles d’embedding sont de loin les moins chers du marché : quelques centimes pour des milliers de pages, et le calcul ne se fait qu’une fois par document. La dépense réelle vient ensuite des questions posées au modèle de génération, pas de l’indexation.
Il existe aussi de très bons modèles d’embedding gratuits et exécutables en local : vos documents ne quittent alors jamais votre machine. Voir faire tourner une IA en local.
Les pièges
- Ne pas mélanger deux modèles. Des embeddings calculés avec un modèle ne sont pas comparables à ceux d’un autre. En changer oblige à tout recalculer.
- Découper intelligemment. Un document entier dans un seul embedding donne une position moyenne, donc floue. On découpe en morceaux qui portent une idée.
- La langue compte. Vérifiez que le modèle est bon en français : beaucoup ne sont évalués que sur l’anglais.
Questions fréquentes
Un embedding, c'est quoi en une phrase ?
À quoi servent les embeddings au quotidien ?
Quelle différence avec une recherche par mots-clés ?
Avant de partir : des abonnements IA à moins de 10 €
Quatre offres tirées au hasard parmi celles que nous suivons, au prix mensuel annoncé par l’éditeur, au .
- 8,30 €/mois — Monica, Plateforme (version gratuite en ligne)
- 8,80 €/mois — Kling AI, Kuaishou, Generative Video
- 9,99 €/mois — Adobe Firefly, Adobe, Generative Image
- 9 €/mois — Krea, Plateforme
