Qu'est-ce qu'un RAG en IA ?
Faire répondre une IA sur VOS documents, avec des réponses datées et sourcées : le principe du RAG, ce qu’il coûte, et les montages qui affinent la pertinence.
La réponse en une phrase : le RAG consiste à retrouver les bons passages de vos documents au moment de la question, puis à les donner au modèle — au lieu de le réentraîner.
Le problème qu’il résout
Un modèle ne connaît que ce qu’il a vu à l’entraînement. Il ignore vos contrats, vos procédures, votre catalogue — et il ignore ce qui s’est passé depuis. Pire : interrogé dessus, il invente plutôt que d’avouer.
Le RAG règle les deux à la fois. Le modèle ne « sait » toujours rien de vous, mais on lui met sous les yeux les trois ou quatre paragraphes utiles juste avant qu’il réponde.
Comment ça marche, en 4 temps
- Découper. Vos documents sont coupés en morceaux qui portent chacun une idée — pas des pages entières.
- Indexer. Chaque morceau est transformé en embedding, c’est-à-dire en une position sur une carte des sens.
- Retrouver. À la question, on cherche les morceaux les plus proches. C’est instantané et ça ne coûte presque rien.
- Répondre. Les morceaux retenus sont collés au prompt, avec la consigne de s’appuyer dessus et de citer ses sources.
Ce que ça change concrètement
- Les réponses sont vérifiables : chaque affirmation renvoie à un passage précis.
- La mise à jour est immédiate : on remplace un document, la réponse change. Pas de réentraînement.
- Le coût est maîtrisé : on envoie trois paragraphes, pas trois cents pages.
RAG ou gros contexte ?
Les modèles récents acceptent des contextes énormes — on peut y coller un livre entier. C’est plus simple à mettre en place, mais vous payez la totalité des tokens à chaque question, et la qualité baisse quand l’information utile est noyée au milieu.
La règle pratique : en dessous d’une centaine de pages consultées ponctuellement, le gros contexte suffit. Au-delà, ou dès que c’est un usage quotidien, le RAG revient beaucoup moins cher. Le comparateur de coût par usage permet de chiffrer les deux.
Les montages qui améliorent vraiment
- Recherche hybride. Combiner la recherche par le sens et la recherche par mots exacts. Indispensable dès qu’il y a des références, des codes produits ou des noms propres.
- Reclassement. Récupérer vingt morceaux, puis les faire trier par un second modèle avant d’en garder quatre. C’est le gain de qualité le plus net pour le moins d’effort.
- Découpage par titre. Couper aux têtes de section plutôt qu’au nombre de caractères : chaque morceau garde son contexte.
- Métadonnées. Attacher à chaque morceau sa date, sa source et sa version, pour filtrer et pour citer.
Les erreurs qui reviennent
- Des morceaux trop gros. Un chapitre entier dilue le sens et la recherche devient floue.
- Aucune consigne anti-invention. Sans « si la réponse n’est pas dans les extraits, dis-le », le modèle comble les trous.
- Un index jamais rafraîchi. Un document modifié et non réindexé fait répondre sur une version périmée — l’erreur la plus difficile à repérer.
Pour un RAG entièrement privé, tout ceci fonctionne avec des modèles exécutés chez vous : voir faire tourner une IA en local.
D'où ça vient, et pourquoi ça marche
- Le RAG (« Retrieval-Augmented Generation ») vient d'un papier de recherche publié en 2020 (NeurIPS) : avant de répondre, l'IA va chercher les passages pertinents dans VOS documents puis rédige à partir d'eux.
- Résultat : des réponses ancrées dans vos sources (citables), moins d'hallucinations, et des connaissances à jour sans réentraîner le modèle.
Source : papier fondateur du RAG (arXiv, 2020). Relevé en juillet 2026.
Questions fréquentes
Un RAG, à quoi ça sert concrètement ?
Quelle différence avec le fine-tuning ?
Le RAG supprime-t-il les hallucinations ?
Peut-on monter un RAG en local ?
Avant de partir : des abonnements IA à moins de 10 €
Quatre offres tirées au hasard parmi celles que nous suivons, au prix mensuel annoncé par l’éditeur, au .
- 8,30 €/mois — Monica, Plateforme (version gratuite en ligne)
- 5 €/mois — ElevenLabs, Generative Audio (version gratuite en ligne)
- 8,80 €/mois — Kling AI, Kuaishou, Generative Video
- 8 €/mois — ChatGPT Go, OpenAI, Abonnement
