C'est la réponse à la question que tout le monde pose au bout de deux semaines d'usage : « comment lui faire connaître mes documents à moi ? » Vos tarifs, vos procédures, vos comptes rendus, votre documentation produit. Rien de tout cela ne figure dans ce qu'un modèle a appris.
Trois solutions existent en théorie. Coller les documents dans chaque conversation, ce qui ne tient pas au-delà de quelques pages. Réentraîner le modèle, ce qui coûte cher et ne convient pas à des informations qui changent. Ou aller chercher automatiquement les bons extraits au moment de la question : c'est le RAG, et c'est la bonne réponse dans la quasi-totalité des cas.
Définition
Le RAG, pour retrieval augmented generation, est une méthode qui consiste à rechercher automatiquement les extraits pertinents dans une base documentaire, puis à les fournir au modèle avec la question, afin qu'il réponde à partir de ces extraits plutôt que de sa mémoire.
Le mécanisme tient en quatre temps. Vos documents sont découpés en morceaux. Chaque morceau est transformé en Embedding, une représentation numérique de son sens. À la question posée, le système retrouve les morceaux les plus proches du sens de la question. Ces morceaux sont glissés dans le Prompt, et le modèle rédige sa réponse à partir d'eux.
La recherche ne porte pas sur les mots mais sur le sens. Une question sur « le délai de remboursement » retrouve un paragraphe qui parle de « restitution sous quinze jours », alors qu'aucun mot ne correspond. C'est ce qui distingue le RAG d'un simple moteur de recherche interne.
Pourquoi c'est presque toujours le bon choix
| Approche | Coût | Mise à jour | Vérifiable |
|---|---|---|---|
| Tout coller dans la conversation | Élevé et répété | Immédiate | Oui |
| Fine-tuning | Élevé à la mise en place | Nouvel entraînement | Non |
| RAG | Faible par question | Immédiate | Oui |
La colonne « vérifiable » est celle qui emporte la décision pour un usage professionnel. Un système RAG peut citer le document d'où vient chaque affirmation. Un modèle réentraîné ne le peut pas : l'information est diluée dans ses paramètres, sans trace de son origine.
La colonne « mise à jour » compte tout autant. Vos tarifs changent, vos procédures évoluent. Avec le RAG, remplacer le document suffit. Avec le fine-tuning, il faut recommencer l'entraînement.
Ce qui fait la qualité d'un RAG
Le découpage
C'est le réglage qui décide de tout et personne n'en parle. Des morceaux trop courts perdent le contexte, des morceaux trop longs noient l'information utile. Le bon découpage suit la structure du document, par section plutôt qu'au nombre de caractères.
La qualité de la source
Un RAG branché sur une documentation périmée répond de façon périmée, avec assurance. Le ménage dans les documents est un préalable, pas une amélioration ultérieure.
Le nombre d'extraits remontés
Trop peu et la réponse est incomplète. Trop et l'information utile se dilue dans la Fenêtre de contexte. Entre trois et cinq extraits convient à la plupart des usages.
La consigne de repli
Sans instruction explicite du type « si la réponse n'est pas dans les extraits, dis-le », le modèle comblera les trous avec ses connaissances générales. Vous obtiendrez alors un mélange indiscernable entre vos documents et une Hallucination.
Où le mettre en place
Les cas qui rentabilisent l'effort se ressemblent : un corpus stable, des questions répétitives, et un coût réel de la mauvaise réponse.
Le support client de premier niveau arrive en tête. Vient ensuite l'accès à des procédures internes, où la question « comment fait-on déjà pour... » revient chaque semaine. Puis la documentation produit, où le volume dépasse toujours ce qu'une personne retient.
Un RAG mal réglé est plus dangereux qu'une absence de RAG. Il produit des réponses qui semblent fondées sur vos documents alors qu'elles viennent d'ailleurs. Exigez toujours l'affichage des extraits utilisés : sans cette traçabilité, vous ne pouvez rien vérifier.
Pourquoi un RAG répond mal, et par où commencer
Un système qui donne de mauvaises réponses a presque toujours l'une des cinq causes suivantes. Le symptôme permet de remonter directement à la bonne, ce qui évite de tout reprendre.
| Symptôme | Cause la plus probable | Correction |
|---|---|---|
| Réponses correctes mais incomplètes | Trop peu d'extraits remontés | Passer de trois à cinq extraits |
| Réponses hors sujet | Découpage trop fin, contexte perdu | Découper par section plutôt qu'au nombre de caractères |
| Le système invente malgré la base | Aucune consigne de repli | Ajouter « si ce n'est pas dans les extraits, dis-le » |
| Informations périmées | Documents non mis à jour | Faire le ménage dans la base, pas dans le réglage |
| Bon sur certaines questions, mauvais sur d'autres | Un sujet absent de la documentation | Écrire la page manquante |
La dernière ligne est la plus fréquente et la plus mal diagnostiquée. On passe des heures à régler le découpage et la recherche alors que l'information n'existe nulle part dans la base. Avant tout réglage technique, vérifiez qu'une personne trouverait la réponse en lisant vos documents.
Questions fréquentes
Faut-il des compétences techniques pour en monter un ?
Plus autant qu'avant. Plusieurs outils d'automatisation proposent désormais des briques prêtes à l'emploi, où déposer des documents suffit à obtenir un système fonctionnel. Le réglage fin du découpage et la sélection des sources restent, eux, un travail de fond.
Mes documents partent-ils chez le fournisseur du modèle ?
Les extraits sélectionnés voyagent dans le prompt, oui. La base elle-même reste où vous l'hébergez. Pour des documents sensibles, vérifiez les engagements de non-conservation de votre fournisseur, ou tournez-vous vers un modèle hébergé chez vous.
Les grandes fenêtres de contexte vont-elles rendre le RAG inutile ?
Non, pour une raison économique. Même si vos dix mille pages tenaient dans la fenêtre, les envoyer à chaque question serait absurde. Le RAG n'existe pas seulement pour contourner une limite technique, il existe pour n'envoyer que ce qui sert.
Comment démarrer sans se lancer dans un chantier ?
En choisissant un seul corpus bien délimité, par exemple vos vingt réponses types au support, plutôt que toute votre documentation. Notre formation n8n montre ce montage de bout en bout, du dépôt des documents à la vérification des extraits cités.