RAG : faire répondre une IA sur vos propres documents

Le RAG permet à un modèle d'IA de répondre à partir de vos documents en allant chercher les extraits utiles avant de rédiger.
6 min de lecture
Believemy logo

C'est la réponse à la question que tout le monde pose au bout de deux semaines d'usage : « comment lui faire connaître mes documents à moi ? » Vos tarifs, vos procédures, vos comptes rendus, votre documentation produit. Rien de tout cela ne figure dans ce qu'un modèle a appris.

Trois solutions existent en théorie. Coller les documents dans chaque conversation, ce qui ne tient pas au-delà de quelques pages. Réentraîner le modèle, ce qui coûte cher et ne convient pas à des informations qui changent. Ou aller chercher automatiquement les bons extraits au moment de la question : c'est le RAG, et c'est la bonne réponse dans la quasi-totalité des cas.


Définition

Le RAG, pour retrieval augmented generation, est une méthode qui consiste à rechercher automatiquement les extraits pertinents dans une base documentaire, puis à les fournir au modèle avec la question, afin qu'il réponde à partir de ces extraits plutôt que de sa mémoire.

Le mécanisme tient en quatre temps. Vos documents sont découpés en morceaux. Chaque morceau est transformé en Embedding, une représentation numérique de son sens. À la question posée, le système retrouve les morceaux les plus proches du sens de la question. Ces morceaux sont glissés dans le Prompt, et le modèle rédige sa réponse à partir d'eux.

Bon à savoir

La recherche ne porte pas sur les mots mais sur le sens. Une question sur « le délai de remboursement » retrouve un paragraphe qui parle de « restitution sous quinze jours », alors qu'aucun mot ne correspond. C'est ce qui distingue le RAG d'un simple moteur de recherche interne.

Le fonctionnement du RAGLa question sert à retrouver des extraits dans vos documents, et le modèle rédige sa réponse à partir de ces extraits.QuestionRecherche par sensVos documentsdécoupés et indexésExtraits pertinentsRéponse sourcéeLe modèle ne répondqu'à partir des extraits


Pourquoi c'est presque toujours le bon choix

ApprocheCoûtMise à jourVérifiable
Tout coller dans la conversationÉlevé et répétéImmédiateOui
Fine-tuningÉlevé à la mise en placeNouvel entraînementNon
RAGFaible par questionImmédiateOui

La colonne « vérifiable » est celle qui emporte la décision pour un usage professionnel. Un système RAG peut citer le document d'où vient chaque affirmation. Un modèle réentraîné ne le peut pas : l'information est diluée dans ses paramètres, sans trace de son origine.

La colonne « mise à jour » compte tout autant. Vos tarifs changent, vos procédures évoluent. Avec le RAG, remplacer le document suffit. Avec le fine-tuning, il faut recommencer l'entraînement.


Ce qui fait la qualité d'un RAG

Le découpage

C'est le réglage qui décide de tout et personne n'en parle. Des morceaux trop courts perdent le contexte, des morceaux trop longs noient l'information utile. Le bon découpage suit la structure du document, par section plutôt qu'au nombre de caractères.

La qualité de la source

Un RAG branché sur une documentation périmée répond de façon périmée, avec assurance. Le ménage dans les documents est un préalable, pas une amélioration ultérieure.

Le nombre d'extraits remontés

Trop peu et la réponse est incomplète. Trop et l'information utile se dilue dans la Fenêtre de contexte. Entre trois et cinq extraits convient à la plupart des usages.

La consigne de repli

Sans instruction explicite du type « si la réponse n'est pas dans les extraits, dis-le », le modèle comblera les trous avec ses connaissances générales. Vous obtiendrez alors un mélange indiscernable entre vos documents et une Hallucination.


Où le mettre en place

Les cas qui rentabilisent l'effort se ressemblent : un corpus stable, des questions répétitives, et un coût réel de la mauvaise réponse.

Le support client de premier niveau arrive en tête. Vient ensuite l'accès à des procédures internes, où la question « comment fait-on déjà pour... » revient chaque semaine. Puis la documentation produit, où le volume dépasse toujours ce qu'une personne retient.

Attention

Un RAG mal réglé est plus dangereux qu'une absence de RAG. Il produit des réponses qui semblent fondées sur vos documents alors qu'elles viennent d'ailleurs. Exigez toujours l'affichage des extraits utilisés : sans cette traçabilité, vous ne pouvez rien vérifier.


Pourquoi un RAG répond mal, et par où commencer

Un système qui donne de mauvaises réponses a presque toujours l'une des cinq causes suivantes. Le symptôme permet de remonter directement à la bonne, ce qui évite de tout reprendre.

SymptômeCause la plus probableCorrection
Réponses correctes mais incomplètesTrop peu d'extraits remontésPasser de trois à cinq extraits
Réponses hors sujetDécoupage trop fin, contexte perduDécouper par section plutôt qu'au nombre de caractères
Le système invente malgré la baseAucune consigne de repliAjouter « si ce n'est pas dans les extraits, dis-le »
Informations périméesDocuments non mis à jourFaire le ménage dans la base, pas dans le réglage
Bon sur certaines questions, mauvais sur d'autresUn sujet absent de la documentationÉcrire la page manquante

La dernière ligne est la plus fréquente et la plus mal diagnostiquée. On passe des heures à régler le découpage et la recherche alors que l'information n'existe nulle part dans la base. Avant tout réglage technique, vérifiez qu'une personne trouverait la réponse en lisant vos documents.


Questions fréquentes

Question

Faut-il des compétences techniques pour en monter un ?

Plus autant qu'avant. Plusieurs outils d'automatisation proposent désormais des briques prêtes à l'emploi, où déposer des documents suffit à obtenir un système fonctionnel. Le réglage fin du découpage et la sélection des sources restent, eux, un travail de fond.


Question

Mes documents partent-ils chez le fournisseur du modèle ?

Les extraits sélectionnés voyagent dans le prompt, oui. La base elle-même reste où vous l'hébergez. Pour des documents sensibles, vérifiez les engagements de non-conservation de votre fournisseur, ou tournez-vous vers un modèle hébergé chez vous.


Question

Les grandes fenêtres de contexte vont-elles rendre le RAG inutile ?

Non, pour une raison économique. Même si vos dix mille pages tenaient dans la fenêtre, les envoyer à chaque question serait absurde. Le RAG n'existe pas seulement pour contourner une limite technique, il existe pour n'envoyer que ce qui sert.


Question

Comment démarrer sans se lancer dans un chantier ?

En choisissant un seul corpus bien délimité, par exemple vos vingt réponses types au support, plutôt que toute votre documentation. Notre formation n8n montre ce montage de bout en bout, du dépôt des documents à la vérification des extraits cités.

Termes connexes

Découvrez notre glossaire IA et automatisation

Le vocabulaire de l'intelligence artificielle et de l'automatisation, expliqué pour ceux qui veulent s'en servir dans leur activité, pas pour ceux qui construisent les modèles.

Partager cet article

Tu veux nous aider ? Fais un lien vers cet article sur tes réseaux ou encore mieux : sur ton site, dans un article ou dans ta newsletter.