Vous avez sans doute déjà vécu la scène : une longue conversation avec un assistant, et au bout d'un moment il oublie une consigne donnée au début, ou contredit ce qu'il affirmait vingt messages plus tôt. Ce n'est pas un caprice, c'est la fenêtre de contexte qui a été dépassée.
C'est l'une des limites les plus structurantes de l'IA générative, et l'une des moins comprises. Elle explique une bonne part des déceptions, et sa maîtrise change complètement la qualité de ce que vous obtenez.
Définition
La fenêtre de contexte est la quantité maximale de texte qu'un modèle peut prendre en compte en une seule fois. Elle se mesure en Token et englobe tout : votre consigne, l'historique de la conversation, les documents fournis et la réponse en cours de rédaction.
L'image de la mémoire de travail est la plus juste. Ce n'est pas un disque dur où le modèle rangerait des informations, c'est un plan de travail de taille fixe. Tout ce qui doit être pris en compte doit y tenir simultanément.
Nuance essentielle : ce qui sort de la fenêtre n'est pas oublié, il n'a jamais existé pour le modèle. Il ne dira pas « je ne me souviens plus », il répondra comme si l'information n'avait jamais été donnée, avec la même assurance.
Grande fenêtre ne veut pas dire bon résultat
Les fournisseurs mettent en avant des fenêtres de plus en plus vastes, capables d'avaler des centaines de pages. C'est un vrai progrès, mais qui s'accompagne de deux effets que le marketing mentionne rarement.
Le coût est proportionnel. Remplir une grande fenêtre à chaque appel se paie à chaque appel. Une conversation qui traîne cent pages de contexte coûte cent pages par message.
L'attention se dilue. Une consigne noyée au milieu de deux cents pages est nettement moins bien suivie que la même consigne accompagnée de trois extraits pertinents. Les modèles retiennent mieux le début et la fin de ce qu'on leur donne que le milieu.
| Situation | Réflexe efficace |
|---|---|
| Un document précis à analyser | Le fournir en entier |
| Une base documentaire entière | Mettre en place un RAG |
| Une conversation qui s'éternise | Résumer et repartir à neuf |
| Une consigne longue et récurrente | La placer en Prompt système |
Un message coûte environ 300 jetons. La place réservée à la réponse est retirée du total disponible.
Bien utiliser l'espace disponible
Mettez l'essentiel aux extrémités. La consigne principale en début ou en fin de message est mieux suivie qu'au milieu d'un long bloc.
Choisissez plutôt que d'empiler. Trois extraits bien sélectionnés valent mieux que le dossier complet. Le tri en amont est le meilleur investissement que vous puissiez faire sur la qualité.
Structurez visiblement. Des titres, des séparateurs nets entre le document et la question. Un modèle suit mieux un texte organisé, exactement comme un lecteur pressé.
Surveillez le point de bascule. Quand les réponses commencent à contredire le début de la conversation, la fenêtre est saturée. Résumez et recommencez plutôt que d'insister.
Questions fréquentes
Comment savoir si j'approche de la limite ?
Les signes sont assez nets : le modèle oublie une contrainte posée au départ, se répète, ou revient sur une décision déjà actée. Les interfaces professionnelles affichent en général la consommation de contexte, ce qui permet de ne pas naviguer à l'aveugle.
Une plus grande fenêtre rend-elle le RAG inutile ?
Non, pour une raison de coût plus que de capacité. Même si vos dix mille pages tenaient dans la fenêtre, les envoyer à chaque question serait absurde économiquement. Le RAG ne sert pas seulement à contourner une limite technique, il sert à n'envoyer que ce qui est utile.
Le modèle garde-t-il quelque chose entre deux conversations ?
Par défaut, non. Certains outils ajoutent une couche de mémoire qui réinjecte automatiquement des éléments des échanges précédents, mais c'est un mécanisme construit par-dessus le modèle, pas une capacité du modèle lui-même.
Comment organiser un travail long sans saturer la fenêtre ?
En découpant en étapes qui produisent chacune un résultat écrit, réutilisable comme point de départ de l'étape suivante. C'est une méthode de travail plus qu'une astuce technique, et notre formation Claude Cowork l'applique à des dossiers longs, du cahier des charges au rapport final.