Fenêtre de contexte : la mémoire de travail d'une IA

La fenêtre de contexte est la quantité de texte qu'un modèle peut prendre en compte en une fois. Au-delà, l'information la plus ancienne disparaît.
4 min de lecture
Believemy logo

Vous avez sans doute déjà vécu la scène : une longue conversation avec un assistant, et au bout d'un moment il oublie une consigne donnée au début, ou contredit ce qu'il affirmait vingt messages plus tôt. Ce n'est pas un caprice, c'est la fenêtre de contexte qui a été dépassée.

C'est l'une des limites les plus structurantes de l'IA générative, et l'une des moins comprises. Elle explique une bonne part des déceptions, et sa maîtrise change complètement la qualité de ce que vous obtenez.


Définition

La fenêtre de contexte est la quantité maximale de texte qu'un modèle peut prendre en compte en une seule fois. Elle se mesure en Token et englobe tout : votre consigne, l'historique de la conversation, les documents fournis et la réponse en cours de rédaction.

L'image de la mémoire de travail est la plus juste. Ce n'est pas un disque dur où le modèle rangerait des informations, c'est un plan de travail de taille fixe. Tout ce qui doit être pris en compte doit y tenir simultanément.

Bon à savoir

Nuance essentielle : ce qui sort de la fenêtre n'est pas oublié, il n'a jamais existé pour le modèle. Il ne dira pas « je ne me souviens plus », il répondra comme si l'information n'avait jamais été donnée, avec la même assurance.

Ce que contient une fenêtre de contexteLa consigne, l'historique, les documents et la question occupent le même espace. Ce qui déborde sort du champ du modèle.Fenêtre de contexteConsigneHistoriqueDocumentsQuestionDébut de conversationsorti de la fenêtre : n'a jamais existé


Grande fenêtre ne veut pas dire bon résultat

Les fournisseurs mettent en avant des fenêtres de plus en plus vastes, capables d'avaler des centaines de pages. C'est un vrai progrès, mais qui s'accompagne de deux effets que le marketing mentionne rarement.

Le coût est proportionnel. Remplir une grande fenêtre à chaque appel se paie à chaque appel. Une conversation qui traîne cent pages de contexte coûte cent pages par message.

L'attention se dilue. Une consigne noyée au milieu de deux cents pages est nettement moins bien suivie que la même consigne accompagnée de trois extraits pertinents. Les modèles retiennent mieux le début et la fin de ce qu'on leur donne que le milieu.

SituationRéflexe efficace
Un document précis à analyserLe fournir en entier
Une base documentaire entièreMettre en place un RAG
Une conversation qui s'éterniseRésumer et repartir à neuf
Une consigne longue et récurrenteLa placer en Prompt système
Voyez ce qui sort de la fenêtre
Taille de la fenêtre
Consigne 500
Documents 2 000
Historique 4 500
Réponse à venir 1 000
500
2 000
20
5
message(s) sorti(s) de la fenêtre
Le modèle répond comme si ces échanges n'avaient jamais eu lieu.
8 000 / 8 000 jetons occupé

Un message coûte environ 300 jetons. La place réservée à la réponse est retirée du total disponible.


Bien utiliser l'espace disponible

Mettez l'essentiel aux extrémités. La consigne principale en début ou en fin de message est mieux suivie qu'au milieu d'un long bloc.

Choisissez plutôt que d'empiler. Trois extraits bien sélectionnés valent mieux que le dossier complet. Le tri en amont est le meilleur investissement que vous puissiez faire sur la qualité.

Structurez visiblement. Des titres, des séparateurs nets entre le document et la question. Un modèle suit mieux un texte organisé, exactement comme un lecteur pressé.

Surveillez le point de bascule. Quand les réponses commencent à contredire le début de la conversation, la fenêtre est saturée. Résumez et recommencez plutôt que d'insister.


Questions fréquentes

Question

Comment savoir si j'approche de la limite ?

Les signes sont assez nets : le modèle oublie une contrainte posée au départ, se répète, ou revient sur une décision déjà actée. Les interfaces professionnelles affichent en général la consommation de contexte, ce qui permet de ne pas naviguer à l'aveugle.


Question

Une plus grande fenêtre rend-elle le RAG inutile ?

Non, pour une raison de coût plus que de capacité. Même si vos dix mille pages tenaient dans la fenêtre, les envoyer à chaque question serait absurde économiquement. Le RAG ne sert pas seulement à contourner une limite technique, il sert à n'envoyer que ce qui est utile.


Question

Le modèle garde-t-il quelque chose entre deux conversations ?

Par défaut, non. Certains outils ajoutent une couche de mémoire qui réinjecte automatiquement des éléments des échanges précédents, mais c'est un mécanisme construit par-dessus le modèle, pas une capacité du modèle lui-même.


Question

Comment organiser un travail long sans saturer la fenêtre ?

En découpant en étapes qui produisent chacune un résultat écrit, réutilisable comme point de départ de l'étape suivante. C'est une méthode de travail plus qu'une astuce technique, et notre formation Claude Cowork l'applique à des dossiers longs, du cahier des charges au rapport final.

Termes connexes

Découvrez notre glossaire IA et automatisation

Le vocabulaire de l'intelligence artificielle et de l'automatisation, expliqué pour ceux qui veulent s'en servir dans leur activité, pas pour ceux qui construisent les modèles.

Partager cet article

Tu veux nous aider ? Fais un lien vers cet article sur tes réseaux ou encore mieux : sur ton site, dans un article ou dans ta newsletter.