Cache de prompt : diviser sa facture sans rien changer

Le cache de prompt permet de ne pas repayer plein tarif une consigne déjà envoyée récemment au modèle.
3 min de lecture
Believemy logo

C'est l'optimisation la plus rentable et la moins connue. Elle ne demande aucun changement dans vos consignes ni dans vos résultats, seulement un réglage. Sur un usage régulier, elle divise couramment la facture par deux ou trois.


Définition

Le cache de prompt est un mécanisme qui permet au fournisseur de conserver temporairement une portion de contexte déjà traitée, et de la facturer à tarif très réduit lors des appels suivants.

Le principe est simple : si vous envoyez à chaque appel les mêmes 3 000 jetons de consigne et de documentation, le modèle n'a pas besoin de les retraiter intégralement à chaque fois.

Bon à savoir

La condition à respecter est structurelle : le cache fonctionne sur le début du prompt. Il faut donc placer ce qui ne change pas en premier, et ce qui change à la fin. Une seule variable en début de consigne suffit à invalider tout le cache.


Ce qu'il faut mettre en cache

À mettre au début, en cacheÀ laisser à la fin
Le Prompt systèmeLa question de l'utilisateur
La documentation de référenceLes données du jour
Les exemples de styleL'historique récent
Les règles métierLe contexte variable

Une erreur fréquente consiste à insérer la date du jour ou un identifiant de session en tête de consigne. Cela paraît anodin et cela annule tout le bénéfice : chaque appel devient un premier appel.


Quand ça vaut le coup

Un assistant avec une longue consigne fixe. C'est le cas idéal : la consigne est identique à chaque appel, seule la question change.

Un système de RAG avec des extraits récurrents. Si les mêmes documents ressortent souvent, ils sont candidats au cache.

Un Agent IA qui boucle. Chaque tour renvoie tout l'historique. Le cache y prend tout son sens, puisque le début ne change jamais.

À l'inverse, si chacun de vos appels est différent et court, le cache n'apporte rien et peut même coûter un peu plus cher à l'écriture.

Attention

Le cache a une durée de vie courte, de quelques minutes à quelques dizaines de minutes selon les fournisseurs. Sur un usage très espacé, il expire entre deux appels et ne sert à rien. Il faut un rythme régulier pour qu'il soit rentable.


Questions fréquentes

Question

Faut-il l'activer manuellement ?

Cela dépend du fournisseur : certains l'appliquent automatiquement, d'autres demandent de marquer explicitement la portion à conserver. C'est un point à vérifier dans la documentation, car le gain est trop important pour être laissé au hasard.


Question

Le résultat change-t-il ?

Non, c'est un mécanisme de facturation et de performance. La réponse produite est la même, elle arrive simplement plus vite et coûte moins cher.


Question

Mes données restent-elles stockées ?

Le cache est temporaire et isolé par compte. Il ne constitue pas une conservation de vos données au sens contractuel, mais si le sujet est sensible, la question mérite d'être posée à votre fournisseur.


Question

Comment savoir si mon cache fonctionne ?

Les réponses de l'API indiquent le nombre de jetons lus depuis le cache. Si ce nombre reste à zéro, c'est que votre consigne varie en tête. Notre formation n8n montre comment structurer les appels pour en tirer parti.

Termes connexes

Découvrez notre glossaire IA et automatisation

Le vocabulaire de l'intelligence artificielle et de l'automatisation, expliqué pour ceux qui veulent s'en servir dans leur activité, pas pour ceux qui construisent les modèles.

Partager cet article

Tu veux nous aider ? Fais un lien vers cet article sur tes réseaux ou encore mieux : sur ton site, dans un article ou dans ta newsletter.