C'est l'optimisation la plus rentable et la moins connue. Elle ne demande aucun changement dans vos consignes ni dans vos résultats, seulement un réglage. Sur un usage régulier, elle divise couramment la facture par deux ou trois.
Définition
Le cache de prompt est un mécanisme qui permet au fournisseur de conserver temporairement une portion de contexte déjà traitée, et de la facturer à tarif très réduit lors des appels suivants.
Le principe est simple : si vous envoyez à chaque appel les mêmes 3 000 jetons de consigne et de documentation, le modèle n'a pas besoin de les retraiter intégralement à chaque fois.
La condition à respecter est structurelle : le cache fonctionne sur le début du prompt. Il faut donc placer ce qui ne change pas en premier, et ce qui change à la fin. Une seule variable en début de consigne suffit à invalider tout le cache.
Ce qu'il faut mettre en cache
| À mettre au début, en cache | À laisser à la fin |
|---|---|
| Le Prompt système | La question de l'utilisateur |
| La documentation de référence | Les données du jour |
| Les exemples de style | L'historique récent |
| Les règles métier | Le contexte variable |
Une erreur fréquente consiste à insérer la date du jour ou un identifiant de session en tête de consigne. Cela paraît anodin et cela annule tout le bénéfice : chaque appel devient un premier appel.
Quand ça vaut le coup
Un assistant avec une longue consigne fixe. C'est le cas idéal : la consigne est identique à chaque appel, seule la question change.
Un système de RAG avec des extraits récurrents. Si les mêmes documents ressortent souvent, ils sont candidats au cache.
Un Agent IA qui boucle. Chaque tour renvoie tout l'historique. Le cache y prend tout son sens, puisque le début ne change jamais.
À l'inverse, si chacun de vos appels est différent et court, le cache n'apporte rien et peut même coûter un peu plus cher à l'écriture.
Le cache a une durée de vie courte, de quelques minutes à quelques dizaines de minutes selon les fournisseurs. Sur un usage très espacé, il expire entre deux appels et ne sert à rien. Il faut un rythme régulier pour qu'il soit rentable.
Questions fréquentes
Faut-il l'activer manuellement ?
Cela dépend du fournisseur : certains l'appliquent automatiquement, d'autres demandent de marquer explicitement la portion à conserver. C'est un point à vérifier dans la documentation, car le gain est trop important pour être laissé au hasard.
Le résultat change-t-il ?
Non, c'est un mécanisme de facturation et de performance. La réponse produite est la même, elle arrive simplement plus vite et coûte moins cher.
Mes données restent-elles stockées ?
Le cache est temporaire et isolé par compte. Il ne constitue pas une conservation de vos données au sens contractuel, mais si le sujet est sensible, la question mérite d'être posée à votre fournisseur.
Comment savoir si mon cache fonctionne ?
Les réponses de l'API indiquent le nombre de jetons lus depuis le cache. Si ce nombre reste à zéro, c'est que votre consigne varie en tête. Notre formation n8n montre comment structurer les appels pour en tirer parti.