Si vous ne deviez retenir qu'un seul terme technique de tout ce glossaire pour maîtriser vos coûts, ce serait celui-là. Le token est l'unité dans laquelle un modèle lit, écrit et facture. Tout le reste en découle.
C'est aussi le mot qui explique les factures surprises. Une automatisation qui semblait coûter quelques centimes finit à plusieurs centaines d'euros par mois, et la réponse est presque toujours dans le nombre de jetons consommés sans qu'on y prenne garde.
Définition
Un token, ou jeton, est un morceau de texte tel que le modèle le découpe. Ce n'est ni un caractère, ni exactement un mot : c'est une unité intermédiaire, souvent un mot court entier ou un fragment de mot long.
En français, comptez environ cinq jetons pour trois mots. Un e-mail de 300 mots pèse donc autour de 500 jetons, une page A4 environ 850, un contrat de vingt pages autour de 17 000.
Les langues ne sont pas égales devant le découpage. L'anglais consomme moins de jetons que le français pour le même contenu, parce que les modèles ont été majoritairement entraînés sur de l'anglais. À contenu identique, une consigne rédigée en anglais coûte souvent 25 à 30 % de moins.
Pourquoi cette unité décide de votre facture
Tous les fournisseurs facturent au jeton, avec une distinction que beaucoup découvrent trop tard : l'entrée et la sortie n'ont pas le même prix.
| Sens | Ce que c'est | Prix relatif |
|---|---|---|
| Entrée | Tout ce que vous envoyez : consigne, historique, documents | Le moins cher |
| Sortie | Ce que le modèle produit | Souvent trois à cinq fois plus cher |
Cette asymétrie a une conséquence contre-intuitive. Demander un résumé de dix lignes à partir d'un document de cinquante pages coûte peu, alors que demander un texte long à partir d'une consigne d'une ligne coûte cher. Ce n'est pas la question qui pèse, c'est la réponse.
Les trois pièges qui font exploser la note
L'historique renvoyé à chaque message
Dans une conversation, tout l'échange précédent est renvoyé au modèle à chaque nouveau message. Au vingtième message, vous payez donc dix-neuf fois le contexte accumulé. C'est le premier poste de gaspillage, et le plus invisible.
Le document collé en entier
Envoyer un manuel de cent pages pour poser une question sur un paragraphe fonctionne, mais coûte cent pages à chaque question. C'est exactement le problème que résout le RAG.
La boucle sans plafond
Un Agent IA qui enchaîne les étapes consomme à chaque tour. Sans limite du nombre d'étapes, un agent bloqué sur un problème insoluble peut brûler un budget mensuel en une nuit.
Le bon réflexe de suivi n'est pas de surveiller le montant global en fin de mois, mais le nombre de jetons par opération. Un montant qui double parce que l'activité a doublé est sain. Un montant qui double à activité constante signale une fuite.
Comment réduire la consommation
Repartez d'une conversation neuve. Dès qu'un échange s'éloigne du sujet initial, ouvrez-en un autre avec un court résumé. Vous coupez l'accumulation à la racine.
Utilisez le cache quand il est disponible. Si la même longue consigne revient à chaque appel, la plupart des fournisseurs proposent de la mettre en cache à tarif réduit. Sur un volume important, l'économie est considérable.
Choisissez la taille du modèle selon la tâche. Un petit modèle coûte souvent dix fois moins qu'un grand. Sur du tri ou de l'extraction, la qualité est équivalente.
Demandez des réponses courtes. Comme la sortie est la partie chère, préciser « en trois phrases » agit directement sur la facture.
Combien de jetons dans vos contenus habituels
Ces ordres de grandeur suffisent à dimensionner un projet sans outil de comptage. Ils valent pour du français : l'anglais, plus économe, tourne plutôt autour de quatre jetons pour trois mots.
| Contenu | Mots | Jetons environ |
|---|---|---|
| Un message court | 30 | 50 |
| Un e-mail courant | 150 | 250 |
| Une page A4 | 500 | 850 |
| Une fiche produit détaillée | 800 | 1 350 |
| Un article de blog | 1 500 | 2 550 |
| Un contrat de vingt pages | 10 000 | 17 000 |
| Un livre de deux cents pages | 80 000 | 136 000 |
Deux repères à garder en tête à partir de ce tableau. Une conversation de trente échanges transporte, au dernier message, l'équivalent d'un article de blog en entrée, et vous le payez à chaque nouveau message. Et un document que vous collez pour poser une seule question vous coûte son poids entier à chaque question posée, ce qui devient absurde au-delà de trois ou quatre.
Estimation, pas un comptage exact. Chaque modèle a son propre découpage : ce simulateur reproduit le principe et donne le bon ordre de grandeur, pas le chiffre de votre fournisseur.
Questions fréquentes
Comment savoir combien de jetons contient mon texte ?
La plupart des fournisseurs mettent à disposition un outil de comptage, et leurs interfaces professionnelles affichent la consommation réelle de chaque appel. Pour une estimation rapide, la règle des trois jetons pour quatre mots suffit largement à dimensionner un projet.
Un jeton coûte-t-il le même prix partout ?
Non, les écarts entre modèles vont de un à cinquante. C'est pourquoi raisonner en jetons plutôt qu'en euros permet de comparer : mesurez d'abord combien de jetons consomme votre usage, puis appliquez le tarif du modèle envisagé.
La longueur de ma question influence-t-elle la qualité de la réponse ?
Jusqu'à un certain point, oui : donner du contexte améliore nettement le résultat. Au-delà, l'effet s'inverse. Une consigne noyée dans dix pages de matériel accessoire est moins bien suivie qu'une consigne nette avec deux extraits bien choisis.
Comment garder ces coûts sous contrôle dans une automatisation ?
En posant dès le départ un plafond d'étapes et une alerte de budget, avant même que l'automatisation ne tourne en production. Notre formation n8n aborde cette mise sous contrôle en même temps que la construction des scénarios, plutôt que comme un correctif après coup.