Coût par token : comprendre et maîtriser sa facture IA

Le coût par token est le prix unitaire facturé par les fournisseurs d'IA, différent à l'entrée et à la sortie.
3 min de lecture
Believemy logo

C'est la seule unité qui permette de comparer deux fournisseurs et de prévoir une facture. Sans elle, vous choisissez un modèle sur son nom et vous découvrez le total à la fin du mois.


Définition

Le coût par token est le prix unitaire appliqué à chaque Token traité par un modèle. Il s'exprime généralement pour un million de jetons, et il diffère selon le sens.

SensCe qui est comptéPrix relatif
EntréeConsigne, historique, documents envoyésLe moins cher
SortieCe que le modèle rédigeTrois à cinq fois plus
Entrée en cacheConsigne déjà envoyée récemmentJusqu'à dix fois moins

La troisième ligne est celle que la plupart des gens ignorent, et c'est souvent la plus rentable : voir Cache de prompt.

Bon à savoir

Ne comparez jamais deux modèles sur le prix affiché seul. Un modèle deux fois plus cher qui répond juste du premier coup revient moins cher qu'un modèle bon marché qu'il faut relancer trois fois. La bonne unité de comparaison est le coût par tâche réussie.


Estimer une facture avant de se lancer

Le calcul tient en trois nombres : le nombre d'appels par mois, la taille moyenne de l'entrée, la taille moyenne de la sortie.

Un exemple concret. Un assistant de support traite 500 demandes par mois. Chaque demande envoie une consigne de 500 jetons, l'historique et trois extraits de documentation, soit environ 3 000 jetons en entrée. La réponse fait 300 jetons. Vous consommez 1,5 million de jetons en entrée et 150 000 en sortie chaque mois. Il ne reste qu'à multiplier par les tarifs du modèle visé.

Ce calcul de cinq minutes évite la plupart des mauvaises surprises, et surtout il montre où agir : ici, l'entrée pèse dix fois plus que la sortie, donc c'est la documentation envoyée qu'il faut réduire, pas la longueur des réponses.

Estimez votre facture mensuelle
500
2 000
200
Modèle
Coût mensuel estimé
6 $
dont 4 $ entrée · 2 $ sortie
1 466 667 jetons par mois

Tarifs indicatifs par million de jetons, à vérifier chez votre fournisseur. Le calcul convertit les mots en jetons au ratio de 4 pour 3.


Les cinq leviers, du plus efficace au moins efficace

Réduire ce que vous envoyez. Trois extraits bien choisis plutôt que dix pages. C'est presque toujours le levier numéro un.

Activer le cache quand la même consigne revient à chaque appel.

Choisir un modèle plus petit pour les tâches simples : classer, extraire, trier. L'écart de prix va de un à cinquante.

Limiter la longueur des réponses, puisque la sortie est la partie chère.

Regrouper les traitements pour ne pas renvoyer la consigne à chaque élément : voir Traitement par lot.

Attention

Le poste de dépense le plus fréquent n'est aucun de ces cinq points : c'est la conversation qui s'allonge. Chaque message renvoie tout l'historique. Au trentième échange, vous payez vingt-neuf fois le contexte accumulé.


Questions fréquentes

Question

Comment suivre sa consommation ?

Les interfaces professionnelles affichent la consommation par appel, et l'exposent dans leurs réponses. Le bon indicateur à surveiller n'est pas le montant mensuel mais le nombre de jetons par opération : un montant qui monte à activité constante signale une fuite.


Question

Les prix baissent-ils avec le temps ?

Ils ont beaucoup baissé ces dernières années à qualité constante. C'est un argument pour ne pas sur-optimiser trop tôt : ce qui coûte cher aujourd'hui peut devenir négligeable dans un an.


Question

Un agent coûte-t-il plus cher qu'un simple appel ?

Nettement, parce qu'une Boucle d'agent fait plusieurs appels, chacun transportant tout l'historique accumulé. C'est pour cette raison que le plafond de tours est un réglage de budget autant qu'un réglage technique.


Question

Comment garder cela sous contrôle dans un projet ?

En instrumentant la mesure dès le premier scénario plutôt qu'après la première facture surprenante. Notre formation n8n intègre ce suivi à la construction des automatisations.

Termes connexes

Découvrez notre glossaire IA et automatisation

Le vocabulaire de l'intelligence artificielle et de l'automatisation, expliqué pour ceux qui veulent s'en servir dans leur activité, pas pour ceux qui construisent les modèles.

Partager cet article

Tu veux nous aider ? Fais un lien vers cet article sur tes réseaux ou encore mieux : sur ton site, dans un article ou dans ta newsletter.