C'est la seule unité qui permette de comparer deux fournisseurs et de prévoir une facture. Sans elle, vous choisissez un modèle sur son nom et vous découvrez le total à la fin du mois.
Définition
Le coût par token est le prix unitaire appliqué à chaque Token traité par un modèle. Il s'exprime généralement pour un million de jetons, et il diffère selon le sens.
| Sens | Ce qui est compté | Prix relatif |
|---|---|---|
| Entrée | Consigne, historique, documents envoyés | Le moins cher |
| Sortie | Ce que le modèle rédige | Trois à cinq fois plus |
| Entrée en cache | Consigne déjà envoyée récemment | Jusqu'à dix fois moins |
La troisième ligne est celle que la plupart des gens ignorent, et c'est souvent la plus rentable : voir Cache de prompt.
Ne comparez jamais deux modèles sur le prix affiché seul. Un modèle deux fois plus cher qui répond juste du premier coup revient moins cher qu'un modèle bon marché qu'il faut relancer trois fois. La bonne unité de comparaison est le coût par tâche réussie.
Estimer une facture avant de se lancer
Le calcul tient en trois nombres : le nombre d'appels par mois, la taille moyenne de l'entrée, la taille moyenne de la sortie.
Un exemple concret. Un assistant de support traite 500 demandes par mois. Chaque demande envoie une consigne de 500 jetons, l'historique et trois extraits de documentation, soit environ 3 000 jetons en entrée. La réponse fait 300 jetons. Vous consommez 1,5 million de jetons en entrée et 150 000 en sortie chaque mois. Il ne reste qu'à multiplier par les tarifs du modèle visé.
Ce calcul de cinq minutes évite la plupart des mauvaises surprises, et surtout il montre où agir : ici, l'entrée pèse dix fois plus que la sortie, donc c'est la documentation envoyée qu'il faut réduire, pas la longueur des réponses.
Tarifs indicatifs par million de jetons, à vérifier chez votre fournisseur. Le calcul convertit les mots en jetons au ratio de 4 pour 3.
Les cinq leviers, du plus efficace au moins efficace
Réduire ce que vous envoyez. Trois extraits bien choisis plutôt que dix pages. C'est presque toujours le levier numéro un.
Activer le cache quand la même consigne revient à chaque appel.
Choisir un modèle plus petit pour les tâches simples : classer, extraire, trier. L'écart de prix va de un à cinquante.
Limiter la longueur des réponses, puisque la sortie est la partie chère.
Regrouper les traitements pour ne pas renvoyer la consigne à chaque élément : voir Traitement par lot.
Le poste de dépense le plus fréquent n'est aucun de ces cinq points : c'est la conversation qui s'allonge. Chaque message renvoie tout l'historique. Au trentième échange, vous payez vingt-neuf fois le contexte accumulé.
Questions fréquentes
Comment suivre sa consommation ?
Les interfaces professionnelles affichent la consommation par appel, et l'exposent dans leurs réponses. Le bon indicateur à surveiller n'est pas le montant mensuel mais le nombre de jetons par opération : un montant qui monte à activité constante signale une fuite.
Les prix baissent-ils avec le temps ?
Ils ont beaucoup baissé ces dernières années à qualité constante. C'est un argument pour ne pas sur-optimiser trop tôt : ce qui coûte cher aujourd'hui peut devenir négligeable dans un an.
Un agent coûte-t-il plus cher qu'un simple appel ?
Nettement, parce qu'une Boucle d'agent fait plusieurs appels, chacun transportant tout l'historique accumulé. C'est pour cette raison que le plafond de tours est un réglage de budget autant qu'un réglage technique.
Comment garder cela sous contrôle dans un projet ?
En instrumentant la mesure dès le premier scénario plutôt qu'après la première facture surprenante. Notre formation n8n intègre ce suivi à la construction des automatisations.