LexiqueÉtage 4 · L’Organisationune mosaïque : l’IA n’y est qu’une case parmi d’autresÉtage 4 · L’Organisation
coût par token
Nº 074 · v2026-08EN : cost per tokenLe coût par token est le prix unitaire de ce que le modèle lit et écrit : il transforme un usage en facture, et il se paie à chaque appel, indéfiniment. Comme un compteur d’eau plutôt qu’un abonnement : ce n’est pas l’installation qui coûte, c’est l’ouverture du robinet.
Ce que ce n’est pas
Le coût par token n’est pas le coût d’un usage. Un utilisateur qui pose une question déclenche souvent plusieurs appels, chacun relisant une instruction permanente, des documents et un historique : la facture réelle se compte par tâche accomplie, pas par question posée. Ce n’est pas non plus un prix stable : il baisse continûment à performance égale, mais les usages qui apparaissent consomment davantage, si bien que la dépense totale d’une organisation augmente pendant que le prix unitaire s’effondre.
En profondeur
Quatre asymétries expliquent la plupart des surprises. La sortie est facturée nettement plus cher que l’entrée, ce qui rend coûteuses les réponses longues et les raisonnements détaillés. L’entrée déjà vue peut être mise en cache et payée une fraction du prix, à condition d’avoir composé le prompt pour cela. Les images consomment un grand nombre de tokens. Et les modèles de raisonnement facturent leurs étapes intermédiaires, même invisibles, ce qui multiplie le coût d’un facteur difficile à prévoir puisqu’il varie d’une exécution à l’autre.
La bonne unité de pilotage n’est donc pas le prix au million de tokens mais le coût par tâche réussie. Ce chiffre intègre ce qui compte vraiment : le nombre d’appels, la longueur du contexte transporté, les reprises après échec, et le taux d’échec lui-même, puisqu’une tâche ratée a coûté sans rien produire. Deux systèmes affichant le même modèle et le même tarif peuvent différer d’un ordre de grandeur sur cette mesure, et c’est elle qui décide de la viabilité d’un service.
Les leviers efficaces sont peu nombreux et se rangent par ordre de rendement. Ne pas appeler le modèle quand une règle simple suffit reste le premier. Employer un petit modèle pour trier et n’escalader vers un grand que sur les cas difficiles vient ensuite. Puis réduire ce qu’on transporte, en évitant de renvoyer un historique entier à chaque tour. Enfin, structurer le prompt pour le cache. À l’inverse, changer de fournisseur pour quelques pour cent de tarif est presque toujours le levier le moins rentable, et il coûte du temps d’équipe.
Relations où vivent les voisins
Vérifier 3 questions · cliquez votre réponse
Niveau 1 · Reconnaître
Qu’est-ce qui coûte le plus cher, à volume égal ?
Niveau 2 · Distinguer
Quelle grandeur faut-il piloter pour juger de la viabilité d’un service ?
Niveau 2 · Distinguer
Les prix unitaires s’effondrent. Pourquoi la facture d’une organisation augmente-t-elle ?
Lexigraph, « Coût par token », v2026-08, https://lexigraph.org/fr/cout-par-token, CC BY 4.0.