Le prix du token baisse, votre facture monte
Deux faits coexistent, et ils semblent incompatibles.
Le prix du token s’effondre. Et les budgets IA des éditeurs de logiciels augmentent.
La contradiction n’est qu’apparente. Elle vient d’une confusion entre deux grandeurs distinctes : le prix unitaire que facture votre fournisseur, et le nombre d’unités que consomme votre produit. En langage de contrôle de gestion, l’effet valeur d’un côté, l’effet volume de l’autre.
Le premier baisse. Le second explose.
Comprendre ce décalage change la façon dont un éditeur construit son P&L.
La déflation est réelle, et spectaculaire
Commençons par valider le premier fait.
Epoch AI, institut de recherche spécialisé dans les trajectoires de l’IA, a mesuré la vitesse à laquelle tombe le prix nécessaire pour atteindre un niveau de performance donné. La méthode est publiée, le code est reproductible. Six benchmarks, trois ans de données.
Le résultat est net. Pour atteindre le niveau de GPT-4 sur des questions scientifiques de niveau doctorat, le prix a été divisé par 40 chaque année. Selon le palier de performance visé, la baisse s’échelonne de 9x à 900x par an, avec une médiane à 50x.
Cette déflation s’est même accélérée. Les baisses les plus rapides sont postérieures à janvier 2024. En restreignant l’analyse à cette période, la médiane passe de 50x à 200x par an.
Aucune commodité informatique n’a connu une telle chute. Ni le calcul pendant la révolution du microprocesseur, ni la bande passante pendant la bulle Internet.
Le premier fait est donc établi. Passons au second.
Les tokens que vous ne voyez pas
Un détail méthodologique d’Epoch AI mérite l’attention, parce qu’il contient toute l’explication.
Les chercheurs ont exclu les modèles de raisonnement de leur analyse du prix au token. La raison qu’ils donnent est directe : ces modèles génèrent un nombre de tokens bien supérieur aux autres, ce qui rend trompeuse toute comparaison de prix unitaire à performance égale.
Prenez la mesure de ce que ça signifie. L’institut de référence sur le sujet retire une catégorie entière de son calcul, parce que le prix au token n’y veut plus dire grand-chose.
Le mécanisme est simple. Un modèle de raisonnement produit deux types de tokens. Ceux que vous lisez dans la réponse. Et ceux qu’il génère pour réfléchir, que vous ne voyez pas mais que vous payez. Ces tokens de réflexion varient d’un ordre de grandeur d’un modèle à l’autre, sur une requête identique.
Ajoutez à cela l’architecture agentique. Un agent qui décompose une tâche, appelle des outils, évalue ses résultats et recommence consomme sans commune mesure avec une complétion simple. Votre coût unitaire baisse. Votre volume unitaire ne suit pas la même courbe.
Quand le modèle le moins cher coûte plus cher
Ce raisonnement vient d’être quantifié.
Une équipe de Stanford, UC Berkeley, CMU et Microsoft Research a évalué huit modèles de raisonnement de premier plan sur neuf tâches — mathématiques de compétition, questions scientifiques, génération de code, raisonnement multi-domaines. Objectif : comparer le prix affiché au coût réellement encouru.
Le résultat casse l’intuition. Dans 21,8 % des comparaisons entre paires de modèles, celui dont le prix catalogue est le plus bas coûte en réalité plus cher. L’écart atteint 28x dans les cas extrêmes.
Un exemple concret tiré de l’étude : Gemini 3 Flash affiche un tarif 78 % inférieur à celui de GPT-5.2. Son coût réel, mesuré sur l’ensemble des tâches, ressort 22 % plus élevé.
Les auteurs vont plus loin. Ils considèrent que prédire le coût réel d’une requête à partir de son prix et de son contenu constitue un problème ouvert, non résolu.
C’est un point à retenir. Des chercheurs qui disposent des données et des moyens de mesure concluent que le calcul n’est pas fiable en l’état.
Ce travail est disponible en preprint sur arXiv. Il n’a pas encore fait l’objet d’une relecture par les pairs.
Ce que ça change pour un éditeur de logiciel
Le problème n’est pas que l’IA soit chère. Il est que l’unité sur laquelle vous êtes facturé n’est pas celle que vous maîtrisez.
Vous contrôlez des requêtes, des utilisateurs, des cas d’usage. Vous êtes facturé en tokens. Entre les deux se glisse un coefficient qui dépend du modèle choisi, de la longueur de son raisonnement, du nombre d’itérations de vos agents. Ce coefficient, vous ne le connaissez pas à l’avance. Il change à chaque mise à jour de modèle.
Un second phénomène s’ajoute à ce coefficient invisible : le passage à l’échelle. Passer de quelques milliers de tâches à quelques millions n’est pas une simple multiplication du même problème par mille. Les cas rares deviennent fréquents, les requêtes longues ou complexes qui restaient marginales sur un panel de test deviennent la norme, et le coefficient tokens/tâche mesuré à petite échelle ne se maintient pas.
Trois conséquences pratiques :
- Une grille tarifaire adossée au tarif catalogue de votre fournisseur est fausse. D’un facteur inconnu, potentiellement d’un ordre de grandeur.
- Un arbitrage entre modèles fondé sur le prix affiché peut vous coûter plus cher. C’est exactement ce que mesure l’étude de Stanford.
- La déflation du prix unitaire n’est pas une protection. Elle est réelle, mais elle joue sur une variable que vos coûts totaux ne suivent pas : l’effet valeur est favorable, l’effet volume l’écrase.
La question à instruire n’est donc pas « quand le token sera-t-il assez bon marché ». Elle est : sur quelle unité voulez-vous construire votre modèle économique, et laquelle pouvez-vous réellement prévoir ?

Sources
- Cottier, Snodin, Owen & Adamczewski, LLM inference prices have fallen rapidly but unequally across tasks, Epoch AI, mars 2025 — epoch.ai/data-insights/llm-inference-price-trends (CC BY)
- Chen, Zhang, He, Stoica, Zaharia & Zou, The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More, preprint arXiv, mars 2026 — arxiv.org/abs/2603.23971
Maîtriser son modèle économique suppose de maîtriser son unité de coût. Agora Software fournit une plateforme multi-agents hébergée (on-prem ou cloud souverain) dont les coûts sont connus à l'avance, indépendamment du prix du token.
Intégrez l'IA dans votre logiciel avec Agora Software.
Parlons-en