Qu’est-ce que le « paradoxe de l’inférence », token en baisse mais workflow en hausse ?

Le « paradoxe de l’inférence » (ou Inference Paradox) selon Gartner désigne le phénomène suivant : le coût unitaire de l’inférence IA (par token) baisse fortement, mais le coût total par workflow d’agent IA augmente fortement, car les systèmes deviennent plus complexes et consomment beaucoup plus de tokens.

Gartner définit le paradoxe de l’inférence comme « de meilleures économies unitaires qui font augmenter le coût global de l’IA sans offrir de voie claire vers une valeur proportionnelle et prévisible ». En d’autres termes : les modèles deviennent moins chers par token (Gartner prévoit une baisse supérieure à 90 % des coûts d’inférence LLM d’ici 2030) ; mais les workflows d’agents IA (raisonnement, planification, appels d’outils, boucles, multi-étapes) utilisent beaucoup plus de tokens, y compris des tokens plus coûteux (modèles de raisonnement, appels répétés, etc.).

Résultat : le coût d’inférence par workflow agenté devrait augmenter de plus de 5 fois d’ici 2028, malgré la baisse du prix unitaire.

Pourquoi ce paradoxe apparaît ?

Plusieurs mécanismes expliquent ce phénomène :

  • Complexité croissante des workflows : les agents ne se contentent pas de répondre à une question ; ils raisonnent, re-planifient, appellent d’autres agents ou outils, et tournent en continu.
  • Utilisation de modèles plus puissants (et plus chers) : pour des tâches de planification, d’apprentissage ou de raisonnement, les entreprises utilisent des modèles dont le coût par token est 8 à 10 fois supérieur à celui d’un chatbot basique.
  • Effet Jevons appliqué à l’IA : quand une ressource (ici, le token) devient moins chère, on l’utilise beaucoup plus, ce qui peut faire augmenter la dépense totale.

Gartner résume cela par « le rythme de l’innovation dépasse la courbe de coût »).

Implications pour les entreprises

Pour les DSI, CFO et responsables de produits IA, le paradoxe de l’inférence implique de ne pas se fier uniquement à la baisse du coût par token pour budgétiser l’IA. De piloter les coûts en termes de « cost per outcome » (coût pour amener une tâche à un résultat acceptable), et non seulement en coût par token. Et de mettre en place une gouvernance FinOps IA : routage sémantique vers des modèles adaptés à la complexité de la tâche, suivi des coûts par workflow, contrôle de l’autonomie des agents.

En résumé, le paradoxe de l’inférence selon Gartner met en garde contre l’illusion que « l’IA devient moins chère » : l’unité de coût baisse, mais la facture globale augmente à cause de l’explosion de la consommation de tokens dans les workflows d’agents autonomes.

à lire