McKinsey alerte sur un écart de coût de 1 à 30 entre agents IA
Le 26 septembre, McKinsey a souligné que deux agents IA visant la même tâche peuvent entraîner des coûts très éloignés, malgré la baisse rapide du prix unitaire des tokens.

Le 26 septembre, McKinsey a averti que le coût d’exécution d’une même tâche par des agents d’IA pouvait varier dans un rapport allant jusqu’à 30. La raison tient aux chemins de résolution : deux systèmes poursuivant le même objectif peuvent multiplier différemment les appels au modèle, les vérifications, les tentatives et l’usage d’outils externes.
L’enjeu dépasse donc le tarif affiché par million de tokens. Une application agentique ne se contente pas forcément de répondre à une question, comme un chatbot. Elle peut décomposer un objectif, raisonner en plusieurs étapes, consulter des systèmes ou outils, examiner les résultats, modifier sa stratégie et poursuivre jusqu’à l’achèvement de la tâche.
Le prix du token ne résume pas la facture
Les coûts unitaires de l’IA ont pourtant fortement diminué. L’AI Index 2025 de Stanford a estimé que le coût d’une requête atteignant le niveau de performance de GPT-3.5 sur un benchmark standard de connaissances et de raisonnement était passé de 20 dollars par million de tokens en novembre 2022 à 0,07 dollar en octobre 2024. L’OCDE a, de son côté, estimé en juillet 2026 que les prix ajustés de la qualité des modèles texte-à-texte avaient baissé de près de 80 % entre janvier 2024 et avril 2026.
Cette baisse ne garantit pas une diminution de la dépense totale. Lors d’un récent échange avec des dirigeants, Coforge a indiqué que le coût unitaire des tokens nécessaires pour fournir le même niveau d’intelligence avait été divisé par environ 100 en sept mois, tandis que la consommation de tokens avait été multipliée par environ 8 000. Ces données reflètent les plateformes observées par l’entreprise, mais elles illustrent le mécanisme : un usage devenu moins cher peut être déployé beaucoup plus largement.
- Évaluer le coût d’une tâche achevée, et non les seuls tokens consommés.
- Inclure les appels aux modèles, les outils, le calcul, l’orchestration et le contrôle humain.
- Comparer les agents qui traitent un même objectif par des procédures différentes.
- Affecter les modèles les plus coûteux aux tâches qui exigent réellement leurs capacités.
Le développement logiciel concentre les risques
McKinsey cible particulièrement les équipes de développement logiciel, où l’automatisation du code par des agents peut être très gourmande en tokens. Un document de travail de 2026, signé par des chercheurs de l’université du Michigan, de Stanford, d’All Hands AI, de Google DeepMind, de Microsoft AI et du MIT, a relevé que des tâches de programmation agentique consommaient environ 1 000 fois plus de tokens que les tâches de raisonnement sur le code et de dialogue sur le code utilisées à titre de comparaison.
Cette même étude a constaté que l’exécution d’une même tâche pouvait varier jusqu’à 30 fois en consommation totale de tokens. Cela ne signifie pas que toute consommation élevée est inutile : une procédure plus longue peut parfois aboutir à un résultat plus pertinent. En revanche, le résultat montre que les factures peuvent s’écarter fortement lorsque le système recommence, explore plusieurs pistes ou appelle davantage d’outils.
Des budgets sous pression
Selon l’enquête IA 2026 de McKinsey, environ un tiers des organisations interrogées prévoyaient de consacrer plus de 10 % de leur budget technologie et communications à l’IA. Soixante pour cent prévoyaient d’augmenter leurs dépenses l’année suivante et environ un cinquième déclaraient que ces dépenses pesaient déjà sur leurs coûts d’exploitation. Des responsables de McKinsey ont décrit ces montants comme de plus en plus concrets et visibles.
Une autre enquête McKinsey, Enterprise AI FinOps, publiée en mai 2026 auprès de 75 répondants qualifiés dans cinq secteurs, a indiqué que 93 % dépassaient leur budget IA. McKinsey a également cité des données de Menlo Ventures selon lesquelles les dépenses des entreprises en grands modèles de langage avaient environ triplé durant les douze mois achevés fin 2025. Ces chiffres portent sur des enquêtes et estimations précises, non sur l’ensemble des entreprises.
Le gain de productivité doit être démontré
McKinsey avait auparavant estimé que l’IA agentique pouvait réduire de 35 % à 40 % le temps humain consacré à certaines tâches de bureaux de transformation, et de plus de 70 % dans certains cas. Mais un gain de temps ne constitue pas, à lui seul, une preuve de rentabilité. Il faut aussi apprécier la fiabilité du résultat, le travail de vérification, l’usage réel du temps libéré et la valeur économique obtenue.
Pour les entreprises françaises et européennes, la conséquence pratique est de suivre le coût complet d’un flux de travail plutôt que de négocier seulement un tarif de tokens. Elles peuvent répartir les tâches entre plusieurs modèles, y compris des modèles à poids ouverts pour certains usages et des modèles de pointe pour les demandes complexes. McKinsey estime que, dans les douze prochains mois, la mesure conjointe des bénéfices et des coûts des agents deviendra un sujet majeur de gestion.



