Chiffrez un agent de service client dans la banque et la facture de tokens atteint 20 à 25 pour cent de son coût variable d'exécution. La supervision humaine — des experts métier et risques qui vérifient le travail de l'agent — atteint 70 à 75 pour cent (McKinsey QuantumBlack, 2026).
Même workflow. Même facture. Et presque tous les business cases d'agents que j'ai lus cette année optimisent le plus petit des deux chiffres.
Choix du modèle, mise en cache des prompts, un niveau d'inférence moins cher pour les appels à faible enjeu : c'est là que va l'attention technique, parce que c'est là que le coût est lisible. Il arrive chaque mois, ligne par ligne, imputable. La supervision, elle, arrive sous forme d'heures salariées dans le centre de coûts de quelqu'un d'autre — elle n'est donc jamais comptabilisée comme un coût d'agent IA. Elle est comptabilisée comme la raison pour laquelle le pilote n'a jamais vraiment passé l'échelle.
Ce que McKinsey a réellement chiffré
Le guide de QuantumBlack du 24 août 2026 sur l'économie des workflows agentiques fait ce que presque toutes les analyses d'agents évitent : il chiffre le travail achevé, pas le logiciel. Agents, systèmes déterministes et humains qui relisent la production, le tout dans un seul coût complet.
Le cas phare est l'ouverture de compte bancaire. Le workflow mobilise cinq à sept agents aux côtés de plusieurs systèmes déterministes, avec deux à quatre équipes assurant la supervision. Le coût complet par onboarding achevé passe d'environ 50-150 dollars à environ 10-30 dollars (McKinsey QuantumBlack, 2026).
C'est une amélioration d'un facteur trois à cinq. Ce n'est donc pas un argument contre la rentabilité des agents. C'est un argument sur le fait que vous suivez la mauvaise ligne budgétaire pour savoir si les vôtres sont rentables.
Pour l'ordre de grandeur : McKinsey situe les workflows mono-agent en contact client, dans certaines banques, entre 20 000 et 30 000 dollars par an d'exploitation, et une équipe multi-agents entre 100 000 et 200 000 dollars. Ces chiffres proviennent d'une analyse McKinsey fondée sur la recherche publique et les tarifs publics, non sur des comptes clients audités : tenez fermement les ratios, tenez souplement les montants.
Ce qui détermine vraiment le coût d'un agent IA : le taux d'exception, pas le modèle
Dans l'onboarding client bancaire, McKinsey anticipe que 10 à 20 pour cent des exécutions agentiques seront relues par des experts risques et métier.
Ce taux de relecture, c'est toute la partie, et il vaut la peine de dérouler l'arithmétique lentement — l'illustration qui suit est la mienne, pas celle de McKinsey, mais les données d'entrée sont les leurs.
Prenez un workflow avec un taux de relecture de 15 % et 20 minutes d'expert par relecture. Sur 1 000 exécutions, cela fait 50 heures de temps métier senior. Ramenez le taux à 5 % et les mêmes 1 000 exécutions coûtent environ 17 heures. Vous avez supprimé deux tiers de la ligne coûteuse sans toucher à un modèle, à un prompt ou à un contrat fournisseur.
Et notez qui effectue cette relecture. McKinsey précise : des experts métier et risques — les personnes dont le jugement justifie l'existence même du workflow, pas un échelon junior de QA que vous pouvez staffer à bas coût. Le coût de supervision est élevé précisément parce qu'une supervision bon marché n'est pas de la supervision ; le relecteur doit être assez senior pour pouvoir désavouer l'agent. Tout plan qui suppose de déléguer la couche de relecture vers le bas est en réalité un plan pour cesser de relire.
Comparez maintenant avec le levier que tout le monde actionne réellement. McKinsey n'identifie que trois moteurs du coût des tokens : la qualité du modèle, l'exigence de latence et la fréquence de la tâche. Les tarifs de pointe début juillet 2026 tournaient autour de 5 dollars par million de tokens en entrée et 30 dollars par million en sortie pour un modèle haut de gamme, contre 0,20 et 1,25 dollar pour un modèle léger antérieur. Un écart d'un facteur vingt-cinq — appliqué à un quart de la facture.
Et voici le piège logé dans l'optimisation évidente. Rétrogradez le modèle pour réduire les tokens et vous augmentez le taux d'erreur. Un taux d'erreur plus élevé augmente le taux d'exception. Un taux d'exception plus élevé augmente les heures de relecture, c'est-à-dire les trois quarts. Les économies de tokens financent régulièrement une hausse de supervision que personne ne mesure, et le workflow devient plus cher pendant que le tableau de bord le montre moins cher.
Pourquoi les heures de relecture ne disparaissent pas
Des preuves indépendantes indiquent que la ligne supervision est structurelle, et non un problème de maturité dont on sort en grandissant.
MIT Technology Review Insights et Microsoft ont interrogé 300 dirigeants et praticiens de la tech et classé 101 tâches agentiques sur une échelle de confiance de 0 à 100. La confiance suivait la vérifiabilité de la tâche et la complétude du contexte métier, pas la capacité du modèle : la génération automatisée de rapports obtenait 83,5 et le code standard 82,5, chacun doté d'une métrique d'évaluation objective unique, tandis que la configuration de service mesh obtenait 37,5 et les tests de reprise après sinistre 43 — mêmes modèles sous-jacents, sans moyen net de savoir si le résultat était juste. La responsabilité inquiétait 48 % des répondants et les hallucinations 47 %, et 59 % prévoient déjà une supervision humaine permanente (MIT Technology Review Insights, 2026).
Les données de production vont dans le même sens. Une étude comparant le produit agentique de Perplexity à son produit de recherche a constaté que l'achèvement de tâches équivalentes passait de 269 minutes à 36 — une réduction de 87 % du temps et de 94 % du coût — tandis que le travail de suivi effectué par les utilisateurs se déplaçait vers le haut, vers la vérification et l'extension (arXiv 2606.07489, 2026).
Le travail humain se relocalise à l'étape de relecture. McKinsey est simplement le premier à mettre un prix sur l'endroit où il atterrit.
Volume et réutilisation décident si le calcul tient
L'autre moitié de l'économie décrite par McKinsey, c'est le coût fixe — et c'est la moitié qui détermine si les programmes d'agents du mid-market franchissent le seuil.
Un agent conversationnel assurant l'onboarding de 2 500 nouveaux clients par an coûte 10 000-15 000 dollars. Doublez le volume et le coût ne monte qu'à 15 000-20 000 dollars, parce que l'infrastructure IA et l'orchestration des agents sont largement fixes, et que les coûts fixes s'amortissent. Notez ce que contient cette ligne d'orchestration : une capacité permanente de data science pour maintenir l'agent en production, qui, observe McKinsey, « doit souvent être ajusté tous les deux jours ».
Les workflows à faible volume perdent donc deux fois. Ils n'obtiennent aucun amortissement sur le coût fixe, et leur ratio de supervision reste élevé parce qu'ils n'accumulent jamais assez d'exécutions pour que quelqu'un repère les motifs d'exception et les élimine par conception.
L'issue pour le mid-market est la réutilisation plutôt que l'échelle. Si aucun workflow ne porte à lui seul un volume suffisant pour amortir la ligne infrastructure et orchestration, la question devient : combien de workflows peuvent tourner sur une seule construction d'agent ? Le cadrage de McKinsey est de construire une fois et de déployer sur plusieurs workflows. Trois processus voisins partageant un agent, une couche de contexte et un protocole de relecture franchissent le seuil de coût fixe qu'aucun d'eux ne franchit seul. C'est une décision d'architecture qui se prend avant le premier pilote, et elle est très difficile à rattraper une fois que trois équipes ont chacune acheté leur propre solution ponctuelle.
Cette asymétrie est visible dans les données d'adoption. Le State of AI 2026 de McKinsey a constaté que les organisations de plus d'un milliard de dollars de chiffre d'affaires passant les agents à l'échelle sont passées de 27 % à 40 %, tandis que celles sous le milliard sont restées stables à 22 %. Environ 20 % ont indiqué que les coûts d'exploitation de l'IA limitaient leur usage, et la part attribuant à l'IA au moins un certain impact sur l'EBIT est restée à 37 %, inchangée d'une année sur l'autre (McKinsey, 2026).
L'adoption se cumule. L'impact financier déclaré, non. C'est la signature d'une ligne de coût que personne ne pilote.
L'objection honnête : il s'agit de banque, et c'est une estimation
Deux réserves que vous feriez mieux d'entendre de moi plutôt que de votre directeur financier.
Premièrement, le chiffre de 70-75 % provient de services financiers régulés et en contact client. L'intensité de la supervision est fonction de l'exposition réglementaire et de la conséquence de l'erreur. Le tri interne de tickets dans une entreprise logistique de 200 personnes se situe sur une autre courbe, et la répartition y est peut-être plus proche de l'équilibre.
Deuxièmement, ce sont des coûts modélisés, bâtis sur des tarifs publics et de la recherche publique, pas des comptes mesurés dans une mission client. Traitez-les comme une estimation bien spécifiée, pas comme une mesure.
Mais observez le sens de l'erreur. Le prix des tokens a baissé régulièrement et continuera de baisser. Les salaires des relecteurs, non, et ils ne le feront pas. Chaque mois qui passe déplace le ratio davantage au détriment des tokens, pas dans l'autre sens. Si 70-75 % est faux pour votre contexte aujourd'hui, la correction honnête consiste à se demander ce que ce sera dans dix-huit mois — pas à supposer que cela retombera vers quelque chose que le tableau de bord des tokens sait voir.
Chiffrez les heures de relecture avant d'approuver le pilote
Cinq choses à changer dans votre façon d'évaluer la prochaine proposition d'agent.
- Inscrivez le taux d'exception dans le business case comme un chiffre nommé. Pourcentage d'exécutions nécessitant une relecture humaine, minutes attendues par relecture, coût horaire chargé du relecteur. Si personne ne s'engage sur ces trois chiffres, vous n'avez pas un business case : vous avez une démo avec un budget agrafé dessus.
- Fabriquez la vérifiabilité avant d'élargir le périmètre. Le classement MIT–Microsoft montre que la confiance suit les tâches dotées d'une métrique de succès unique et lisible. Cette propriété se construit : instrumentez la métrique, encodez le contexte métier, resserrez le périmètre. Séquencez les déploiements par vérifiabilité, pas selon la tâche qui paraît la plus simple.
- Classez d'abord les workflows candidats par nombre d'exécutions annuelles. Réutilisation et volume sont ce qui amortit le coût fixe. Un cas d'usage astucieux à faible volume est un moins bon investissement qu'un cas d'usage ennuyeux à fort volume, à chaque fois.
- Budgétez explicitement la ligne maintenance. Des agents ajustés tous les deux jours exigent une capacité d'ingénierie permanente. C'est un coût fixe durable, pas une dépense de projet.
- Reportez le ROI du travail achevé. Coût complet pour terminer le travail — humains, agents et systèmes déterministes ensemble — rapporté à la valeur du travail. Pas le coût par token, ni les heures théoriquement économisées.
La prescription de McKinsey est l'inverse de l'instinct : plutôt que d'optimiser le choix du modèle, reconcevez le workflow pour réduire les taux d'exception et simplifier les processus de relecture qui déclenchent une intervention humaine coûteuse. C'est un mandat d'ingénierie des processus logé dans ce que tout le monde traitait comme une décision d'achat.
Ce qu'il faut décider ce trimestre
Trouvez le pilote d'agent qui attend votre signature et demandez un chiffre qui ne figure pas dans la présentation : les heures de relecture attendues pour cent exécutions.
Si la réponse est un haussement d'épaules, on ne vous demande pas d'approuver un logiciel. On vous demande de staffer une équipe de relecture que personne n'a budgétée — et de le faire sur les trois quarts du coût d'un agent IA que votre tableau de bord n'a jamais été conçu pour vous montrer.