Scovai Scovai
AI & Operations 2026-08-12 1 min read

Votre flotte d'agents a un plafond — et les neuroscientifiques de Harvard le fixent à 16

DSL

Dr. Sarah Liu

Votre flotte d'agents a un plafond — et les neuroscientifiques de Harvard le fixent à 16

Ajoutez des agents à une tâche et la précision collective monte — jusqu'à seize environ. Au-delà, elle redescend : le groupe cesse de converger vers une réponse et se scinde en camps qui se confortent mutuellement (NTT Research, 2026). Pas une limite de capacité. Pas une limite de coût. Une limite de coordination — la même qui régit les équipes humaines, surgissant sur une feuille de route qui supposait que plus d'agents signifiait plus de production.

Le nombre lui-même est propre à la tâche et ne se transposera pas à vos flux de travail. Ce qui se transpose, c'est la forme de la courbe, et cette forme fait passer la taille de la flotte d'agents du statut de variable d'achat à celui de variable de conception : dans tout déploiement agentique, il existe un point où l'agent marginal retranche de la valeur.

Ce que le Flag Game a réellement mesuré

L'expérience vient d'Elizabeth Pavlova, senior data scientist au Center for Brain Science de Harvard, et d'Hidenori Tanaka, qui dirige le Physics of Artificial Intelligence Lab de NTT Research ainsi que le Physics of Intelligence Program au Harvard CBS. L'article — Flag Game: Interpreting Decision Mechanisms of Bounded Social Agents — a été présenté à l'atelier AI4Good d'ICML 2026 (Pavlova & Tanaka, 2026).

Le dispositif est volontairement dépouillé. Chaque agent ne voit qu'un petit fragment, attribué au hasard, d'un drapeau national caché. Aucun agent ne peut l'identifier seul. Pour répondre, la population doit communiquer — les agents transmettent leurs hypothèses à un auditeur, les diffusent au groupe, ou interrogent un système manager qui renvoie un avis. La partie s'achève lorsque 85 % ou plus des agents s'accordent sur le même drapeau pendant trois tours consécutifs, ou lorsque le budget d'étapes est épuisé (The Register, 2026).

C'est cette structure qui rend le résultat digne de l'attention d'un directeur des opérations. Elle isole exactement la tension que contient tout flux agentique : la preuve privée d'un agent face à l'apport social qui arrive du reste de la chaîne. Réconcilier les deux n'est pas un problème de capacité du modèle. C'est un problème de structure de communication.

En dessous de seize agents environ, la population ne parvient pas à réunir assez de fragments pour justifier une réponse collective assurée. Au-dessus, le mode de défaillance s'inverse : des sous-groupes se forment, et chacun valide sa position en interne plutôt que face aux preuves. La précision collective baisse alors même que l'information totale du système continue d'augmenter.

Pourquoi la courbe se retourne

L'intuition que portent la plupart des feuilles de route est qu'un système multi-agents se dégrade en douceur — plus d'agents, plus de bruit, rendements décroissants, puis un plateau. Le résultat du Flag Game est pire qu'un plateau. C'est un déclin, et le mécanisme qui le sous-tend est social, pas technique.

« Ajouter simplement plus d'agents IA n'améliore pas nécessairement la performance — de même qu'embaucher plus de personnes ne rend pas automatiquement une entreprise plus efficace », a déclaré Tanaka lors de la publication. « La communication devient plus difficile, et les groupes peuvent se scinder en camps concurrents » (NTT Research, 2026).

Lu comme une affirmation opérationnelle, c'est inconfortable : vues de l'extérieur, les populations d'agents polarisées n'ont pas l'air en panne. Elles produisent des résultats assurés et cohérents en interne. Le consensus se forme encore — à l'intérieur de chaque camp. Ce qui disparaît, c'est la propriété que vous achetiez : des preuves indépendantes, agrégées. Une flotte de vingt agents qui renvoie une réponse nette et fausse coûte bien plus cher qu'une flotte de six qui en renvoie une incertaine, et un seul de ces deux états apparaît dans votre supervision.

L'incitation des fournisseurs pointe dans l'autre sens

Les deux grands laboratoires ont promu les architectures multi-agents comme la voie pour démultiplier la valeur de l'IA — OpenAI via son cadrage « swarm » puis l'Agents SDK, Anthropic via l'orchestration multi-agents (The Register, 2026). L'implication de ce positionnement est que la productivité croît avec le nombre d'agents. Notez qui paie quand c'est le cas.

Ce n'est pas une accusation de mauvaise foi ; l'orchestration est réellement utile. C'est une remarque sur la direction que prend le conseil par défaut lorsque la recherche affirme que la plage utile est bornée et que personne dans la chaîne de valeur n'a intérêt à trouver cette borne à votre place.

Les deux conclusions qui comptent plus que le 16

Le chiffre d'accroche sera cité pendant un an. Les deux conclusions secondaires sont celles qui changent ce qu'une équipe ops de taille intermédiaire fait dès lundi.

La structure l'emporte sur l'échelle. Le cadrage des chercheurs est que la performance de l'IA en entreprise dépend non seulement du nombre d'agents déployés, mais de la façon dont ces agents communiquent, dont ils sont organisés et dont les humains guident leur collaboration (NTT Research, 2026). L'enjeu, selon leurs termes, n'est pas de bâtir des organisations IA plus grandes — c'est d'en concevoir de plus efficaces.

La diversité des modèles est nommée comme variable de conception. La recherche présente le succès organisationnel comme un équilibre entre échelle, communication, structure et diversité des modèles, avec des agents qui se complètent plutôt qu'ils ne se dupliquent. La publication publique ne fournit pas de comparaison chiffrée entre équipes multi-modèles et mono-modèle : traitez donc la direction comme une recommandation de conception des auteurs, non comme un effet mesuré — mais notez qu'elle va franchement à l'encontre du réflexe de standardisation sur un fournisseur unique, réflexe par défaut de la plupart des services achats.

Pourquoi le point sur la diversité bénéficie d'un appui indépendant

Un corpus de preuves distinct pointe dans le même sens. Une revue systématique avec méta-analyse portant sur 19 études et 61 tailles d'effet a montré que la co-création avec l'IA générative produit une homogénéisation des productions faible mais robuste, d = 0,334, non expliquée par un biais de publication (de Rooij & Biskjaer, 2026). Le mécanisme est l'ancrage : le modèle fournit le point de départ, l'humain élabore, et l'élaboration préserve la qualité tout en détruisant l'indépendance.

Ces études comparaient le travail assisté par IA au travail non assisté, et non les organisations mono-fournisseur aux multi-fournisseurs. L'extension à la concentration fournisseur est une inférence, pas un résultat — je le signale comme tel. Mais deux lignes de recherche indépendantes convergent désormais vers la même prudence opérationnelle : une population d'agents puisant dans des a priori identiques s'accordera plus vite et vaudra moins. Dans le Flag Game, l'accord est la condition de victoire. Dans votre entreprise, l'accord est précisément ce que vous cherchiez à éprouver.

Ce que 16 n'est pas

Trois limites, à poser avant que quiconque n'en fasse une politique.

Ce n'est pas une constante transposable. Seize est le pic pour une tâche de consensus synthétique unique, avec une topologie de communication et une règle d'arrêt spécifiques. Un pipeline d'extraction documentaire, une flotte de revue de code et un système de tri client ont des structures de preuve différentes et culmineront ailleurs — peut-être à quatre, peut-être à quarante.

Ce n'est pas une affirmation sur la qualité des agents. Le déclin est une propriété de la communication de la population, non du raisonnement d'un agent isolé. De meilleurs modèles n'y remédient pas de façon évidente ; des sources de preuve plus indépendantes, peut-être.

C'est un article d'atelier, pas une étude d'entreprise longitudinale. AI4Good est un track d'atelier ICML avec évaluation par les pairs, donc une science crédible en phase précoce — pas un résultat de terrain répliqué sur des déploiements en production. Traitez-le comme un avertissement bien conçu sur un mécanisme, pas comme une table d'étalonnage.

Ce qui survit à ces trois limites, c'est l'asymétrie. Si la performance collective en fonction du nombre d'agents est un U inversé et non une droite croissante, alors toute feuille de route agentique a besoin d'un nombre où elle s'arrête — et presque aucune n'en a un.

La comparaison humaine que vous menez déjà

L'analogie de Tanaka avec le recrutement n'est pas ornementale. Les directions des opérations gèrent déjà un plafond de coordination et en connaissent déjà le chiffre, parce qu'il figure sur l'organigramme.

Les données Gallup 2026 sur le span of control situent le manager américain moyen à 12,1 rapports directs, contre 10,9 l'année précédente — mais la médiane tient à cinq ou six depuis 2013, la moyenne étant tirée vers le haut par une fine queue d'équipes au-delà de 25 (Gallup, 2026). Personne ne soutient qu'un manager avec 40 rapports est 3 fois plus efficace qu'un manager avec 13. Nous supposons, à juste titre, que le coût de coordination mange le gain.

Les flottes d'agents ont été exemptées de ce raisonnement pour une seule raison : à la marge, les agents paraissent gratuits. Ils ne le sont pas à la marge en matière de précision, et le Flag Game est la première démonstration nette que le coût en précision arrive avant la ligne budgétaire.

Pendant ce temps, la courbe de déploiement n'attend pas. Le Work Trend Index 2026 de Microsoft fait état d'agents actifs dans l'écosystème Microsoft 365 en croissance de 15x d'une année sur l'autre, et de 18x dans les grandes entreprises (Microsoft, 2026). Les tailles de flotte se fixent en ce moment même, par quiconque configure le flux, sans aucun plafond déclaré.

Concevez la flotte, ne vous contentez pas de la dimensionner

Quatre mouvements, du moins coûteux au plus coûteux.

Plafonnez la taille de flotte par tâche et écrivez-le. Pas une politique globale — un nombre par flux de travail, choisi délibérément, consigné à côté du flux. Ce qui compte, moins que la valeur, c'est l'existence d'une valeur dont quelqu'un répond.

Dépensez le prochain dollar marginal en instruction, pas en effectifs. L'affirmation centrale de la recherche est que la manière dont les humains structurent et guident le système déplace la performance collective. Clarifier la spécification de la tâche pour une flotte existante coûte un après-midi ; le dix-septième agent coûte une licence et peut coûter de la précision.

Mélangez les modèles délibérément là où la tâche relève du jugement, pas du débit. Pour du travail parallèle mécanique, l'homogénéité convient et se pilote plus simplement. Là où la flotte existe pour peser des preuves contradictoires, des a priori identiques sont le mode de défaillance — et standardiser sur un fournisseur unique est le chemin le plus court pour y arriver.

Instrumentez la polarisation, pas seulement la précision. Consignez la dynamique d'accord : à quelle vitesse le consensus se forme, combien de grappes de réponses distinctes apparaissent avant, si le désaccord disparaît plus tôt à mesure que vous montez en échelle. Une flotte qui converge plus vite en grandissant vous montre le signal d'alarme, pas l'amélioration.

Une décision pour ce trimestre

Prenez votre flux agentique le plus critique — celui dont la production part vers un client, un régulateur ou le compte de résultat. Exécutez-le à sa taille de flotte actuelle, puis à la moitié. Si la précision tient, vous avez trouvé de la marge gratuite et un plafond opérationnel. Si elle baisse, vous disposez d'une preuve en faveur de la taille déjà retenue, ce qui est plus que ce que produisent la plupart des feuilles de route.

La question qui finance l'expansion des agents est combien pouvons-nous en faire tourner. La question qui détermine si cela fonctionne est combien devraient se parler entre eux. Une seule des deux a une réponse dans la recherche, et elle est plus petite que ne le laisse entendre la diapositive de votre fournisseur.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.