给一项任务增加智能体,集体准确率会上升——直到大约十六个。越过这一点它开始下滑,群体不再收敛于一个答案,而是分裂成彼此背书的阵营(NTT Research, 2026)。这不是算力上限。也不是成本上限。这是协调上限——与支配人类团队的那一条相同,而它出现在一份默认"更多智能体等于更多产出"的路线图上。
这个数字本身与任务绑定,不会迁移到你的工作流。会迁移的是曲线的形状,而这个形状把智能体舰队规模从采购变量变成了设计变量:在任何智能体部署中,都存在一个点,越过它边际智能体是在做减法。
Flag Game 究竟测量了什么
实验来自 Harvard 脑科学中心(Center for Brain Science)资深数据科学家 Elizabeth Pavlova,以及领导 NTT Research 人工智能物理实验室与 Harvard CBS 智能物理项目的 Hidenori Tanaka。论文《Flag Game: Interpreting Decision Mechanisms of Bounded Social Agents》发表于 ICML 2026 的 AI4Good 研讨会(Pavlova & Tanaka, 2026)。
设置刻意简朴。每个智能体只看到一面隐藏国旗中随机分配的一小块碎片,没有任何一个能独自识别。要作答,整个群体必须沟通——智能体把猜测传给倾听者、向群体广播,或向一个返回意见的管理系统提问。当 85% 及以上的智能体在连续三轮中认定同一面国旗,或步数预算耗尽时,游戏结束(The Register, 2026)。
正是这个结构让结果值得运营负责人关注。它精准隔离出每个智能体工作流内含的张力:智能体的私有证据,对上从流水线其余部分涌来的社会性输入。调和二者不是模型能力问题,而是沟通结构问题。
在大约十六个智能体以下,群体无法拼出足够碎片来支撑一个有把握的集体答案。在其之上,失效模式反转:子群体形成,各自在内部验证立场而非对照证据。即便系统中的信息总量持续上升,集体准确率仍然下降。
曲线为何掉头向下
大多数路线图携带的直觉是:多智能体系统会优雅退化——更多智能体、更多噪声、边际递减,最终走平。Flag Game 的结果比走平更糟。它是下滑,而背后的机制是社会性的,不是技术性的。
"简单地增加更多 AI 智能体并不必然提升表现——正如雇更多人并不会自动让公司更高效,"Tanaka 在发布时表示。"沟通变得更困难,群体可能分裂成相互竞争的阵营"(NTT Research, 2026)。
把它当作运营陈述来读会让人不安,因为极化的智能体群体从外部看并不像坏掉了。它们产出自信、内部自洽的结果。共识依然在形成——在每个阵营内部。消失的是你本来在买的那个属性:独立证据的聚合。一支二十智能体舰队给出干脆的错误答案,远比六智能体舰队给出不确定答案昂贵,而这两种状态里只有一种会出现在你的监控上。
供应商的激励指向相反方向
两家主要实验室都把多智能体架构宣传为扩大 AI 价值的路径——OpenAI 经由 "swarm" 框架并推出 Agents SDK,Anthropic 经由多智能体编排(The Register, 2026)。这种定位隐含的意思是:生产力随智能体数量上升。请留意上升时是谁在付钱。
这不是在指控恶意;编排确实有用。这是在提醒:当研究说有效区间是有界的、而供应链上没有人有动力替你找到那条界线时,默认建议指向何方。
比 16 更重要的两项发现
这个标题数字会被引用一整年。真正改变中型市场运营团队周一动作的,是两项次级结论。
结构胜过规模。 研究者的框架是:企业 AI 表现不仅取决于你部署了多少智能体,还取决于这些智能体如何沟通、如何组织,以及人类如何引导它们的协作(NTT Research, 2026)。用他们的话说,挑战不是建更大的 AI 组织——而是设计更有效的组织。
模型多样性被点名为设计变量。 该研究把组织成功定位为规模、沟通、结构与模型多样性之间的平衡,强调智能体应互补而非重复。公开材料并未发布混合模型与单一模型团队的量化对比,因此应把这一方向视为作者的设计建议而非实测效应——但请注意,它正面抵触"标准化到单一供应商"的本能,而那正是多数采购职能的默认状态。
多样性论点为何有独立支撑
另有一条独立的证据线指向同一方向。一项涵盖 19 项研究、61 个效应量的系统综述与元分析发现,与生成式 AI 共创会产生小而稳健的产出同质化,d = 0.334,且无法由发表偏倚解释(de Rooij & Biskjaer, 2026)。机制是锚定:模型提供起点,人类展开细化,而细化在保住质量的同时摧毁了独立性。
这些研究比较的是"有 AI 协助"与"无 AI 协助"的工作,而非单供应商组织与多供应商组织。推广到供应商集中度是推论而非发现——我明确标注这一点。但两条独立的研究线如今汇聚到同一条运营警示上:一群依赖相同先验的智能体,会更快达成一致,也更没有信息量。在 Flag Game 里,一致是获胜条件。在你的业务里,一致恰恰是你原本想检验的东西。
16 不是什么
三条界限,在有人把它写进制度之前先讲清楚。
它不是可迁移的常数。 十六是某一项合成共识任务的峰值,带有特定的沟通拓扑与特定的停止规则。文档抽取流水线、代码评审舰队、客户分诊系统的证据结构各不相同,峰值会落在别处——可能是四,也可能是四十。
它不是关于智能体质量的论断。 下滑是群体沟通的属性,不是任何单个智能体推理能力的属性。更强的模型显然修不好它;更独立的证据来源也许可以。
它是研讨会论文,不是纵向企业研究。 AI4Good 是经同行评审的 ICML 研讨会分支,属于可信的早期科学——不是在生产部署中被复现的现场结果。请把它当作一份精心构造的机制预警,而不是一张校准表。
在这三条之后仍然成立的是那个不对称性。如果集体表现相对智能体数量呈倒 U 形而非上升直线,那么每一份智能体路线图都需要一个"停在哪里"的数字——而几乎没有一份有。
你早已在做的那个人类对照
Tanaka 关于招聘的类比不是装饰。运营负责人早就在管理一个协调上限,也早就知道那个数字,因为它写在组织架构图上。
Gallup 2026 年管理幅度数据显示,美国管理者平均直接下属为 12.1 人,高于前一年的 10.9——但中位数自 2013 年以来一直保持在五到六人,均值是被 25 人以上团队那条细尾巴拉高的(Gallup, 2026)。没有人主张带 40 人的管理者比带 13 人的有效三倍。我们正确地假设:协调成本吃掉了增量。
智能体舰队被豁免于这套推理,只有一个原因:在边际上智能体看起来是免费的。就准确率而言,它们在边际上并不免费;而 Flag Game 是第一份干净的证明——准确率成本先于费用科目到达。
与此同时,部署曲线不会等你。Microsoft 2026 年 Work Trend Index 报告称,Microsoft 365 生态中的活跃智能体同比增长 15 倍,大型企业中增长 18 倍(Microsoft, 2026)。舰队规模此刻正由配置工作流的人随手定下,而没有任何已声明的上限。
设计舰队,而不只是给它定规模
四个动作,按成本从低到高。
为每项任务设定舰队规模上限并写下来。 不是一条全局政策——是逐工作流的数字,刻意选定,记录在工作流旁边。重要的不是那个值,而是存在一个有人负责的值。
把下一块边际预算花在指令上,而不是人头上。 研究的核心主张是:人类如何结构化并引导系统,会移动集体表现。为既有舰队厘清任务规格只花一个下午;第十七个智能体要花一份许可证,还可能花掉准确率。
在任务属于判断而非吞吐的地方刻意混用模型。 对机械化的并行工作,同质化没问题,运维也更简单。当舰队的存在意义是权衡相互冲突的证据时,相同的先验就是失效模式——而标准化到单一供应商是抵达它的最快路径。
为极化设仪表,而不只为准确率。 记录一致性动态:共识形成得多快、在此之前出现多少个不同的答案簇、随着规模扩大异议是否更早消失。一支越大越快收敛的舰队,展示的是警报信号,不是改进。
本季度的一个决定
挑出你风险最高的智能体工作流——输出会送到客户、监管方或损益表的那一个。先按当前舰队规模跑一遍,再按一半跑一遍。如果准确率不变,你就找到了免费的余量和一个有效上限。如果下降,你就为已经选定的规模拿到了证据——这比大多数路线图能拿出的都多。
为智能体扩张买单的问题是我们能跑多少个。决定它是否奏效的问题是应该有多少个彼此对话。这两个问题里,只有一个在研究中有答案,而它比你供应商幻灯片暗示的要小。