为银行业的一个客服智能体核算成本,token 账单占其可变运行成本的 20% 到 25%。而人工监督——由职能专家与风险专家复核智能体的产出——占 70% 到 75% (McKinsey QuantumBlack, 2026)。
同一套工作流。同一张账单。而我今年读到的几乎每一份智能体商业论证,优化的都是那个更小的数字。
模型选型、提示缓存、为低风险调用启用更便宜的推理层级——工程注意力都投向了这些地方,因为成本在那里是可读的。它按月到账、逐项列明、可以归属。监督成本则以工资工时的形式落在别人的成本中心里,因此它从来不会被计入 AI 智能体成本,只会被计作试点悄无声息地未能规模化的原因。
麦肯锡究竟为什么定了价
QuantumBlack 于 2026 年 8 月 24 日发布的智能体工作流经济学指南,做了一件几乎所有智能体分析都跳过的事:它为已完成的工作定价,而不是为软件定价。智能体、确定性系统,以及复核产出的人,全部计入一个完全负担成本数字。
标志性案例是银行开户。该工作流动用五到七个智能体,配合多个确定性系统,并由两到四个团队提供监督。每完成一次开户的完全负担成本,从大约 50–150 美元降至约 10–30 美元 (McKinsey QuantumBlack, 2026)。
这是三到五倍的改善。所以这并不是在论证智能体不划算,而是在论证:你盯错了成本科目,因而无从判断自家的智能体是否划算。
给个量级参考:麦肯锡估算,某些银行面向客户的单智能体工作流每年运行成本为 2 万至 3 万美元,多智能体团队则为 10 万至 20 万美元。这些数字来自麦肯锡对公开研究与公开定价的分析,而非经审计的客户账簿——请牢牢抓住比例,宽松看待绝对金额。
真正驱动 AI 智能体成本的是例外率,不是模型
在银行客户开户场景中,麦肯锡预计 10% 至 20% 的智能体运行会由风险专家与职能专家复核。
这个复核率就是全部胜负手,值得把算术慢慢走一遍——下面这个示例是我做的,不是麦肯锡的,但输入参数来自他们。
设想一条复核率为 15% 的工作流,每次复核占用专家 20 分钟。在 1,000 次运行中,这就是 50 小时的资深职能时间。把复核率降到 5%,同样 1,000 次运行只需约 17 小时。你没有碰任何模型、任何提示词、任何供应商合同,却砍掉了那条昂贵科目的三分之二。
另外请注意是谁在做这项复核。麦肯锡明确指出是职能专家与风险专家——正是工作流存在的意义所在、需要被保护其判断力的那批人,而不是可以廉价配置的初级 QA 层。监督成本之所以昂贵,恰恰因为廉价的监督根本不是监督;复核者必须资深到有权推翻智能体。任何假定复核层可以向下委派的方案,实质上都是一个停止复核的方案。
现在把这一点与所有人真正去拉的那根杠杆作比较。麦肯锡只识别出三个 token 成本驱动因素:模型质量、时延要求、任务频率。2026 年 7 月初的前沿定价,顶级模型约为 每百万输入 token 5 美元、每百万输出 token 30 美元,而更早的轻量模型为 0.20 美元与 1.25 美元。二十五倍的价差——却只作用于账单的四分之一。
而显而易见的优化里藏着一个陷阱。为削减 token 而降级模型,会推高错误率。更高的错误率推高例外率。更高的例外率推高复核工时,也就是那四分之三。token 上省下的钱,经常在为一笔无人计量的监督增量买单:工作流实际变贵了,仪表盘却显示它变便宜了。
为什么被复核的工时不会消失
有独立证据表明,监督这条科目是结构性的,而非可以随成熟度自然摆脱的问题。
MIT Technology Review Insights 与 Microsoft 调研了 300 位技术高管与从业者,并将 101 项智能体任务置于 0–100 的信任量表上排序。信任度跟随的是任务可验证性与业务上下文完整度,而非模型能力:自动报告生成得分 83.5,样板代码 82.5,二者都有单一客观的评判指标;而 service mesh 配置为 37.5,灾难恢复测试为 43——底层模型完全相同,只是缺少一种干净的方式来判断产出是否正确。48% 的受访者担忧问责归属,47% 担忧幻觉,而 59% 已经在规划永久性的人工监督 (MIT Technology Review Insights, 2026)。
生产数据指向同一方向。一项将 Perplexity 智能体产品与其搜索产品对比的研究发现,同类任务的完成时间从 269 分钟降至 36 分钟——时间减少 87%、成本减少 94%——而用户的后续工作却向上迁移,转入验证与延伸 (arXiv 2606.07489, 2026)。
人的工作迁移到了复核环节。麦肯锡只是第一个为这个落点标出价格的机构。
规模与复用决定这笔账是否算得过来
麦肯锡经济学的另一半是固定成本,而正是这一半决定了中型市场的智能体项目能否跨过门槛。
一个每年为 2,500 名新客户办理开户的对话式智能体,成本为 1 万至 1.5 万美元。把业务量翻倍,成本也只升到 1.5 万至 2 万美元——因为 AI 基础设施与智能体编排在很大程度上是固定的,而固定成本会被摊薄。请留意编排这条科目里装着什么:维持智能体在生产环境运行所需的常备数据科学人力;麦肯锡观察到,智能体"往往每隔几天就需要调整一次"。
因此低业务量的工作流会输两次。它们得不到固定成本的摊薄,而监督比例居高不下,因为它们永远积累不到足够的运行次数,让人得以找出例外模式并从设计上消除它们。
中型市场的出路是复用,而不是规模。如果没有任何单条工作流能承载足够的业务量来摊薄基础设施与编排科目,那么问题就变成:有多少条工作流可以跑在同一套智能体构建之上?麦肯锡的提法是一次构建、多流部署。三条相邻流程共享一个智能体、一个上下文层和一套复核协议,就能跨过它们各自单独都跨不过的固定成本门槛。这是一个必须在首个试点之前做出的架构决策,一旦三个团队各自买下自己的点状方案,事后极难补救。
这种不对称在采用数据中清晰可见。麦肯锡《State of AI 2026》发现,营收超过 10 亿美元、正在规模化部署智能体的机构占比从 27% 升至 40%,而营收低于 10 亿美元的机构则停滞在 22%。约 20% 的机构表示 AI 运营成本限制了其使用,而认为 AI 至少对 EBIT 产生了一定影响的比例维持在 37%,同比持平 (McKinsey, 2026)。
采用率在累积。上报的财务影响没有。这正是一条无人管理的成本科目所留下的特征签名。
诚实的反方意见:这是银行业,而且这是估算
两点提醒,你最好从我这里听到,而不是从你的 CFO 那里。
第一,70–75% 这个数字取自受监管的、面向客户的金融服务。监督强度是监管敞口与错误后果的函数。一家 200 人物流公司的内部工单分派处在另一条曲线上,那里的比例分配可能更接近对半。
第二,这些是基于公开定价与公开研究建模得出的成本,而非某个客户项目中实测的账簿。请把它们当作一个界定清晰的估算,而不是一次测量。
但请注意误差的方向。token 价格持续下降,并将继续下降。复核者的薪资没有下降,也不会下降。每过一个月,这个比例都会更进一步地不利于 token,而不是回摆向它。如果 70–75% 对你今天的场景而言不准确,诚实的修正方式是去问:十八个月后它会变成多少?——而不是假定它会回落到 token 仪表盘能够看见的那个量级。
在批准试点之前,先为复核工时定价
评估下一份智能体提案时,有五件事需要改变。
- 把例外率作为一个具名数字写进商业论证。 需要人工复核的运行占比、每次复核的预计分钟数、复核者的完全负担时薪。如果没有人愿意为这三个数字背书,你手里的就不是商业论证,而是一份附带预算的演示。
- 在扩大范围之前,先把可验证性做出来。 MIT–Microsoft 的排序显示,信任跟随的是那些拥有单一可读成功指标的任务。这一属性是可以建造的:为指标埋点、把业务上下文编码进去、收窄范围。按可验证性而非按哪项任务看起来最简单来安排部署顺序。
- 先按年度运行次数对候选工作流排序。 复用与业务量才是摊薄固定成本的东西。一个精巧但低频的用例,永远比一个乏味但高频的用例更糟糕的投资。
- 明确地为维护科目列预算。 每隔几天就要调整的智能体,需要常备的工程人力。这是永久性的固定成本,不是项目开支。
- 汇报已完成工作的 ROI。 把工作做完所需的完全负担成本——人、智能体与确定性系统三者合计——对照这份工作的价值来衡量。不是每 token 成本,也不是名义上节省的工时。
麦肯锡自己的处方与直觉恰恰相反:与其优化模型选型,不如重新设计工作流,以降低例外率并简化那些触发昂贵人工介入的复核流程。这是一项流程工程的任务,却藏身于所有人一直当作采购决策来处理的事情里。
本季度该做的决定
找出那个正等着你签字的智能体试点,索要一个演示材料里没有的数字:每一百次运行的预期复核工时。
如果答案只是耸耸肩,那么别人要你批准的就不是一套软件。别人是在要求你为一支没有任何人列入预算的复核团队配置人手——而且是在 AI 智能体成本的那四分之三上配置,而你的仪表盘从设计之初就不是用来向你展示这部分的。