你的团队每天在 AI 工具里花费 87 分钟。其中 42% 用于排查错误和反复调整提示词,而真正推进工作的部分只占 35%(BambooHR,2026)。AI 排障时间如今已是普通工作日中最大的一类 AI 时间——比这些工具本该扩大的那个产出类别还要大。
按年折算,这 87 分钟相当于每年约 47 个八小时工作日。其中约 20 个工作日,花在让工具听话上。
这不是采用率问题。采用是成功的。这是度量问题:几乎每一个跟踪该项目的仪表盘都在统计这 87 分钟,却没有一个把它拆开。
你的续约谈话应该从这项研究开始
BambooHR 的《Redesigning Work: AI's Performance Review》调查了 1,608 名美国全职受薪员工,其中包含 520 名人力资源专业人士的子样本;调研期为 2026 年 6 月 26 日至 7 月 15 日,由 Method Research 执行,9 月 1 日发布(BambooHR,2026)。受访者覆盖十余个行业,性别分布均衡,年龄段与地域也有相应分布。
核心的时间拆分就是结论本身:
- 42% 的 AI 时间——排查错误与反复调整提示词
- 35% 的 AI 时间——真正推进本人工作量的产出性工作
- 23%——其余一切
请记住这个比例,而不是百分数。你的团队每花三分钟从 AI 工具中获取价值,就要花四分钟让这个工具产出可用的东西。这个比例有成本,也有分布,而两者都不会出现在席位数报表上。
与此同时,63% 的组织已经上调了 AI 工具预算。支出正在一个没人拆解过的分母上放大。
这份负担把你的组织架构倒了过来
下面这部分应该改变你观察的位置。
按层级划分的每日 AI 工具使用分钟数(BambooHR,2026):
- 副总裁及高管层: 101 分钟
- 经理与总监: 89 分钟
- 一线执行者: 54 分钟
高管在这些工具里花的时间,几乎是其下属的两倍。如果排障占比在各层级之间大体稳定,那么公司内最大的一池非产出性 AI 时间,正是由最昂贵的人力产生的。
放到中型企业的规模上算。一家 200 FTE 的公司,有 15 人处于副总裁及以上层级:每天 101 分钟,其中 42% 用于排障,即每位高管每天约 42 分钟。15 个人合计,每天就超过 10 个高管工时——比额外增加一名全职资深员工还多,而且全部花在提示词迭代和错误纠正上,由你薪酬表上最贵的一条线支付。
没有人批准过这个编制。它是通过一笔工具预算进来的。
为什么资历越高,成本越集中
一旦看清资深员工把 AI 用在什么地方,这个方向就不意外了。他们的工作更少模板化、判断密度更高、更依赖上下文——恰恰是会产生更多迭代、更多纠正、更多废弃产出的那类工作。AI 产出最干净的任务,往往是结构化的、位于组织架构更下层的任务。
欧元区有一个方向一致的证据。欧洲央行的消费者预期调查发现,AI 时间回报最高的任务既狭窄又未被充分利用——代码生成与调试每周可带回近八小时,但只有约 8% 的劳动者把 AI 用在那里——而最常见的用途,即检索、信息收集、写作与编辑,节省的时间要少得多(欧洲央行,2026)。宽泛、非结构化、高上下文的工作,正是投入小时数最多而回报最少的地方。这也正是一位高管一天的写照。
为什么没有人抱怨
因为它感觉不像浪费。正是这一点,让问题在整个预算周期里保持隐形。
BambooHR 发现,65% 的员工对在工作中使用 AI 感到有信心且充满热情,58% 把节省时间列为主要动机——而他们恰恰身处同一个 42/35 的分配之中。
Culture Amp 的首份 AI at Work 基准报告在更大规模上显示了同样的脱节。在截至 2026 年 7 月的 12 个月里收集的约 112,000 名员工、343,000 份回答中,71% 的员工表示 AI 工具让他们感觉更有产出,在使用最密集的人群中这一比例升至 93%。然而当被问及工作量是否合理时,重度用户为 72%,未使用者为 69%——相差三个百分点(Culture Amp,2026)。
感知到的产出力随使用强度上升 22 个百分点。感知到的工作量缓解只移动了三个百分点。这两条曲线本该同行,但它们没有。
自我报告在这里是脆弱的测量工具
感知效果与实测效果之间的落差是有据可查的,而且只朝一个方向偏。METR 针对资深开源开发者的随机对照试验发现,2025 年初的 AI 工具让他们慢了 19%,而参与者却以为自己加快了;METR 后续对 349 名技术工作者的调查指出,那项研究的参与者对 AI 在任务耗时上的影响平均高估了约 40 个百分点(METR,2026)。
英国政府自己的评估在更好的方法下呈现了同样的压缩。跨部门 Microsoft 365 Copilot 实验——20,000 名公务员——报告平均每天节省 26 分钟,而这个数字是参与者自己从一组区间中估算出来的(GDS,2025)。当英国就业与养老金部(DWP)以未使用者对照组来评估自己那部分试验,并控制人口统计、职业与对 AI 的偏好等变量后,估计值降至八项常规任务上每天 19 分钟(DWP,2025)。
两者人群不同、任务范围不同,所以这并非干净的前后对比。但它们是同一次推行的两次测量,而带有对照组的那次数值更小。GDS 报告在结论中说得很明确:「由于实验条件限制,无法确定节省下来的时间被用到了哪里。」
你团队的热情是真实的。但它不是证据。
AI 排障时间正在毁掉你的采用率指标
席位数、许可证使用率和登录频率,衡量的都是那 87 分钟。没有一个能区分 42 和 35。依据这些证据,一个显示使用强劲的采用率仪表盘,既可能对应一个真正获得杠杆的团队,也同样可能对应一个每年有 20 个工作日在与工具搏斗的团队。
更糟的是,这个指标奖励了错误的动作。工具内分钟数上升会被读作成功。如果排障占比稳定,上升的分钟数主要是上升的返工。
欧洲央行的结果补上了第二处修正。欧元区 AI 用户的中位数每周节省约三小时,约合工作时间的 7.7%——但由于只有 48.8% 的劳动者既使用 AI 又因此节省了时间,整个经济层面的收益约为 3.8%(欧洲央行,2026)。用人均数字乘以员工人数,会把回报高估约一倍。一个建立在「节省 X 分钟 × 所有人」之上的商业论证错了两次:一次错在参与率,一次错在它确实统计的那些分钟里的排障占比。
诚实的反面意见
三条限制,直说。
这是一份厂商研究。 BambooHR 向中小企业销售人力资源软件,对「AI 推行需要人员侧管理」这一论点有商业利益。实地调研由独立研究公司执行,方法论已披露,样本也算合理——但这是一份调查发布,不是同行评议论文。据此调整权重。
它是自我报告,支撑它的多数证据也是。 42/35 的拆分来自员工对自身时间分配的估计,而这恰恰是 METR 证明在此领域不可靠的那种测量工具。诚实的读法是:方向在 BambooHR、Culture Amp 与英国试验之间得到了良好印证,而量级是松的。不要把 42% 当作一个实测常数来引用。把它当作去测量你自己那个数字的理由。
按资历的差异是相关性,不是机制。 BambooHR 公布了各层级的分钟数,却没有公布各层级的排障占比。我上面的推算假设 42% 在各层级之间大致恒定。这个假设合理但未经检验——资深工作可能产生更多迭代,资深用户也可能更善于规避。请把那个高管工时数字当作一个有待核实的数量级,而不是一个可以放进董事会材料的数字。
这个季度要做的决定
四个动作。没有一个需要新软件。
- 在下一次续约前,把分钟数拆开。 你现在的指标是工具内分钟数。加一个维度:这些时间里,多少产出了成果,多少只产出了一条可用的提示词。让 20 个人做两周的自我记录,就能得到一个站得住脚的内部数字,而这也是本文中唯一真正关于你公司的数字。
- 按职级带采样,而不是看平均值。 把资深职级单独拉出来。如果 BambooHR 的形态在你的组织里成立,那么这个昂贵的问题集中在十五份日程表上,而不是两百份——这也让它变得可处理。
- 把排障占比设为采用率的核心 KPI。 用这个比值替换登录率。分钟数上升而排障占比下降的推行是有效的;两者同时上升的推行,是一条披着采用率仪表盘外衣的返工流水线。
- 在统计这些小时之前,先为它们指定去处。 两份英国评估都能测出节省的时间,却都说不出它去了哪里。没有明确去处的时间节省数字,不构成 ROI 的输入项。先决定什么停下来,再去记入什么开始了。
今年上调 AI 预算的那 63%,依据的是一个把「搏斗的一分钟」和「工作的一分钟」算作同一分钟的数字。
在批准下一笔增量之前,先弄清楚你买的究竟是哪一种。你最资深的那批人已经为这个答案付了一整年的账——付的是没有人列进预算的 AI 排障时间。