Scovai Scovai
AI & Operations 2026-09-18 1 min read

AI 加速的是工作,不是产出:MIT Sloan 50 万开发者研究点名你的生产力收益死在哪个下游环节

DSL

Dr. Sarah Liu

AI 加速的是工作,不是产出:MIT Sloan 50 万开发者研究点名你的生产力收益死在哪个下游环节

自主编码智能体使开发者的提交(commit)活动累计增长 240%。而发布——软件真正抵达客户的那个环节——只增长了 30%(Demirer, Musolff & Yang, NBER, 2026)。同一批开发者,同一批工具,同一项研究,同一时间窗口。所测得收益的八成从未走出公司大门。

这个落差,正是今年绝大多数 AI 商业论证的形状。试点度量的是工具所加速的那个环节。没有人去度量真正决定交付的那个环节,因为那个环节上没有挂着任何许可费。

这篇论文题为 Writing Code vs. Shipping Code,标题里的这一区分就是全部结论。AI 生产力收益是真实的、可观的,并且是在任务层级上测得的。它们抵达客户时已被大幅打折。

50 万开发者的研究能看到、而试点看不到的东西

Mert Demirer(MIT Sloan)、Leon Musolff 与 Liyuan Yang 在配对事件研究设计中,将 AI 使用遥测数据与 50 万名以上 GitHub 开发者相匹配,并追踪了效应在历代工具中的演变(NBER Working Paper 35275, 2026)。

按世代划分的结果值得单独看待,因为这是大多数读者最想引用的部分:

  • 自动补全: 对提交量的累计效应 +30%
  • 交互式编码智能体: +180%
  • 自主编码智能体: +240%

每一代都是实打实的跃升。若有人主张智能体工具不会推动任务层级的吞吐量,那是在与一个极大的样本较劲。

接着是衰减。那 240% 的提交效应,在项目数量上降至 80%,在实际发布上降至 30%。而当作者把视野移出 GitHub,转向四个主要软件市场时,他们发现新应用数量显著上升,总使用量却没有增加。

写下的代码更多了。启动的项目略多了一些。交付的稍微多了一点。而被使用的,一点也没多。

市场端的结果值得单独掂量,因为它排除了一种令人安心的解读。若只是瓶颈问题,预期会出现积压——产出等在闸门后面,一旦闸门放宽便可回收。但新应用增加了,总使用量却没有,这指向发布环节之后的某种东西:市场吸纳了更多供给,却没有产生更多需求。缺失收益的一部分确实排在人工评审后面。另一部分本来就不会变成价值,因为把没人要的东西做得更多,不算产出。这两种解读都该让运营负责人对那种把任务级速度直接换算成营收的商业论证保持警惕。

为什么 AI 生产力收益在最后一环之前就死了

作者的解释是弱环节假说,它比任何 AI 专属理论都更古老、更扎实:在多阶段生产链中,总产出由改善最少的那个环节决定,而不是由平均水平决定。

写代码是一个环节。评审、集成测试、安全签核、发布审批与部署是另外几个——而没有任何一代编码工具触及它们。于是约束发生了位移。它没有消失,只是迁移到了加速环节下游的第一道人工闸门。

弹性数字就是论点本身

论文给出了一个系数:AI 与人类投入之间的替代弹性估计为 0.23(Demirer et al., NBER, 2026)。

直白地读:低弹性意味着强互补性。AI 与其下游的人并非争夺同一份工作的替代品,而是彼此大致成比例需要的投入要素。把其中一项增至三倍而不动另一项,你不会得到三倍产出。你会得到一条队列。

这个数字应该摆在每一个默认「足够好的智能体终将连评审者一起吸收」的计划面前。目前最好的估计说的恰恰相反,而且说得精确到小数点后一位。

你的流水线是同一个形状

软件只是场景,不是边界。产生这一结果的结构——顺序推进的环节、前端可被机器加速的工作、后端的人工判断闸门——正是一家 50 至 500 名全职员工的公司里几乎每一条运营流程的结构。

从订单到回款:报价生成可自动化;授信审批与异常处理不可。从招聘到入职:寻源与初筛可自动化;录用决定与第一周的交接不可。从工单到解决:分诊与起草可自动化;升级判断不可。

每一种情形里,AI 预算都压在前端环节上,而产能天花板立在后端环节上。

如何用一个下午找出你的弱环节

这项诊断不需要新工具。取一条流程,把它从头到尾的环节写下来——六到七个是常态。对每个环节标注两件事:过去十二个月 AI 是否触及它,以及今天它前面的队列是什么样子。

弱环节几乎总是第一个对第一个问题答否、对第二个问题答正在增长的环节。它通常由一两位资深同事把守,而这些人在这一切开始之前就已经是升级处理的落点——这正是没人提议把它自动化的原因,也正是它无法吸收更多流量的原因。

然后问那个能重塑预算对话的问题:如果这个环节每周多处理 20% 的单量,值多少钱?把它与下一批上游许可证的成本相比。在多数中型市场的流水线里,这个对比根本不接近。

独立证据表明,这种错配近乎普遍。覆盖 120,620 名员工的行为遥测发现,只有 2% 达到工作流整合成熟度——即在重新设计过的流程内部使用 AI,而非把它当作旁路查询;仍有 27% 停留在简单的研究辅助阶段(ActivTrak Productivity Lab, 2026)。如果 98% 的采用发生在流程周围而不是内部,那么下游环节从一开始就不在范围内。

生产数据从另一端指向同一结论。一项比较智能体与搜索使用的研究发现,配对任务的完成时间从 269 分钟降至 36 分钟,时间减少 87%——而后续工作向上迁移到了验证与延伸,而非消失(Perplexity & HBS, arXiv, 2026)。人类工作没有离开。它搬到了你没有在测量的那个环节。

你没给预算的那道闸门,也是昂贵的那道

另外两项发现,使下游环节比单纯的排队问题更难被忽视。

第一,它比工具更贵。McKinsey QuantumBlack 对智能体单位经济性的分析发现,对一个银行客服智能体而言,token 成本仅占可变运行成本的 20–25%,而人工监督占 70–75%(McKinsey QuantumBlack, 2026)。你的商业论证当作免费管理费的那个环节,占据了运行成本的大头。

第二,它在负载下会劣化。一项针对 2,500 名知识工作者的调查发现,42% 花在核验 AI 输出上的时间超过使用它所节省的时间,且 52% 经常修正同事产出的 AI 生成工作(Adaptavist, 2026)。把更多流量推过一个没有改变的评审环节,评审者会把它吸收为返工——而这正是上游 240% 的收益转化为下游 30% 的机制。

所以弱环节不只是慢。它是成本中心,而且早已饱和。

诚实的反面意见

三条限制,在别人指出之前先说出来。

作者与一家供应商存在已披露的关系。 Demirer 与 Musolff 此前均在 Microsoft 担任博士后研究职位,如今是该公司的有偿研究顾问——这在工作论文本身即有披露。该结论与商业利益相悖(它为编码工具可宣称的产出效应设了上限),而这正是让利益冲突不那么令人担忧的方向。但仍应记下。

估计值在不同稿本之间发生了变动,这会影响你的引用方式。 2026 年 5 月版报告的样本更小、系数不同;2026 年 9 月的修订版报告的是 50 万名以上开发者、30/180/240% 的世代效应与 0.23 的弹性。衰减模式在两个版本中都成立。若要在董事会材料中引用本文的数字,请引用当前修订版并标注日期——工作论文不是定论,值得引用的是那些形态能挺过修订的结果。

一个行业不等于所有行业。 软件的环节边界异常清晰,遥测数据也异常完备。你的财务结账或履约链条可能在每个环节都有更深的人力介入,这会同时压缩上游收益与衰减幅度。方向可以迁移。量级在你测量之前都不属于你。

这个季度要决定什么

四个动作。其中三个除了注意力之外不花钱。

  1. 给一条流程里最后那道人工闸门命名。 不是流程负责人,而是每一单位工作在计为「已交付」之前必须通过的那个具体审批、评审或签核步骤。如果你无法用一句话说出它,那本身就是结论。
  2. 把两个环节分开度量。 你现有的指标几乎肯定在统计被加速环节的活动量:产出的草稿、分诊的工单、生成的报价。请在交付环节加一个计数器。两者之比就是你的衰减,也是本文中唯一真正关于你公司的数字。
  3. 把下一笔 AI 预算增量移向下游。 若弱环节结论在你的流水线成立,再买一个上游席位的边际回报接近于零,而疏通闸门的边际回报,就等于那道闸门当前正扣住的一切。这是再分配,不是新增支出。
  4. 先重新设计闸门,再放宽漏斗。 在评审环节不变的情况下抬高上游流量,产生的是队列与返工,不是产出。把顺序反过来:先修闸门,再放流量。

你的 AI 生产力收益是真实的。这项研究以任何内部试点都无法企及的规模说明了这一点。

它们同样正排在队列里,等着一个没人列入预算的人。这个季度的问题不是你的团队能把工作做得多快,而是这些工作里你的组织还能完成多少。

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.