Scovai Scovai
AI & Operations 2026-09-17 1 min read

聊天记录不是劳动力研究:美联储与哈佛的新论文指出,你商业论证下的 AI 使用基准,统计的是你岗位里根本不存在的工作

DSL

Dr. Sarah Liu

聊天记录不是劳动力研究:美联储与哈佛的新论文指出,你商业论证下的 AI 使用基准,统计的是你岗位里根本不存在的工作

超过 15% 的 OpenAI 聊天被归类为 "Edit written materials or documents"。而在 O*NET 中,只有 2.4% 的劳动者所从事的职业包含这项任务(Bick, Blandin, Deming & Schumacher, NBER, 2026)。这道落差,就嵌在支撑大多数 2027 年运营计划的 AI 使用基准里。

再看反方向。在一项全国代表性调查中,占生成式 AI 使用份额最高的单一任务是 "Direct organizational operations, activities, or procedures"——占全部申报使用的 4.1%,由 43% 的劳动者承担。它在 OpenAI 数据中的份额是 0.0%。在 Microsoft 数据中是 0.0%。在 Anthropic 数据中是 0.2%。

最能代表运营工作的那部分,恰恰是聊天记录完全看不见的部分。如果你的 2027 年 AI 计划是照着某份厂商使用研究来定规模的——大多数中型企业的计划都是如此,因为这类研究免费、时新且体量巨大——那么你读的是一张把你自己的领土裁掉了的地图。

这项调查做到了什么,而聊天研究做不到

Alexander Bick(Federal Reserve Bank of St. Louis)、Adam Blandin(Vanderbilt)、David Deming(Harvard Kennedy School)与 Tyler Schumacher(Vanderbilt)基于全国代表性调查而非平台遥测数据,构建了首个任务层级的生成式 AI 采用指数(NBER Working Paper 35677, 2026)。

机制才是关键。他们汇总了 Real-Time Population Survey 的四轮调查——13,920 名 18 至 64 岁的在业受访者——并把每个人申报的生成式 AI 使用,对应到其详细职业,以及该职业实际包含的具体 ONET 工作活动。因为知道受访者的职业,他们才能把一次使用归属到一个已知岗位架构内部*的任务上。

聊天分类器做不到这一点。它读的是对话文本,通常完全不知道用户以何为业。于是它只能做唯一可做的事:把聊天归到一个描述可见动作的任务名下。编辑。搜集信息。设计系统。

这不是谁家分类器的缺陷。这是输入端的结构性限制,论文说得很直白:聊天分类器"可能倾向于把聊天归入描述基础性、通用性动作的任务名称"。

AI 使用基准偏离得有多远

后果是极端集中。332 项任务中的十项,占 OpenAI 数据使用量的 53.0%、Anthropic 的 46.0%、Microsoft 的 60.8%——而调查中仅为 22.2%(Bick et al., NBER, 2026)。最大的单一任务在三份聊天数据集中分别占 15.1%、16.7% 和 23.2%,调查中则为 4.1%。

接着是那个应当终结"这是同一现实的两种视角"之争的数字。调查任务份额与聊天数据集任务份额之间的相关系数是 OpenAI 0.11、Anthropic 0.34、Microsoft 0.10。三者中有两者,与劳动者自述在其真实任务上如何使用工具,几乎在统计上不相关。

二阶误差才是躺在你计划里的那个

直接使用份额通常不会直接进入商业论证。链条更长,论文也追踪了它:聊天—任务分类被汇总成按职业划分的生成式 AI 份额,这些职业份额随后作为按角色的 AI 暴露度代理指标流通——成为推广次序、培训预算与人力预测背后的输入。作者点名了四项以此方式构建的已发表指标,并得出结论:这些代理指标"很可能不准确,并提供了一个被扭曲的视角"。

所以当某份演示告诉你哪些职能最受 AI 影响时,追问这个排名从何而来。若它追溯到聊天记录,它就继承了一个从不知道任何人职业的分类器——而它的特征性错误,就是高估在文字记录中看起来通用的工作。

你的另一项输入同样比看上去更弱

显而易见的修正是:丢掉使用基准,改用一份正经的职业暴露度评分。论文也测了这个,对照文献中被引用最多的两个指数。

对实际采用率做回归,Eloundou 等人(2024)的指标给出调整后 R² 为 0.081,Felten 等人(2021)的为 0.086——大约是职业层级可解释方差的一半(Bick et al., NBER, 2026)。这些评分确有预测力。但远远谈不上够用。

底下还压着一个更硬的约束。职业本身只能解释劳动者个体层级采用率方差的不到 20%(Bick et al., NBER, 2026)。真正决定谁会采用的因素,大多在职位名称内部,而非职位名称之间。同一团队的两名分析师,同样的工具、同样的任务——一个已经围绕工具重构了自己的一周,另一个一个月打开两次。

这是一个形状明确的规划问题。你按角色做的任何分配——席位、培训工时、赋能次序——都建立在一个只能解释你所关心结果不到五分之一的变量上。

它也解释了大多数运营负责人早已见过、却归档到别处的一种现象。同一场赋能培训,一个职能回来后结果差异极大;反射式的解读是动机、管理者水平,或抗拒改变。采用数据说的是:这种离散度的很大一部分本来就会出现,因为它在个人层级,而干预却在角色层级。把培训更用力地再做一遍,并不触及成因。

"广而浅"是一个精确判断,不是含糊其辞

这项调查给出的采用图景,在两个方向上都容易被误引。精确的版本是:

  • 截至 2026 年 5 月,45% 的劳动者在工作中使用生成式 AI;作者将其视为下限,因为嵌入式与被动式使用常常不会被申报。
  • 超过 80% 的职业和 40% 的任务采用率高于 20%。
  • 但只有 2.8% 的任务采用率超过 50%,且没有任何一项超过 70%。

把三条放在一起读。在美国经济中,不存在任何一项任务的生成式 AI 使用接近普及。那些采用率极高的职业——约 15% 超过 70%——靠的不是某一项饱和任务,而是一组中等采用率的任务。

独立数据在形态上与之吻合。Google 的 ATLAS 研究基于 1,465 万次去标识化交互而非自我申报,发现中位数职业在其约 21% 的任务上使用 Gemini,而端到端自动化意图在非常规认知类对话中低于 10%(Google ATLAS v1.0, 2026)。覆盖 120,620 名劳动者的行为遥测显示,仅有 2% 达到工作流整合成熟度——即在重新设计过的流程内部使用 AI,而非作为旁侧查询(ActivTrak Productivity Lab, 2026)。

三种方法,三份数据集,一个结论:覆盖广,渗透薄。这意味着,把一个"受 AI 影响"的岗位建模成一个"被 AI 改造"的岗位,误差几乎是全程。

诚实的反面

三项值得守住的局限。

2.4% 这个数字部分是 ONET 的人为产物,作者自己也这么说。 他们的原话是:"从事编辑工作的劳动者比例显然远高于 2.4%。" ONET 把编辑嵌入到更高阶的任务里,比如编写报告或起草法律文件。所以 15% 与 2.4% 之间的落差并非纯粹的分类器误差——其中一部分,是参照分类体系拒绝为一项实际上无处不在的活动单独命名。失真的方向是稳固的;任何单独一对数字的量级,都比看上去更软。

自我申报也有自己的失效模式。 调查知道人们说自己用工具做了什么。聊天记录知道实际有什么通过了那扇窗口,其规模是任何调查都永远达不到的。两者都不是基准真值;它们回答的是不同的问题,而这篇论文的贡献在于展示两个答案相距多远,而不是宣布其中一个是假的。

全国性调查不是你的公司。 RPS 描述的是美国劳动力。你的任务清单、工具栈与岗位设计都不是全国平均值,而这里没有任何内容能告诉你你的哪些岗位会采用。

最后这条局限才是真正要紧的——而它只指向一个方向。这个领域里的每一个外部基准,无论来自聊天记录还是调查,都是先验。没有一个是对你自己组织的测量。

这个季度该决定什么

四个动作。没有一个需要新增开支。

  1. 把计划里的每一个 AI 使用基准追溯回源头。 如果某个数字来自平台聊天记录,就把它标记为方向性先验,而不是人力或预算模型的输入。这是对一份你已经写好的文件做三十分钟审计。
  2. 为一个职能建一份任务清单。 一个团队的二三十项真实活动,用你自己的语言写,而不是 O*NET 的语言。它是唯一能让你问出"工具碰到这件事了吗?"而不是"这个岗位受影响吗?"的产物——而且它能挺过厂商基准的每一次改版,因为它描述的是你的工作,不是别人的流量。为此预留一个下午和团队负责人一起做,而不是一份咨询合同。
  3. 别再按角色分配赋能。 既然职业只能解释个人层级采用率的不到 20%,基于角色的推广就接近抛硬币。改为按观察到的实际使用来分配,让第一批人选是你自己遥测数据中已经领先的那些人。
  4. 把目标设在任务上,而不是席位上。 从那份清单里挑一项任务,把它推过 50% 的采用率。全国范围内,每一百项任务中越过这条线的不到三项——正因如此,刻意越过它,才是一个站得住脚、值得上报的结果。

你的 AI 使用基准回答了一个你从未提出的问题:聊天长什么样。而摆在你桌上的问题是:你的人整天在做什么,工具又触及了其中的哪一部分。

这两个问题里,一个已有公开发表的答案。另一个,只有你的答案。

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.