Scovai Scovai
AI & Operations 2026-09-16 1 min read

你的外向型员工最不适合尽责型 AI:MIT 发表于 PNAS 的新实验说明,你向全员推行的助手人格是一个绩效变量

DSL

Dr. Sarah Liu

你的外向型员工最不适合尽责型 AI:MIT 发表于 PNAS 的新实验说明,你向全员推行的助手人格是一个绩效变量

把 1,258 人与 AI 智能体配对,让他们制作 7,266 则展示广告,再由 1,168 名独立评分者打分。整个实验设计中表现最差的组合,既不是弱模型,也不是未受训的用户,而是外向型的人与尽责型 AI 一起工作(Ju & Aral, PNAS, 2026)。

尽责。正是每家厂商默认调校的方向——细致、周全、专注于任务。一旦交到不合适的人手中,它产出了整个实验中质量最低的作品。

这正是中型市场运营团队应当停下来细读的发现,因为几乎所有人押的都是相反的赌注:一套助手人格,配置一次,推给所有人。这项研究是首个大规模因果证据,表明人格本身就是一个绩效变量——把它留在厂商默认值上是一个决定,而不是中立状态。

这项实验实际测量了什么

Harang Ju(Johns Hopkins Carey Business School)与 Sinan Aral(MIT Sloan,MIT Initiative on the Digital Economy 主任)开展了一项预注册随机实验:先对 1,258 名参与者测量大五人格特质,再将其随机配对给被提示独立展现这五种特质高低水平的 AI 智能体(Ju & Aral, PNAS, 2026)。

每组有 40 分钟、实时聊天以及同步的文本与图像编辑工具,为一家真实智库的年度报告制作展示广告。产出:7,266 则广告。随后由 1,168 名独立评分者就文本与图像质量进行评分(MIT Sloan / EurekAlert, 2026)。

接下来是让这项研究超越实验室结论的部分。研究者把这些广告投放到 X 平台两周——近五百万次曝光——并测量点击率与单次点击成本。评分质量预测了真实市场表现:更高的文本质量使点击率提升约 7%,单次点击成本下降约 30 美分(MIT Sloan / EurekAlert, 2026)。

有两个设计选择值得强调,因为它们正是本研究区别于市面上已有人格讨论之处。特质水平是随机分配并独立变动的,因此比较对象不是自选不同工具的用户群体,而是因果比较。研究还用与提示智能体相同的大五人格量表来测量人类,这才使得交互效应可被估计。多数厂商研究报告的是用户对某种人格的感受;这项研究报告的是配对对工作本身造成了什么。

于是,因果链条完整贯通。人格配对改变了质量。质量改变了金钱。

配对表:哪些组合有益,哪些有害

结果并不能归结为"同类相配"——而这恰是多数人在阅读之前的假设。

最强的配对是:外向型人配外向型 AI、尽责型人配尽责型 AI,以及开放型人配尽责型 AI——最后一组是互补而非镜像(MIT Sloan / EurekAlert, 2026)。

按论文给出的顺序,显著拉低质量的配对为:

  1. 外向型人 + 尽责型 AI——研究中质量最低者
  2. 尽责型人 + 宜人型(agreeable)AI
  3. 神经质型人 + 尽责型 AI

(Ju & Aral, PNAS, 2026)

第二行请读两遍

尽责型 AI 同时出现在三个最差配对中的两个以及三个最佳配对中的两个。在这份数据里不存在放之四海皆优的人格。尽责型智能体交给尽责型的人,属于可得的最佳组合之一;同一个智能体交给外向者,则是最差。配置完全相同,结果完全相反,差别仅取决于谁拿到了它。

再看第二行对厂商标准答案的冲击。宜人型 AI——乐于配合、迁就、从不反驳——反而拉低了尽责型员工的产出。最以用户满意度为目标调校的人格,恰恰对最可能承担你细致工作的人群产生了实质损害。

为什么全组织一套人格是一项隐形的绩效税

以下是运营层面的翻译,而它之所以令人不适,恰恰因为修正它不花钱,却没有人在测量它。

当你把单一助手配置推给 300 个人时,你做的并不是中立的推广。你在运行一场非随机实验:其中一部分员工拿到的,正是这项研究判定为产出最差的那种配对——而无论他们还是你,都没有能够察觉此事的工具。失败表现为稍弱的初稿、稍多的返工,以及某些团队隐约觉得这个工具"没那么有用"。它从不会出现在成本科目里。

而返工落在最昂贵的地方。McKinsey QuantumBlack 对银行业智能体工作流的成本拆解显示,token 支出占智能体可变运行成本的 20% 至 25%,而由业务与风险专家承担的人工监督占 70% 至 75%(McKinsey QuantumBlack, 2026)。在这种结构下,产出质量不是软性指标。你在生成环节损失的每一分质量,都要按审核工时的价格偿还,由那位有资格推翻结果的资深同事来付。

而审核不会消失。在 MIT Technology Review Insights 与 Microsoft 针对 300 位技术高管、覆盖 101 项智能体任务的研究中,59% 已计划永久保留人工监督,且信任程度取决于任务的可验证性而非模型的原始能力(MIT Technology Review Insights, 2026)。

因此,人格错配不是一条用户体验投诉。它是压在你 AI 支出中最大一项成本上的隐形乘数。

方差早已存在于同一职位内部

如果你想要证据表明这在自家公司而非仅在实验室中可测,它已经躺在你的采用数据里。Bick、Blandin、Deming 与 Schumacher 将全国代表性调查与细分的 O*NET 任务相连接,发现生成式 AI 的暴露度指标只能解释约一半的采用差异——从事相同工作、使用相同工具的人,其采用方式存在系统性差别(NBER Working Paper 35677, 2026)。

一半方差位于职位内部,而非职位之间。多数运营团队把它归档到动机或培训项下。PNAS 的结果为其中一部分提供了一个不那么体面、却更可操作的解释:工具是为另一个人配置的,而不是为正在使用它的人。

这一重构改变了你对低采用群体的处理方式。向一个正悄悄从默认智能体拿到更差产出的团队再派一轮赋能培训,并未触及成因——只是给这些人增加了工时,而他们的初稿仍将比同事需要更多返工。

诚实的反面意见

三项局限,且都重要。

任务是广告创作,不是运营。四十分钟的创意会话产出展示广告,不等于你的季度结账、供应商导入或工单分流。人格配对在创意任务中改变质量,是一个发现;它会在你的工作流中同样改变质量,则是一个推论。把它当作值得检验的强先验,而非既定结论。

作者有商业立场。Ju 与 Aral 共同创办了 Pairium,该公司构建并分发本研究所用的 Pairit 实验平台(Ju & Aral, PNAS, 2026)。研究经过预注册并在 PNAS 通过同行评审,这约束了最明显的失效模式——但拿到该发现的研究者同时在出售解法,这一点应纳入你的解读。

把所有人都完美匹配,本身也有代价。同一文献中的研究发现,多样化的 AI 人格可缓解人机协同构思中的同质化效应(Wan & Kalman, 2026)。若把每一次配对都按个体产出质量优化,你可能压缩团队思维的方差——初稿更好,也更雷同。如果你的职能需要的是广度而非打磨,这个取舍是真实存在的。

但这些都救不了现状。默认配置并不是对上述局限的对冲;它是唯一一个必然对部分员工是错的选项,而且没有任何数据告诉你错在哪部分人身上。

本季度该决定什么

四个动作,都不需要新增厂商支出。

  1. 不要再把人格当成 IT 配置。助手的系统提示词是一个对产出质量有实测影响的绩效参数。谁负责 AI 赋能,谁就拥有它——并须为当前设定给出理由。
  2. 在一个已经产出可评分成果的职能中做一次配对测试。内容、支持回复、初稿分析皆可。两套人格、随机分配、一个季度、盲评质量。你是在小规模复现一项已发表的设计,这是你能委托的最廉价研究。
  3. 最应仔细审视的是高产出岗位上的外向者与高神经质员工。这是研究在默认尽责型智能体面前标记出的两类人群。若一位明显能干的同事从工具中悄悄获益甚微,错配如今是一个成立的假设,而不是培训问题。
  4. 先提供人格选择,再去建人格分配。完整的特质匹配分配需要人格数据,而多数中型市场企业既没有、也未必想要。两到三个可选助手配置文件即可捕获部分效果,且毫无治理层面的暴露。

AI 人格配对如今是一个带价签的实测变量。你其实已经在设定它了——一次性、全局性地,接受了厂商交付的那一套。

本季度的问题不是人格是否重要。PNAS 已经回答了。问题是:你是否还要继续以默认方式、替所有人做出这个决定,然后把结果算到模型头上。

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.