Scovai Scovai
AI & Operations 2026-08-26 1 min read

谁来决定智能体何时接管?一项新的飞行模拟器研究给出的答案是:几乎永远不该由智能体决定

DSL

Dr. Sarah Liu

谁来决定智能体何时接管?一项新的飞行模拟器研究给出的答案是:几乎永远不该由智能体决定

92名操作员在飞行模拟器上完成了 NASA 的多属性任务测验。当工作负荷骤增时,他们的跟踪精度从76%跌至55%——他们放弃了持续监控任务,以保住离散任务(TechXplore, 2026)。这一点并不意外。真正应当改变你配置智能体方式的,是第二轮实验:当系统被允许自行决定何时接管任务、何时交还任务时,只有在急性高峰期间表现更好。在其余所有情形下,自行选择委派时机的人表现更佳——而当系统替他们做决定时,他们报告的疲劳程度明显更高(International Journal of Human–Computer Interaction, 2026)。

同一个智能体。同样的能力。唯一的变量是:谁握有调动工作的权限。

你看过的每一份智能体AI路线图,都把自主性当作一条成熟度阶梯:辅助、监督、再到自主,而自适应控制权交接被摆在最高一级。这项证据说明,这架梯子上有一级踏板是反着钉的。由智能体自行发起的接管,只适用于一小段特定条件,在其他所有场景中都是错误的默认设置。

模拟器测量了什么,又没有测量什么

该研究来自岭南大学(Lingnan University)心理学系,由 Jie (Jay) Xu 教授主持,2026年8月发表于《International Journal of Human–Computer Interaction》(IJHCI, 2026)。参与者在 NASA 的 MATB 上同时执行三项任务:摇杆跟踪、系统监控与资源管理——这是一种刻意更接近一个完整班次、而非单次决策的负荷结构。

第一轮建立基线。在负荷高峰下,跟踪精度从76%崩落至55%,而两项离散任务基本保持稳定。压力之下,人首先放弃的是持续警觉。这正是智能体本应填补的缺口。

第二轮比较了两种填补机制:

  • 人主导的权限分配(HLAA)。 由操作员决定何时把任务交给系统、何时收回。
  • 共享权限分配(ShAA)。 系统监测负荷,自行接管或自行交还。

ShAA 在急性高峰与紧急状况中胜出,它恰好保住了人在负荷下最先丢弃的那项任务。而在这些窗口之外,HLAA 胜出。在 ShAA 条件下,操作员会脱离任务;当控制权回到手中,他们无法及时重建情境意识,产生了可测量的绩效下滑。在长时段实验中,ShAA 组后期的疲劳评分明显高于人主导组(TechXplore, 2026)。

研究者的因果解读比数字更重要。缺口不在能力,而在未加解释的权限转移。追踪系统在做什么、为何介入、接下来会做什么,本身就是认知劳动——一种不会出现在任何"节省时间"计算中的劳动。

失效点是交还,而不是接管

智能体设计的注意力几乎都集中在委派的那一刻:什么触发智能体、它被允许做什么、有哪些护栏约束它。几乎没有人关注归还。

顺序反了。在这组数据里,负荷下的接管恰恰是有效的部分。损害集中在返回路径上:控制权回到一个已经脱离环路的人手中,没有说明什么发生了变动、为何变动,随后是一段绩效受损、却无人计量的恢复期。

看看中型企业版本。一个智能体整夜处理队列,把无法解决的异常升级上报,协调员早上8点接手。在仪表盘上,升级看起来很干净:处理12项,升级3项。仪表盘看不见的,是协调员花掉的二十分钟——用来还原这三项为何被升级、智能体已经尝试过什么。把这个数字乘以一周里的每一次交还,恢复成本就开始与处理节省相抗衡——而这笔账目从来没人设立过。

这与 IBM Institute for Business Value 在高管层发现的是同一个结构性问题。在一项针对2000名CIO与CTO的调查中,三分之二表示自己要为并未完全掌控的AI系统负责,77%表示采用速度已经超出其治理能力(IBM Institute for Business Value, 2026)。模拟器研究,就是同一道裂口在办公桌层面、用秒表复现了一遍。

为什么自适应自主性被当成高端功能来卖

因为它的演示效果极好。一个察觉队列开始积压、不等吩咐就介入的智能体,比一个等待指令的智能体更适合做两分钟演示。可是,演示本身就是一个高峰情境。而高峰,正是证据认为应当由智能体决定的唯一情形。

这套说辞还夹带了一个未经检验的假设:从人手中拿走一个决定,就能减轻他的负担。疲劳数据显示,决定从来不是昂贵的部分。昂贵的是维持一个"系统正在做什么"的心理模型,而自主交接把这项成本推高了:现在你既要跟踪工作本身,也要跟踪智能体对工作的判断。

透明度要求不是锦上添花

作者说得明确:缺少对控制权为何转移的解释,操作员与系统之间就会裂开一道认知缺口。这不是用户体验偏好,而是产生绩效下滑的机制本身。

它在基准测试中也有回声。Surge AI 的 HANDBOOK.md 评测让前沿模型执行65项受真实43页公司手册约束的智能体任务;所有受测模型的严格 pass@1 都低于25%,且增加推理投入并未带来稳定改善(Surge AI, 2026)。如果智能体在长任务中对政策的遵守如此脆弱,那么一个已经脱离两小时、又在没有理由说明的情况下被交还控制权的操作员,拿到的就是一个他无法高效检查的包裹。

这在50到500人规模的组织中落在哪里

三个位置,按见效速度排列。

异常队列与非工作时段覆盖。 任何由智能体无人值守运行、再把一部分交还给人的流程,都是披着路由外衣的交还问题。如果返回不附带理由,你在每一个周期都在支付恢复成本。

常驻监督岗位。 疲劳效应出现在长时段的后期。短周期试点检测不到它。如果你有人整天的工作就是盯着智能体干活,那么你那个两周试点测的是错误的窗口。

由供应商设定的升级阈值。 大多数智能体平台出厂时都带有一个"何时介入或升级"的默认灵敏度。这个默认值,是由一个在优化演示效果和支持工单量的人选定的,而不是在优化你的操作员的情境意识。这是一项正在生效的配置决策,却几乎没有人有意识地做过。

三者之下还有一个组织设计问题,微软《2026年工作趋势指数》从另一个方向提出过:86%的员工已经把AI产出当作起点而非最终答案,而组织因素的影响力超过个人AI技能的两倍——67%对32%(Microsoft Work Trend Index, 2026)。人们已经在做核验工作。交接设计决定的,是这项工作便宜还是昂贵。

这项研究没有说什么

三条边界,明说出来,因为建立在过度解读之上的政策一定会失败。

参与者是大学生,不是领域操作员。 有经验的专业人士也许能更快重建情境意识。对高技能知识工作的外部效度尚未确立。

这是飞行模拟器,不是后台办公室。 MATB 是负荷测量工具,不是异常队列的近似。把结论迁移到运营中的智能体监督是一种推断——一种有充分依据的推断,但仍是推断。

N=92、两轮实验,报道中未给出效应量。 方向是一致的;在你的场景中的量级则未知。

在这三条限制之下仍然成立的是机制,而机制正是可迁移的部分:未经解释就转移的权限,会给接收它的人强加一笔恢复成本。这一点与摇杆毫无关系。

本季度就把接管权限变成一项设计决策

四个动作。都不需要新增支出,四项都属于配置而非战略。

把升级默认设为由人发起。 让操作员决定何时移交。把由系统发起的接管,保留给点名列出的高峰条件——超过阈值的处理量、明确定义的故障、特定的时间窗口——而不是交给智能体持续自行裁量。

要求每一次交还都附带理由。 智能体说明它做了什么、尝试过什么、为何把该事项退回。这是提示词与模板层面的改动,不是工程项目,而且正好对准研究识别出的缺口。

试点要做长,不只是做广。 如果某个岗位涉及监督常驻智能体,评估之前至少完整跑满一个班次。疲劳成本按其构成就是后期才出现;建立在半天工作日上的两周试点,注定看不见它。

为恢复窗口装上仪表。 测量从一次交还到人对该事项采取首个实质动作之间的时间。这个间隔就是你当前交接设计的成本,而它在我见过的每一块智能体仪表盘上都是隐形的。

本季度摆在你面前的问题,不是你的智能体该有多自主。它更窄,也更容易回答:在你流量最大的那条流程里,今天是谁在决定智能体何时接管——是你,还是别人出厂时设好的默认值?在这项研究中,技术保持不变,仅这一个变量就把绩效与疲劳推向了相反的方向。它是你桌面上最便宜的一根杠杆,而它默认停在错误的位置上。

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.