63% 的活跃求职者如今已经经历过 AI 面试——六个月内上升了 13 个百分点。70% 的人从未被明确告知将由 AI 对他们进行评估,21% 的人直到面试开始后才知道 (Greenhouse, 2026)。
这两个数字描述了中型企业大多数招聘漏斗的现状。Information Systems Research 上的一项新研究说明了第二个数字正在让你付出什么代价。
看不见自己如何被评判的候选人会夸大。AI 分数无法察觉这一点。而你作为保险机制加进来的人工复核者,看一眼分数,就不再使用自己的判断了。
这不是三个问题。这是一个分三个阶段的失效模式,而中间那个阶段从你的仪表盘上是看不见的。
透明度悖论,经八项研究检验
Akshat Lakhiwal(University of Georgia)、Che-Wei Liu(Arizona State)、Hillol Bala(Indiana)与 Hung-Yue Suen(National Taiwan Normal University)于 2026 年 7 月 30 日在 Information Systems Research 发表了 "From Opacity to Transparency: User Behavior and Downstream Effects in Algorithmic Evaluation"。八项研究,包括两项主要实验和一项准现场复现,全部设置在单向异步视频面试场景中 (Lakhiwal 等,Information Systems Research, 2026)。
起点上的张力是真实存在的,这也是大多数雇主对自己所用工具保持沉默的原因。公开算法测量什么,你可能降低候选人的焦虑——也可能只是把考试答案直接交了出去。作者称之为透明度悖论,然后去测量哪一边占上风。
实验一:与人工评估相比,算法评估提高了受访者的压力水平和欺骗性印象管理(impression management)。透明度抵消了这两种效应,使其"与人工评估高度一致"。
达成这一结果的信息披露并不是一份技术说明。候选人被告知,系统会关注面部表情、言语情绪和特定关键词,并会就团队协作、与岗位相关的能力、工作风格和个性对他们评分。该组随后表现出的真实行为水平,与那些以为由人类复核的候选人相同 (UGA Today, 2026)。
Lakhiwal 对不透明为何反噬雇主的解释值得记下来:
"如果你申请梦想公司的职位,而这家梦想公司想用 AI 面试你,你其实没有太多选择。你不想说不,但你也不知道它是怎么运作的。"
候选人用猜测来填补这个空白。"夸大的情况很多,"Lakhiwal 说。"他们似乎把所有能用的都抛出来,想给那个'评估者'它们想象中它在寻找的东西。"
关于候选人会"钻系统空子"的反驳意见,结果是反过来的。隐藏评估标准并没有阻止钻空子,反而制造了钻空子——因为一个针对想象中的评分表做优化的候选人,会同时在所有方向上过度用力。
你的 AI 面试分数分不出诚实与夸大
这是应当改变你阅读筛选报告方式的那一部分。
研究中使用的那个业界主流 AI 代理,并没有对那些把事实拉伸的候选人扣分。它给他们的评分,与那些诚实描述同样资历的候选人一样高 (UGA Today, 2026)。
而当人类评估者观看同样的视频时,他们能够分辨出来。他们总体上对夸大者扣分,并把最高评分给了那些行为看起来最真实的候选人。
所以人的判断是有效的。这是这项发现中令人鼓舞的那一半,而它只能维持到你告诉这个人机器怎么想的那一刻。
然后人就不再看了
实验二转向流程下游,比较了三种决策配置:纯人工、AI 增强(人类决策者由 AI 分数辅助)以及完全自动化。
在候选人一侧,透明度在三种配置中都继续发挥作用。在评估者一侧,它走到了尽头。用作者的话说,它对面试表现的纠正作用"在评估一侧受到了约束"。当 AI 分数在场时,评估者锚定于这些分数,贬低自己的判断,即便这些 AI 分数无法区分诚实行为与欺骗行为 (Lakhiwal 等,Information Systems Research, 2026)。
按这些配置在中型企业中的普及程度来读它们。完全自动化的筛选很少见,而且被广泛认为有风险。纯人工筛选是你出于成本原因正试图摆脱的。而 AI 增强——先出一个分数,再由一位人工复核者签字——才是几乎所有人实际买下的东西,也正是那个本来能够识别夸大的人会稳定地停止识别的配置。
这个保险机制并不中立。它在为分数洗白。
同样的失效也出现在一项现场实验中
这不是孤立一篇论文的结论。Lane、Boussioux、Ayoubi 及同事开展了一项现场实验,228 名评估者审阅 48 份真实申请,比较纯人工评估、黑箱模型推荐,以及同一推荐外加一段叙述性解释 (Lane 等,HBS Working Paper 25-001)。
黑箱推荐提升了决策质量。附带解释的同一推荐则没有——尽管它带来了更高的采纳率。评估者不成比例地听从了拒绝类建议,大幅增加了假阴性,且在边界案例中效应最强。
两个不同的研究团队,两个不同的领域,同一个机制:流畅的机器输出取代了人工验证这一步,而不是为它提供信息。而假阴性是漏斗在结构上唯一看不见的错误类别。招错一个人,六个月内会浮现。被拒掉的好候选人,永远不会浮现。
候选人要求的,并不是保护你的那个东西
现在把候选人一侧的调查数据放回实验旁边,因为重叠之处令人不安。
38% 的候选人表示,他们想确认在作出任何决定之前有人工复核 AI 的评估。39% 的候选人想要一份关于 AI 究竟测量什么的清楚说明 (Greenhouse, 2026)。
第二个要求是有证据支撑的那一个。透明度可测量地恢复了真实行为。
第一个要求——对 AI 评估进行人工复核——几乎精确地描述了那种人类向机器让步的 AI 增强配置。这是候选人想要的保险机制,是你的供应商乐于卖给你的保险机制,也是实验发现其不足的保险机制。不是因为人工复核毫无价值,而是因为顺序很重要:复核一份评估与评估一段录像,是两种不同的认知任务。
与此同时,38% 的候选人已经因为流程中包含 AI 面试而放弃了该招聘流程,而最大的单一触发因素是:由 AI 评分、且无任何人在场的预录视频(33%)。你正因为一个同时还不起作用的配置,而流失真实的候选人。
诚实的反面意见
四点局限,直说。
这里刻意没有效应量。全文在付费墙之后,已发表的摘要与新闻稿报告的是方向,而不是量级——"显著增加"、"数百名在线求职者"。任何从这项研究里给你引用一个百分比的人,都是在编造。已经确立的是效应的方向和次序;量级请视为未知。
一个代理、一个供应商、一个时点。评分上的这一失效,是在研究者所使用的那个业界主流的特定代理上观察到的。换一个工具,也许能更好地分辨欺骗。目前没有任何一家宣称自己能做到这一点,这本身就有信息量,但不要从单一系统外推出一种能力。
先前研究支持"钻空子"这一反驳。Lakhiwal 直接承认了这一点:已有研究表明,告诉候选人如何被评估,会让他们得以操纵评估。这项研究在本情境下得到的净效应是相反的。一项设计良好的研究不能让一整片文献退场。
Lane 等人是一篇相邻领域的工作论文。它评估的是创新申请,而不是求职者,且手稿早于其 2026 年的传播时间。它佐证了锚定机制;它不是招聘领域内的复现。
下一轮筛选之前要改什么
四个动作。没有一个需要新的预算条目,其中两个是你本周就能做的顺序调整。
- 用通俗语言公布系统测量什么。不是模型名称,也不是供应商架构——Lakhiwal 明确指出候选人并不需要这些。告诉他们哪些行为会被观察、哪些属性会被评分。实验条件下使用的那份披露只有四行,却恢复了真实行为。你同时也解决了那个正在把候选人推出漏斗的 70% 未披露问题。
- 让人工评分先行。让你的复核者在 AI 分数可见之前先为录像评分,并把两者都存下来。这是唯一直接针对锚定结果的改动,除了界面顺序之外不花任何成本。请注意,这是 Scovai 从该结果中作出的推断,而不是研究者检验过的条件——论文显示的是锚定,不是解药。
- 不要再把"有人签过字"当作审计轨迹。如果这个人先看到了分数,那么他的签字带着分数的错误,还附上了一个人的名字。让一个筛选决定站得住脚的,是独立记录下来的人类判断,并按每次招聘留痕——Scovai 的企业级定位,包括依 EU AI Act 第 14 条留存的人类决策日志,记录了构建这一点的一种方式。
- 审计假阴性,而不是准确率。抽取一批被你的 AI 筛选在边缘拒掉的候选人,让人以盲评方式为这些录像评分。Lane 的结果表明,拒绝一侧的错误正是机器采纳率集中之处,而你的指标对它们在结构上是盲的。
你的 AI 面试体系里大概已经有人了。真正的研究问题不是他在不在——而是他是否在机器告诉他该怎么想之前,就已经形成了判断。
去看看你复核者的屏幕。如果分数加载在录像的上方,你没有一个在环路里的人。你有的是一名见证者。