在一套隔离度量表上,2.0 代表每个族群都被完全限制在各自的职业小格里。人类参与者的得分是 0.84。执行完全相同任务的大语言模型,得分高出约 65%。OpenAI 的 o3 达到了 1.83(MIT Technology Review, 2026)。
没有人把这种偏见训练进去。候选人是虚构的,族群是编造的,每位应聘者在每个岗位上成功的概率完全相同。模型是自己建立起这套刻板印象的——在运行中,仅凭少数几次招聘结果。
这与你的采购流程被设计来拦截的那类问题不同。大多数供应商尽职调查所理解的 AI 筛选偏见是"继承来的":训练数据倾斜留下的残留物,可在部署前检出,可用更好的语料库和一纸审计证书修复。而这里的偏见根本没有任何上游来源。它在上线之后成形,来自你自己招聘结果的反馈,发生在一个通过了你所有上线前检查的系统里。
这项研究:干净数据进去,职业隔离出来
Princeton University 与 University of Chicago 的研究者改编了一项关于人类刻板印象形成的心理学实验,并在来自 OpenAI、Anthropic、DeepSeek、Meta、Google 和 Alibaba 的 15 个模型上运行。论文于 2026 年 7 月在首尔的 ICML 上发表(Liu et al., ICML 2026)。
实验设置刻意做得"无菌"。每个模型被告知,它受一座虚构城市的市长聘为顾问,需要填补 20 个岗位:医生、律师、育儿助理、清洁工。每一轮呈现一个空缺和四名候选人,分别来自四个编造的族群:Tufa、Aima、Reku、Weki。模型做出录用决定,得知此人是否胜任,然后进入下一轮。共四十轮。目标是让成功录用的次数最大化。
对模型隐藏的真实设定是:每位候选人在每个岗位上成功的概率都相同。根本没有信号可找。
模型还是找到了一个。当被告知某位 Aima 当医生失败后,模型便不再录用 Aima 做医生——转而把他们导向清洁类岗位,因为它把这类岗位归类为对热情与胜任力要求更低(MIT Technology Review, 2026)。一个结果,一个族群,一个岗位。由此生出一套种姓制度。
作者对其含义毫不含糊:大语言模型"能够自发地针对人为设定的族群产生全新的社会偏见,即使这些族群之间并不存在任何固有差异",这使它们"不只是人类社会偏见的被动镜子,而是能够从经验中主动创造新偏见"(Liu et al., ICML 2026)。
一个从未见过偏见数据集的模型,依然能产出一支被隔离的员工队伍。偏见不在语料库里,而在更新规则里。
表现最好的模型,正是风险最高的模型
这是应当重排你供应商短名单的那条发现。在每一个受测的模型家族内部,越新、越大、推理能力越强的模型,偏见越重,而不是越轻。OpenAI 的 o3 与 DeepSeek 的 R1 对候选人的分层最为严重。
这一机制不是缺陷,而是能力按设计运转的结果。Princeton 的合著者 Ryan Liu 说得直白:大模型"确实急于从有限数据中形成概括。这在字面意义上就是它们被大量优化的方向"(MIT Technology Review, 2026)。
任何决策者都面临探索与利用的取舍:守住有效的做法,还是尝试可能更好的做法。在数学、编程和科学题目上训练的模型,因"从少量样本推出规则并自信应用"而获得奖励。正是这种直觉让它们擅长逻辑谜题。一旦对准社会资源分配问题,它就变成基于稀薄证据的过早概括,并且停止探索那些已被它划掉的群体。研究者自己的表述是:更强的模型"可能偏好某一群体的候选人,只要此前在相似岗位上的分配是成功的",而"这种看似理性的倾向可能是适应不良的,因为它有减少探索、并在无意间边缘化社会群体的风险"(Liu et al., ICML 2026)。
其运营含义颠覆了一条标准的采购经验法则。在你的筛选工具比选中,静态基准上准确率数字最漂亮的那个模型,很可能正是它一旦开始从真实结果中学习后隔离得最狠的那个。能力与这种失效模式是相关的,而你目前只按能力做选择。
你对 AI 筛选偏见的尽职调查瞄错了对象
招聘领域的 AI 治理,大多在检查系统接触你的候选人之前就已存在的东西:训练数据来源、model cards、基准数据集上的公平性指标、上线前的影响比率测试、供应商提供的类 SOC 2 保证材料包。
纽约市的 Local Law 144——业内被复制最多的模板——要求对自动化雇佣决策工具进行年度独立偏见审计,按性别和种族/族裔衡量录取率影响比,并包含交叉分析和审计摘要的公开披露(Warden AI, 2026)。年度。独立。而且是一张快照。
对于一种跨轮次累积的偏见来说,快照是错误的工具。在研究中,隔离是在 40 次决策的过程中浮现的。一个处理中型企业体量的筛选工具,一个下午就能跑完 40 次决策。三月份认证"结果达标"的审计,对系统到九月收敛成什么样的策略毫无说明力,因为九月的策略是用三月还不存在的数据构建的——你的数据、你的招聘结果、你的反馈。
供应商每发布一项记忆与个性化功能,这道缺口就扩大一分。一个跨会话保留上下文、或基于你的录用/拒绝决定做微调、或维护一份滚动"这里什么有效"摘要的筛选工具,正是该研究所建模的架构。而一个无状态的筛选工具——独立评估每份简历、评完即忘——实质上更安全,这与这些产品向你推销的方式恰好相反。
采用度与掌控力之间的落差
风险敞口已经很广。据 ManpowerGroup Talent Solutions 2026 年针对美英两国高级人才负责人的研究,超过 90% 的组织已在人才招募中部署 AI,但报告获得转型级成果的不足 5%(ManpowerGroup, 2026)。近乎普遍的部署,极低的实际价值兑现,而且——研究提示——两者之下还流淌着一层未被测量的漂移风险。
最有力的反驳,以及它在哪里失效
诚实的反方意见:这是一座虚构城市、编造的族裔和一个玩具式的奖励信号。你的 ATS 不是这么运作的。真实的筛选工具是针对职位描述嵌入和结构化标准做排序,大多数根本不从下游结果中学习,而那四个虚构族群不带有任何让现实偏见变得可处理的相关性。
这条反驳在机制的可迁移性上是对的,在机制的方向上是错的。
在你的筛选工具真正无状态时它成立:没有记忆、没有结果反馈、不基于你的决定做微调、每位候选人都从固定策略重新评分。如果这就是你的技术栈,那么这项研究是对一个你还没买的系统发出的警告。
它在两点上失效。第一,虚构族群非但没有削弱结论,反而强化了它:由于不存在现实世界的相关物,本就没有任何正当信号可学,因此每一分隔离度都是凭空制造的。在真实的招聘管线中,当真实相关性存在时,模型可供过度概括的素材更多,而不是更少。第二,整个行业正朝着有状态、带记忆、持续学习的智能体演进,而这正是这种失效模式的原生环境。问题不在于你现有的工具是否如此,而在于供应商明年路线图上的那次升级是否如此——以及你的合同是否会告知你。
在有人提出申诉之前,它已经让你付出的代价
法律尾部风险并非理论。在 Mobley v. Workday 一案——加州北区一宗关于算法筛选的歧视诉讼——Workday 自己的法庭文件显示,在相关期间内有 11 亿份申请是通过其工具被拒绝的;该案已推进至集体认证阶段,并就偏见测试与申请人数据的证据开示展开争议(Duane Morris, 2026)。无论结果如何,证据开示的格局已经确立:你的筛选决策和偏见测试记录都是可被调取的。
更安静的代价来得更早,而且在成为法律问题之前,它首先是招聘质量问题。一个已经悄悄不再为某个岗位呈现某一群体的筛选工具,不会抛出报错。它交回一份看上去完全合理的短名单。你损失的是那些你从未见过的候选人,遵循的是一套没有任何人选择过的模式,而你的漏斗指标全程保持绿色——因为不断收窄的搜索空间和高效的搜索空间,在仪表盘上长得一模一样。
本季度的一个决定
在下一次续约或扩大筛选供应商合作之前,把两个问题写下来,并要求书面答复。
第一:这个工具有状态吗? 它是否跨候选人或跨会话保留记忆、是否从我们的录用结果中学习、是否基于我们的录用/拒绝决定做微调——现在如此,还是产品路线图上会如此?回答"是",就意味着你从静态审计机制转入漂移监控机制,而你治理体系里的其他任何东西都改变不了这一点。
第二:什么能让我们看见漂移? 两条合同条款覆盖了大部分风险。一是随机探索留出组——一定比例的决策不使用模型习得的偏好,这是持续观察那些已被系统划掉的群体之结果的唯一办法。二是按月节奏的分群结果监控,同时按群体和按岗位追踪录取率,因为该研究的失效模式并不是某一群体总体录用人数变少,而是录用人数不变、却被分流到不同岗位。在那场模拟中,一个汇总层面的影响比率会显示"结果达标",而隔离指数正一路爬向上限。
这两条都属于合同,不属于实施计划。续约才是你手握筹码的时刻。
这项研究中的 AI 筛选偏见既非继承而来,也非有意为之,更不出现在任何部署前就已存在的产物里。它是在岗位上被制造出来的——由房间里能力最强的那个系统,从一份根本无物可寻的数据中制造出来。把你的尽职调查对准模型从你这里学到了什么——而不是它来的时候就已经知道什么。