当一个关于员工反馈的问题有清晰、可核验的答案时,前沿 AI 模型的得分在 64% 到 82% 之间。而当任务要求把不完整、带情绪、依赖情境的信号权衡成一个站得住脚的结论时,其中最好的模型跌至 33%(PYX Labs, 2026)。
第二类任务在你的公司里有个名字。它叫做决定谁获得晋升。
十位管理者中已有六位在用 AI 对直接下属做决定——加薪、晋升、裁员、解雇(Resume Builder, 2025)。能力曲线与使用曲线正指向相反方向,而几乎没有人在两者之间划下界线。
PYX-Voice 基准究竟测量了什么
2026 年 7 月 15 日,由 Perceptyx 资助的研究机构 PYX Labs 发布了 PYX-Voice,这是首个专门用于评估前沿 AI 模型理解员工反馈能力的基准。来自 OpenAI、Google、Anthropic 与 xAI 的七个领先模型完成了 84 项真实的员工倾听任务,并依据由工业与组织心理学家(I-O)及组织行为专家制定的 208 条标准接受评分(Perceptyx, 2026)。
评分标准才是关键。把一份调查回复的表格交给模型是件小事。而定义对这些数据的正确解读是什么样子——一位称职的 I-O 心理学家会得出什么结论、又会拒绝得出什么结论——才是难点,也正是所有通用 AI 基准都不测试的部分。
核心发现并不是模型很差。它们并不差。随着任务的解读负荷上升,可靠性出现了显著且可预测的下滑(PYX Labs, 2026)。表现最强的模型总分越过 76%。而所有受测模型——无一例外——都把综合研判记录为自身最弱的能力。
这种一致性比绝对分数更重要。四家不同实验室的所有模型共有的弱点,不是一个可以靠采购解决的供应商问题。它是这项任务本身的属性。
悬崖恰好落在风险最高之处
该基准的表现曲线,几乎完美地对应了大多数运营负责人早已凭直觉做出、却很少在工具中落实的一个区分。
模型在反馈能被清晰归入明确主题之处表现最强:关于目标、工具、指标、资源的绩效赋能类问题。这些是披着人力资源外衣的分类问题。存在一个正确答案,答案可核验,而模型能找到它。
在宽泛、细腻的主题上,表现则明显退化——变革、创新,以及那类含糊的评论:它说有什么不对劲,却不说是什么。在这里,模型必须同时握住若干片面且互相矛盾的信号,并给出判断。得分低至 33%(PYX Labs, 2026)。
该基准对这一失效的自述值得引用,因为它点出的是机制而非症状:「崩溃恰恰发生在它们必须权衡不完整的、情绪性的或依赖情境的信号,并将其化为一个清晰结论之时」(HR Dive, 2026)。
再读一遍这段描述,然后问:晋升决定是什么?它是不完整的信息、带有情绪权重、高度依赖情境,并被化为一个清晰结论。这项基准测的不是绩效管理。它测的正是绩效管理所由构成的那一项认知操作。
判断类任务上的 33%,不是一个略弱的助手。那是一次带着笃定嗓音的抛硬币。
而失效模式比分数所暗示的更糟,因为两种情况下的输出看起来一模一样。一个把员工反馈综合得很差的模型,不会返回错误,也不会给出低置信度提示。它返回的是一段流畅、结构完整、完全合理的团队士气描述。复核的管理者没有任何信号可以把 82% 的情形与 33% 的情形区分开。PYX Labs 还记录到少见但值得重视的情形:模型产出了编造的统计结果,或未严格遵守底层数据集的约束——摘要里出现了数据中从未存在过的数字(HR Dive, 2026)。
流畅不等于校准。当推理退化时,呈现层不会跟着退化。
AI 参与的人事决定已经在哪里发生
现在把这份能力画像放到管理者的真实行为旁边。
Resume Builder 于 2025 年 6 月下旬调查了 1,342 位有直接下属的美国管理者。六成使用 AI 工具对自己的团队成员做决定。在这些人中:78% 用它决定加薪,77% 用于晋升,66% 用于裁员,64% 用于解雇(Resume Builder, 2025)。
同一项调查中的另外三个数字,精确地界定了治理问题。
超过五分之一的管理者表示,他们经常让 AI 在没有任何人工介入的情况下做出最终决定。在用 AI 管理下属的管理者中,三分之二未接受过任何正式培训。而仅有 32% 表示接受过关于如何合乎伦理地使用这些工具的正式培训(HR Dive, 2025)。
风险在于信心,而非使用
在借助 AI 管理团队的管理者中,超过十分之七表示相信这项技术能对员工做出公平、无偏见的决定(HR Dive, 2025)。
七成以上有信心。解读端的能力为三成三。这道落差就是全部风险敞口,而它并不靠更好的模型来弥合——它靠更清晰的划界来弥合。
请注意这不是什么。这不是在说管理者鲁莽,也不是说 AI 在绩效管理中毫无位置。把 400 条开放式调查回复的主题提取交出去的管理者,判断是对的;那是 82% 的任务,用人手去做等于浪费一位资深员工一周的时间。问题在于,同一个界面、同一个提示框、同一份组织授权,同时覆盖了这两类任务——而其中只有一类是安全的。
反对过度解读的理由
三点保留意见,直说为好,因为想要对这两个来源打折扣的本能,有一部分是应该的。
PYX Labs 由 Perceptyx 资助,而后者销售员工倾听技术。一项结论为「解读员工反馈比看上去更难、且需要 I-O 专业能力」的基准,对一家出售 I-O 专业能力的公司而言,商业上颇为顺手。记下这一点,然后把它与另一事实相权衡:该基准的方法、任务数量与评分标准均已披露,结果也完整公布,包括模型表现良好之处。
Resume Builder 是一家简历服务公司,其研究是自我报告式的在线调查。「六成管理者用 AI 做人事决定」测量的是管理者自称的行为,而在这样的调查里,回答「是」没有任何代价。把方向当作可靠的,把小数位当作松动的。
再者,PYX-Voice 只是一项基准,发布仅数周,尚未经过独立重复验证。单一基准是证据,不是定论。
在这三点保留之后仍然成立的,是这一发现的形状:能力随解读负荷上升而下降,在各实验室之间表现一致;而使用率恰恰在解读负荷达到峰值处最高。没有任何商业动机能制造出这种倒挂。要让赞助方偏差与调查偏差恰好指向同一方向,需要一种相当奇怪的运气。
这在一家 50 至 500 人的公司里意味着什么
在大型企业中,这个问题会被流程吸收。那里有薪酬委员会、有校准会议、有独立阅读同一批反馈的 HRBP,还有一个会追问解雇决定如何做出的法务部门。
而在 200 人的公司里,只有一位管理者、一张表格和一个截止日期。
这不是在批评中型市场的运营团队——这是让该发现在此处比在两万人企业更为紧迫的结构性现实。中型市场拥有同样的 AI 使用权限、更薄的复核层,以及对不当解雇诉讼低得多的承受力。工具到位了;本可拦下它错误的校准流程没有。
还有一种值得点名的累积效应。一个对细腻反馈读取不足的模型,出错并不随机。它系统性地偏向易读而非重要:偏向写得清楚的投诉而非含蓄的,偏向表达流畅的员工而非寡言的,偏向带关键词的主题而非不带的。让这套东西悄悄运行两个晋升周期,你并没有犯下一个错误。你安装了一种偏见,还附带完整的文档记录。
本季度就把这条线划出来
按可核验性拆分工作,而不是按工具
可用的界线不是「AI 用于 HR,是或否」。而是:这个输出能否在一分钟内对照原始材料完成核验? 把 300 条评论聚成主题——可核验,交出去。依据反馈为一个晋升名额给两位候选人排序——不可核验,留给人。把这条测试写下来并写进管理者指引,因为此刻你手下使用这些工具的管理者中,有三分之二未接受过任何正式培训(Resume Builder, 2025)。
点名 AI 不得终结的四类决定
加薪、晋升、裁员、解雇。对每一类,都要求一份有记录的人类理由,且不得引用 AI 摘要作为其证据。这不花一分钱,而且直接针对当下那五分之一——他们正让模型在无人监督下做决定。
向后审计一个周期
拿出上一个绩效或薪酬周期。向每位管理者问一个问题:AI 在哪一步介入了,你又核验了什么?你要找的不是违规。你要找的是这件事已经发生到什么程度的诚实地图——在我看过的多数中型市场公司里,它比领导层设想的走得更远。
本季度的一个决定
挑出你的管理者在过去九十天里做出的、利害最重的一项人事决定,然后问:AI 生成的摘要是否出现在它证据链的任何一环?如果出现过,再问第二个问题:仅凭输出本身,有没有人分得出那份摘要属于 82% 那一类,还是 33% 那一类?
如果答案是否定的,你面对的不是 AI 问题。你面对的是一次没有边界的授权——而修复它靠的是政策文件里的一行字,不是一个更好的模型。
十位管理者中已有六位越过了那条线。而他们几乎没有人被告知那条线在哪里。