Scovai Scovai
Organizational Behavior 2026-08-04 1 min read

Шесть из десяти руководителей решают вопросы повышений и увольнений с помощью ИИ. Новый I-O-бенчмарк показывает: именно здесь он слабее всего.

DSL

Dr. Sarah Liu

Шесть из десяти руководителей решают вопросы повышений и увольнений с помощью ИИ. Новый I-O-бенчмарк показывает: именно здесь он слабее всего.

Передовые модели ИИ набирают от 64% до 82%, когда у вопроса об обратной связи сотрудников есть ясный, проверяемый ответ. Когда же задача требует взвесить неполные, эмоционально заряженные, зависящие от контекста сигналы и свести их к одному защитимому выводу, лучшие из них падают до 33% (PYX Labs, 2026).

У этой второй категории есть имя в вашей компании. Она называется «решить, кого повысить».

Шесть из десяти руководителей уже используют ИИ для решений о своих прямых подчинённых — повышения зарплаты, продвижения, сокращения, увольнения (Resume Builder, 2025). Кривая возможностей и кривая использования направлены в противоположные стороны, и почти никто не провёл границу между ними.

Что на самом деле измерил бенчмарк PYX-Voice

15 июля 2026 года PYX Labs — исследовательская лаборатория при поддержке Perceptyx — выпустила PYX-Voice, первый бенчмарк, созданный специально для оценки того, насколько хорошо передовые модели ИИ понимают обратную связь сотрудников. Семь ведущих моделей от OpenAI, Google, Anthropic и xAI прошли 84 реальные задачи employee listening и были оценены по 208 критериям, сформулированным организационными психологами (I-O) и специалистами по организационному поведению (Perceptyx, 2026).

Критерии оценки — это и есть суть. Передать модели таблицу с ответами опроса тривиально. Определить, как выглядит правильное прочтение этих данных — что заключил бы компетентный I-O-психолог и что он отказался бы заключать, — вот сложная часть, и именно её не проверяет ни один универсальный бенчмарк ИИ.

Главный вывод не в том, что модели плохи. Они не плохи. Надёжность снижалась резко и предсказуемо по мере роста интерпретационной нагрузки задачи (PYX Labs, 2026). Сильнейшая модель в выборке превысила 76% в общем зачёте. Каждая протестированная модель — без исключения — показала синтез как свою самую слабую способность.

Эта согласованность важнее абсолютных баллов. Слабость, общая для всех моделей из четырёх разных лабораторий, — это не проблема поставщика, которую можно решить закупкой. Это свойство самой задачи.

Обрыв находится ровно там, где ставки

Профиль результатов бенчмарка почти идеально накладывается на различие, которое большинство операционных руководителей уже проводят интуитивно, но редко закрепляют в инструментах.

Модели показали лучшие результаты там, где обратная связь чётко раскладывается по хорошо определённым темам: вопросы обеспечения результативности — цели, инструменты, метрики, ресурсы. Это задачи категоризации, переодетые в костюм HR. Есть правильный ответ, ответ проверяем, и модель его находит.

Результаты ухудшались на широких, неоднозначных темах — изменения, инновации, та расплывчатая категория комментариев, которая сообщает, что что-то не так, не говоря, что именно. Здесь модель должна одновременно удерживать несколько частичных, противоречивых сигналов и вынести суждение. Баллы падали до 33% (PYX Labs, 2026).

Собственное описание сбоя, данное бенчмарком, стоит процитировать, потому что оно называет механизм, а не симптом: «Сбой происходит именно тогда, когда им нужно взвесить неполные, эмоциональные или зависящие от контекста сигналы и свести их к одному ясному выводу» (HR Dive, 2026).

Перечитайте это описание и спросите себя, что такое решение о повышении. Это неполная информация, эмоционально нагруженная, сильно зависящая от контекста, сведённая к одному ясному выводу. Бенчмарк проверял не управление результативностью. Он проверял ровно ту когнитивную операцию, из которой управление результативностью и состоит.

33% на задаче суждения — это не чуть более слабый помощник. Это подбрасывание монеты уверенным голосом.

И режим отказа хуже, чем предполагает балл, потому что вывод выглядит одинаково в обоих случаях. Модель, плохо синтезирующая обратную связь сотрудников, не возвращает ни ошибки, ни признака низкой уверенности. Она возвращает гладкий, хорошо структурированный, совершенно правдоподобный абзац о настроении в команде. У проверяющего руководителя нет сигнала, отличающего случай на 82% от случая на 33%. PYX Labs также зафиксировала редкие, но значимые случаи, когда модели выдавали сфабрикованные статистические результаты или не удерживались в рамках ограничений исходного набора данных — цифра в резюме, которой в данных никогда не было (HR Dive, 2026).

Беглость — не калибровка. На уровне подачи ничего не ухудшается, когда ухудшается рассуждение.

Где кадровые решения с ИИ уже принимаются

Теперь поставьте этот профиль возможностей рядом с реальным поведением руководителей.

Resume Builder опросила 1 342 американских руководителя с прямыми подчинёнными в конце июня 2025 года. Шестьдесят процентов используют инструменты ИИ для решений о своих людях. Среди них: 78% применяют его для определения повышений зарплаты, 77% — для продвижений, 66% — для сокращений и 64% — для увольнений (Resume Builder, 2025).

Ещё три цифры из того же опроса точно очерчивают проблему управления.

Более одного из пяти руководителей говорят, что часто позволяют ИИ принимать окончательное решение без участия человека. Две трети руководителей, использующих ИИ для управления людьми, не прошли никакого формального обучения этому. И лишь 32% сообщают о каком-либо формальном обучении этичному использованию этих инструментов (HR Dive, 2025).

Риск — в уверенности, а не в использовании

Более семи из десяти руководителей, применяющих ИИ в управлении своими командами, выразили уверенность в том, что технология принимает справедливые и непредвзятые решения о сотрудниках (HR Dive, 2025).

Более семидесяти процентов уверены. Тридцать три процента способности на интерпретационном конце. Этот разрыв и есть весь риск, и он закрывается не лучшими моделями — он закрывается лучшим определением границ.

Обратите внимание, чем это не является. Это не довод в пользу того, что руководители безрассудны или что ИИ нет места в управлении результативностью. Руководители, делегирующие выделение тем из 400 открытых ответов, поступают правильно; это задача на 82%, и делать её вручную — впустую тратить неделю дорогого специалиста. Проблема в том, что один и тот же интерфейс, одно и то же поле ввода и одно и то же институциональное разрешение покрывают обе задачи — а безопасна только одна из них.

Доводы против того, чтобы вычитать здесь лишнее

Три оговорки, названные прямо, потому что рефлекс дисконтировать оба источника отчасти заслужен.

PYX Labs финансируется Perceptyx, которая продаёт технологии employee listening. Бенчмарк, приходящий к выводу, что интерпретация обратной связи сложнее, чем кажется, и требует I-O-экспертизы, коммерчески удобен компании, продающей I-O-экспертизу. Отметьте это, а затем взвесьте против того факта, что методология, число задач и критерии оценки раскрыты, а результаты опубликованы целиком — включая те области, где модели показали себя хорошо.

Resume Builder — компания, оказывающая услуги по составлению резюме, и её исследование представляет собой онлайн-опрос с самоотчётом. «Шестьдесят процентов руководителей используют ИИ для кадровых решений» измеряет то, что руководители говорят о своих действиях, в опросе, где ответить «да» ничего не стоит. Считайте направление надёжным, а десятые доли — мягкими.

И PYX-Voice — это один бенчмарк, вышедший несколько недель назад и пока не прошедший независимого воспроизведения. Один бенчмарк — свидетельство, а не доказательство.

Что переживает все три оговорки — это форма вывода: способность падает по мере роста интерпретационной нагрузки, единообразно во всех лабораториях, тогда как использование максимально ровно там, где интерпретационная нагрузка достигает пика. Ни один коммерческий интерес не сконструировал эту инверсию. Понадобилась бы довольно странная удача, чтобы смещение спонсора и смещение опроса случайно указали в одну сторону.

Что это значит в компании на 50–500 сотрудников

В крупной корпорации эту проблему поглощает процесс. Есть комитет по вознаграждениям, сессия калибровки, HR-бизнес-партнёр, который независимо читает ту же обратную связь, и юридическая функция, которая спросит, как было принято решение об увольнении.

При 200 сотрудниках есть руководитель, таблица и дедлайн.

Это не упрёк операционным командам среднего бизнеса — это структурная реальность, из-за которой данный вывод здесь острее, чем в компании на 20 000 человек. У среднего бизнеса тот же доступ к ИИ, более тонкий слой проверки и существенно меньшая устойчивость к иску о неправомерном увольнении. Инструмент пришёл; процесс калибровки, который ловил бы его ошибки, — нет.

Есть и накопительный эффект, который стоит назвать. Модель, недочитывающая неоднозначную обратную связь, ошибается не случайно. Она систематически предпочитает читаемое значимому: ясно написанную жалобу — осторожной, красноречивого сотрудника — сдержанному, тему с ключевым словом — теме без него. Дайте этому тихо поработать два цикла повышений — и вы не совершите ошибку. Вы установите предвзятость с документальным следом.

Проведите границу в этом квартале

Разделяйте работу по проверяемости, а не по инструменту

Рабочая граница — не «ИИ для HR: да или нет». Она такова: можно ли сверить вывод с источником меньше чем за минуту? Сгруппировать 300 комментариев по темам — проверяемо, делегируйте. Ранжировать двух кандидатов на одно место в повышении по их обратной связи — не проверяемо, оставьте человеку. Запишите этот тест и внесите его в руководство для менеджеров, потому что прямо сейчас две трети ваших руководителей, пользующихся этими инструментами, не прошли никакого формального обучения (Resume Builder, 2025).

Назовите четыре решения, которые ИИ закрывать не вправе

Повышения зарплаты, продвижения, сокращения, увольнения. Для каждого требуйте документированного человеческого обоснования, которое не ссылается на резюме от ИИ как на доказательство. Это ничего не стоит и напрямую адресует того одного из пяти, кто сегодня позволяет модели решать без надзора.

Проверьте один цикл назад

Возьмите последний цикл оценки результативности или пересмотра вознаграждений. Задайте каждому руководителю один вопрос: где здесь участвовал ИИ и что вы проверили? Вы ищете не нарушения. Вы ищете честную карту того, где это уже происходит, — а она в большинстве компаний среднего бизнеса, которые я разбирала, заходит дальше, чем предполагает руководящая команда.

Одно решение в этом квартале

Возьмите самое значимое кадровое решение, принятое вашими руководителями за последние девяносто дней, и спросите, стояло ли где-нибудь в его доказательной цепочке резюме, сгенерированное ИИ. Если стояло, задайте второй вопрос: смог бы кто-нибудь по одному лишь выводу понять, был ли этот текст случаем на 82% или случаем на 33%?

Если ответ отрицательный, у вас не проблема с ИИ. У вас делегирование без периметра — и исправление умещается в строку регламента, а не в более совершенную модель.

Шесть из десяти руководителей эту границу уже перешли. Почти никому из них не сказали, где она проходит.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.