По шкале сегрегации, где 2,0 означает, что каждая демографическая группа полностью загнана в собственную профессиональную нишу, люди-участники набрали 0,84. Большие языковые модели, выполнявшие ту же самую задачу, набрали примерно на 65% больше. Модель o3 от OpenAI достигла 1,83 (MIT Technology Review, 2026).
Эту предвзятость никто не закладывал в обучение. Кандидаты были вымышленными, этнические группы — придуманными, и у каждого соискателя была ровно одинаковая вероятность успеха на любой должности. Модели построили стереотип сами, в реальном времени, из горстки результатов найма.
Это другая проблема, чем та, которую призван отлавливать ваш закупочный процесс. Предвзятость ИИ-скрининга в том виде, в каком её мыслит большинство процедур проверки поставщиков, — унаследованная: осадок перекошенных обучающих данных, обнаруживаемый до внедрения, исправимый лучшим корпусом и сертификатом аудита. Здесь же предвзятость вообще не имеет источника выше по течению. Она формируется после запуска, из обратной связи по вашим же результатам найма, внутри системы, прошедшей все предзапусковые проверки, которые вы провели.
Исследование: чистые данные на входе, сегрегация на выходе
Исследователи Princeton University и University of Chicago адаптировали психологический эксперимент о формировании стереотипов у людей и прогнали его на 15 моделях от OpenAI, Anthropic, DeepSeek, Meta, Google и Alibaba. Работа была представлена на ICML в Сеуле в июле 2026 года (Liu et al., ICML 2026).
Постановка намеренно стерильна. Каждой модели сообщают, что мэр вымышленного города нанял её консультантом и что нужно закрыть 20 вакансий: врачи, юристы, воспитатели, уборщики. В каждом раунде — одна вакансия и четыре кандидата, по одному из четырёх придуманных этнических групп: туфа, айма, реку, веки. Модель нанимает, узнаёт, оказался ли человек успешен, и переходит к следующему раунду. Сорок раундов. Задача — максимизировать число успешных наймов.
Скрытая от модели истина: каждый кандидат одинаково вероятно преуспеет на любой работе. Никакого сигнала здесь нет.
Модели всё равно его нашли. Узнав, что представитель айма провалился как врач, модель переставала нанимать айма врачами — и начинала направлять их на уборку, которую классифицировала как требующую меньшей теплоты и компетентности (MIT Technology Review, 2026). Один исход, одна группа, одна должность. Из этого — кастовая система.
Авторы прямо говорят, что это значит: LLM «способны спонтанно вырабатывать новые социальные предубеждения об искусственных демографических группах даже там, где никаких внутренних различий не существует», а значит, они «не просто пассивные зеркала человеческих социальных предубеждений, но могут активно создавать новые из опыта» (Liu et al., ICML 2026).
Модель, никогда не видевшая предвзятого датасета, всё равно способна произвести сегрегированный штат. Предвзятость не в корпусе. Она в правиле обновления.
Ваша самая производительная модель — самая рискованная
Вот результат, который должен переупорядочить ваш шорт-лист поставщиков. Внутри каждого протестированного семейства более новые, крупные и способные модели рассуждения оказывались более предвзятыми, а не менее. Жёстче всех стратифицировали кандидатов o3 от OpenAI и R1 от DeepSeek.
Механизм — не дефект. Это способность, работающая ровно так, как задумано. Райан Лю, соавтор из Princeton, говорит прямо: LLM «действительно жадны до обобщений на основе ограниченных данных. Буквально на это они во многом и оптимизированы» (MIT Technology Review, 2026).
Любой принимающий решения сталкивается с компромиссом между исследованием и эксплуатацией: держаться того, что сработало, или попробовать то, что может сработать лучше. Модели, обученные на задачах по математике, программированию и естественным наукам, вознаграждаются за выведение правила из немногих примеров и его уверенное применение. Именно этот инстинкт делает их сильными в логических головоломках. Направленный на задачу социального распределения, он превращается в преждевременное обобщение из скудных данных — и модель перестаёт исследовать группы, которые уже списала. Формулировка самих исследователей: более сильная модель «может отдавать предпочтение кандидатам из группы, если прежние назначения на схожие должности были успешными», и «эта на вид рациональная склонность может быть дезадаптивной, поскольку рискует сократить исследование и непреднамеренно маргинализировать социальные группы» (Liu et al., ICML 2026).
Операционный вывод переворачивает стандартную закупочную эвристику. В вашем сравнении скрининговых инструментов модель с лучшими цифрами точности на статическом бенчмарке — правдоподобно та самая, что будет сегрегировать сильнее всех, как только начнёт учиться на живых исходах. Способность и этот режим отказа коррелируют, а вы сейчас отбираете только по способности.
Ваша проверка предвзятости ИИ-скрининга нацелена не на тот артефакт
Большая часть управления ИИ в найме исследует то, что существует до встречи системы с вашими кандидатами: происхождение обучающих данных, model cards, метрики справедливости на эталонном наборе, предзапусковый тест impact ratio, пакет гарантий поставщика уровня SOC 2.
Нью-йоркский Local Law 144 — самый копируемый шаблон в отрасли — требует ежегодного независимого аудита предвзятости, измеряющего impact ratio отбора по полу и расе/этничности для automated employment decision tools, включая интерсекциональный анализ и публикацию сводки аудита (Warden AI, 2026). Ежегодный. Независимый. И это моментальный снимок.
Снимок — неверный инструмент для предвзятости, накапливающейся от раунда к раунду. В исследовании сегрегация возникла за 40 решений. Скринер на объёмах среднего бизнеса проходит 40 решений за полдня. Мартовский аудит, удостоверяющий паритет, ничего не говорит о политике, к которой система сошлась к сентябрю, потому что сентябрьская политика построена на данных, которых в марте не было: на ваших данных, ваших результатах найма, вашей обратной связи.
Этот разрыв растёт с каждой функцией памяти и персонализации, которую выпускают поставщики. Скринер, сохраняющий контекст между сессиями, или дообучаемый на ваших решениях о принятии/отказе, или ведущий текущее резюме «что здесь сработало», — это ровно та архитектура, которую моделирует исследование. Скринер без состояния, оценивающий каждое резюме независимо и забывающий, существенно безопаснее — что противоположно тому, как эти продукты вам продают.
Разрыв между внедрением и контролем
Экспозиция уже широка. Более 90% организаций внедрили ИИ в привлечение талантов, тогда как менее 5% сообщают о трансформационных результатах — по данным исследования ManpowerGroup Talent Solutions 2026 года среди senior-руководителей по талантам в США и Великобритании (ManpowerGroup, 2026). Почти всеобщее внедрение, минимальная реализованная ценность и — как подсказывает исследование — неизмеряемый риск дрейфа, идущий под обоими.
Сильнейшее возражение и где оно перестаёт работать
Честный контраргумент: это вымышленный город с придуманными этносами и игрушечным сигналом вознаграждения. Ваша ATS работает иначе. Реальные скринеры ранжируют относительно эмбеддингов описаний вакансий и структурированных критериев, большинство вообще не учится на последующих исходах, а четыре выдуманные группы не несут ни одной из корреляций, которые делают реальную предвзятость поддающейся анализу.
Это возражение право насчёт переносимости механизма и неправо насчёт его направления.
Оно работает там, где ваш скринер по-настоящему без состояния: нет памяти, нет обратной связи по исходам, нет дообучения на ваших решениях, каждый кандидат переоценивается с фиксированной политики. Если это описывает ваш стек, исследование — предупреждение о системе, которую вы ещё не купили.
Оно перестаёт работать в двух точках. Во-первых, вымышленные группы усиливают вывод, а не ослабляют его: без реальных коррелятов не было легитимного сигнала для обучения, значит каждая единица сегрегации изготовлена. В живом пайплайне, где подлинные корреляции есть, у модели больше материала для чрезмерного обобщения, а не меньше. Во-вторых, отрасль движется именно к агентам с состоянием, памятью и непрерывным обучением, где этот режим отказа является родным. Вопрос не в том, делает ли это ваш текущий инструмент. Вопрос в том, будет ли это делать обновление, стоящее у поставщика в дорожной карте на следующий год, — и сообщит ли вам об этом ваш договор.
Во что это обходится до того, как кто-либо подаст жалобу
Юридический хвост не теоретичен. В деле Mobley v. Workday — иске о дискриминации при алгоритмическом скрининге в Северном округе Калифорнии — из собственных процессуальных документов Workday следует, что за рассматриваемый период с помощью её инструментов было отклонено 1,1 миллиарда заявок; дело прошло коллективную сертификацию и спорную стадию раскрытия по тестам на предвзятость и данным соискателей (Duane Morris, 2026). Каким бы ни был исход, диспозиция раскрытия уже сложилась: ваши решения по скринингу и ваши журналы тестирования на предвзятость достижимы.
Более тихая цена приходит первой, и это проблема качества найма прежде, чем юридическая. Скринер, молча переставший показывать определённую когорту на конкретную роль, не выдаёт ошибку. Он возвращает шорт-лист, который выглядит совершенно разумно. Вы теряете кандидатов, которых никогда не видели, по схеме, которую никто не выбирал, а метрики вашей воронки всё это время остаются зелёными — потому что сужающееся пространство поиска и эффективное пространство поиска дают одинаковый дашборд.
Одно решение в этом квартале
Перед следующим продлением или расширением договора со скрининговым поставщиком задайте два вопроса письменно и потребуйте письменных ответов.
Первый: есть ли у этого инструмента состояние? Хранит ли он память между кандидатами или сессиями, учится ли на наших результатах найма, дообучается ли на наших решениях о принятии/отказе — сегодня или по продуктовой дорожной карте? Ответ «да» переводит вас из режима статического аудита в режим мониторинга дрейфа, и ничто другое в вашем управлении этого не изменит.
Второй: что покажет нам дрейф? Две договорные оговорки покрывают основную часть риска. Холдаут со случайным исследованием — определённая доля решений, принимаемых без выученного предпочтения модели; это единственный способ продолжать наблюдать исходы для когорт, которые система начала списывать. И помесячный мониторинг исходов по когортам, отслеживающий доли отбора по группе и по роли, потому что режим отказа в исследовании — это не меньше наймов из группы в целом, а то же число наймов, рассортированное по другим должностям. Агрегированный impact ratio показал бы в той симуляции паритет, пока индекс сегрегации полз к своему потолку.
Обе оговорки — предмет договора, а не плана внедрения. Продление — момент, когда у вас есть рычаг.
Предвзятость ИИ-скрининга в этом исследовании не была унаследованной, не была намеренной и не была видна ни в одном артефакте, существовавшем до внедрения. Она была изготовлена на ходу, самой способной системой в комнате, из данных, в которых нечего было находить. Направьте свою проверку на то, чему модель учится у вас, — а не на то, с чем она пришла.