Более 15% чатов OpenAI классифицируются как "Edit written materials or documents". И лишь 2,4% работников заняты в профессии, которая содержит эту задачу в O*NET (Bick, Blandin, Deming & Schumacher, NBER, 2026). Этот разрыв сидит внутри бенчмарка использования ИИ, на котором построено большинство операционных планов на 2027 год.
Теперь в обратную сторону. Единственная задача с наибольшей долей использования genAI в национально репрезентативном опросе — "Direct organizational operations, activities, or procedures": 4,1% всех заявленных случаев использования, её выполняют 43% работников. Её доля в данных OpenAI — 0,0%. У Microsoft — 0,0%. У Anthropic — 0,2%.
Работа, наиболее характерная для операционного блока, — ровно та работа, которую логи чатов не видят вовсе. Если ваш план по ИИ на 2027 год был размечен по одному из этих вендорских исследований использования — а так сделано большинство планов среднего бизнеса, потому что такие исследования бесплатны, свежи и огромны, — вы читаете карту, с которой убрали вашу собственную территорию.
Что сделал этот опрос и чего не могут исследования чатов
Александр Бик (Federal Reserve Bank of St. Louis), Адам Блэндин (Vanderbilt), Дэвид Деминг (Harvard Kennedy School) и Тайлер Шумахер (Vanderbilt) построили первый индекс внедрения genAI на уровне задач на основе национально репрезентативного опроса, а не платформенной телеметрии (NBER Working Paper 35677, 2026).
Важен механизм. Они объединили четыре волны Real-Time Population Survey — 13 920 занятых респондентов в возрасте от 18 до 64 лет — и связали заявленное использование genAI каждого человека с его детальной профессией и с конкретными рабочими активностями ONET, которые эта профессия действительно содержит. Поскольку они знают профессию респондента, они могут отнести использование к задаче внутри известной архитектуры должностей*.
Классификатор чатов так не может. Он читает текст разговора и, как правило, не имеет представления, кем работает пользователь. Поэтому делает единственное доступное: относит чат к названию задачи, описывающему видимое действие. Редактировать. Собирать информацию. Проектировать систему.
Это не дефект чьего-то классификатора. Это структурное ограничение входных данных, и работа называет его прямо: классификаторы чатов «могут быть предрасположены относить чаты к названиям задач, описывающим базовые, обобщённые действия».
Насколько далеко уходит бенчмарк использования ИИ
Следствие — крайняя концентрация. Десять задач из 332 дают 53,0% использования в данных OpenAI, 46,0% у Anthropic и 60,8% у Microsoft — против 22,2% в опросе (Bick et al., NBER, 2026). Крупнейшая одиночная задача забирает соответственно 15,1%, 16,7% и 23,2% трёх наборов чат-данных против 4,1% в опросе.
Затем цифра, которая должна закрыть спор о том, два ли это взгляда на одну реальность. Корреляция между долями задач в опросе и долями в чат-наборах составляет 0,11 для OpenAI, 0,34 для Anthropic и 0,10 для Microsoft. Два из трёх статистически почти не связаны с тем, как работники описывают использование инструментов на своих реальных задачах.
Ошибка второго порядка — та, что уже лежит в вашем плане
Прямая доля использования обычно не попадает в бизнес-кейс. Цепочка длиннее, и работа её прослеживает: классификации «чат-задача» агрегируются в доли genAI по профессиям, а эти доли затем расходятся как прокси подверженности ИИ по ролям — вход для последовательности развёртывания, бюджетов обучения и прогнозов численности. Авторы называют четыре опубликованные меры, построенные так, и заключают, что эти прокси «вероятно, неточны и дают искажённую картину».
Поэтому, когда презентация сообщает, какие ваши функции сильнее всего подвержены ИИ, спросите, откуда взялся рейтинг. Если он восходит к логам чатов, он наследует классификатор, который никогда не знал, кем кто работает, — а его характерная ошибка в том, чтобы завышать работу, которая выглядит обобщённой в расшифровке.
Ваш второй источник данных тоже слабее, чем кажется
Очевидная поправка — отказаться от бенчмарков использования и взять вместо них нормальный индекс профессиональной подверженности. Работа проверила и это, против двух самых цитируемых индексов в литературе.
В регрессии на фактическое внедрение мера Eloundou et al. (2024) даёт скорректированный R² 0,081, а мера Felten et al. (2021) — 0,086, то есть около половины объяснимой дисперсии на уровне профессии (Bick et al., NBER, 2026). Эти индексы действительно прогностичны. Достаточными они не являются и близко.
Под этим лежит более жёсткое ограничение. Сама профессия объясняет менее 20% дисперсии внедрения на уровне отдельного работника (Bick et al., NBER, 2026). То, что определяет, кто действительно внедряет, находится преимущественно внутри должности, а не между должностями. Два аналитика в одной команде, одни инструменты, одни задачи — один перестроил свою неделю вокруг инструмента, другой открывает его дважды в месяц.
Это плановая проблема с чёткой формой. Любое распределение по ролям — лицензии, часы обучения, очерёдность enablement — опирается на переменную, объясняющую менее пятой части интересующего вас результата.
Она же объясняет картину, которую большинство операционных руководителей уже видели и подшили под другой ярлык. Функция возвращается с одной и той же сессии обучения с крайне разными результатами; рефлекторное прочтение — мотивация, качество руководителя или сопротивление изменениям. Данные о внедрении говорят, что большая часть этого разброса возникла бы в любом случае, потому что он на уровне человека, а вмешательство было на уровне роли. Повторить сессию настойчивее — не значит устранить причину.
«Широко, но неглубоко» — точное утверждение, а не оговорка
Картину внедрения из этого опроса легко исказить в обе стороны. Точная версия:
- На май 2026 года 45% работников используют genAI для работы; авторы трактуют это как нижнюю границу, поскольку встроенные и пассивные способы использования часто не осознаются.
- Более 80% профессий и 40% задач показывают внедрение выше 20%.
- Но лишь 2,8% задач превышают 50% внедрения, и ни одна не превышает 70%.
Прочтите вместе. В американской экономике нет ни одной задачи, где использование genAI было бы почти всеобщим. Профессии с очень высоким внедрением — примерно 15% превышают 70% — приходят к этому не через одну насыщенную задачу, а через набор умеренно внедрённых.
Независимые данные согласны по форме. Исследование Google ATLAS, построенное на 14,65 млн обезличенных взаимодействий, а не на самоотчётах, показало, что медианная профессия использует Gemini примерно на 21% своих задач, при намерении сквозной автоматизации менее чем в 10% нерутинных когнитивных разговоров (Google ATLAS v1.0, 2026). Поведенческая телеметрия по 120 620 работникам относит лишь 2% к зрелости интеграции в рабочий процесс — использование ИИ внутри перестроенного процесса, а не как боковой справки (ActivTrak Productivity Lab, 2026).
Три метода, три набора данных, один вывод: широкий охват, тонкое проникновение. А значит, план, который моделирует подверженную ИИ роль как преобразованную ИИ роль, ошибается почти на всю дистанцию.
Честное возражение
Три ограничения, которые стоит удержать.
Цифра 2,4% отчасти артефакт ONET, и авторы сами это говорят. Их точные слова: «доля работников, выполняющих редактирование, явно намного больше 2,4%». ONET встраивает редактирование в задачи более высокого порядка — подготовку отчётов, составление юридических документов. Значит, разрыв между 15% и 2,4% — не чистая ошибка классификатора: часть его в том, что эталонная таксономия отказывается называть деятельность, которая действительно есть повсюду. Направление искажения установлено надёжно; величина любой отдельной пары чисел мягче, чем выглядит.
У самоотчёта свои режимы отказа. Опрос знает, что люди говорят о своей работе с инструментами. Логи чатов знают, что реально прошло через окно, в масштабе, недостижимом ни для одного опроса. Ни то ни другое не является эталонной истиной; они отвечают на разные вопросы, и вклад работы — показать, насколько ответы расходятся, а не объявить один из них ложным.
Национальный опрос — не ваша компания. RPS описывает рабочую силу США. Ваш перечень задач, ваш набор инструментов и ваш дизайн должностей — не среднее по стране, и ничто здесь не скажет, какие из ваших ролей внедрят инструмент.
Последнее ограничение и есть по-настоящему значимое — и указывает оно в одну сторону. Любой внешний бенчмарк в этой области, из чат-логов или из опроса, — это априорная оценка. Ни один из них не является измерением вашей организации.
Что решить в этом квартале
Четыре шага. Ни один не требует новых расходов.
- Проследите каждый бенчмарк использования ИИ в вашем плане до источника. Если цифра происходит из платформенных логов чатов, пометьте её как направляющую априорную оценку, а не как вход модели численности или бюджета. Это тридцатиминутный аудит документа, который вы уже написали.
- Составьте перечень задач для одной функции. Двадцать-тридцать реальных активностей одной команды, записанных вашим языком, а не языком O*NET. Это единственный артефакт, позволяющий спросить «инструмент касается этого?» вместо «эта роль подвержена?» — и он переживает любую ревизию вендорских бенчмарков, потому что описывает вашу работу, а не чужой трафик. Заложите полдня с руководителем команды, а не консалтинговый проект.
- Перестаньте распределять enablement по ролям. Если профессия объясняет менее 20% внедрения на уровне человека, ролевое развёртывание близко к подбрасыванию монеты. Распределяйте по наблюдаемому использованию и пусть первая когорта — те, кто уже впереди по вашей собственной телеметрии.
- Ставьте цель на задачу, а не на лицензию. Выберите одну задачу из перечня и доведите её за 50% внедрения. Менее трёх задач из ста в масштабах страны перешли эту черту — именно поэтому осознанный переход через неё является защитимым результатом для отчёта.
Ваш бенчмарк использования ИИ ответил на вопрос, который вы не задавали: как выглядят чаты. Вопрос на вашем столе — что ваши люди делают весь день и добрался ли инструмент хоть до какой-то части этого.
У одного из этих вопросов есть опубликованный ответ. У второго есть только ваш.