Посчитайте стоимость агента службы поддержки в банке — и счёт за токены составит 20-25 процентов его переменных затрат на эксплуатацию. Человеческий надзор — функциональные эксперты и специалисты по рискам, проверяющие работу агента, — составит 70-75 процентов (McKinsey QuantumBlack, 2026).
Тот же процесс. Тот же счёт. И почти каждый бизнес-кейс по агентам, который я читала в этом году, оптимизирует меньшее из двух чисел.
Выбор модели, кэширование промптов, более дешёвый уровень инференса для малозначимых вызовов — именно туда уходит инженерное внимание, потому что именно там затраты читаемы. Они приходят ежемесячно, постатейно, с чёткой атрибуцией. Надзор же приходит как оплачиваемые часы в чужом центре затрат, поэтому он вообще никогда не учитывается как стоимость ИИ-агента. Он учитывается как причина, по которой пилот тихо не вышел на масштаб.
Что именно оценила McKinsey
Руководство QuantumBlack от 24 августа 2026 года по экономике агентных процессов делает то, что пропускает почти любой анализ агентов: оно оценивает завершённую работу, а не программное обеспечение. Агенты, детерминированные системы и люди, проверяющие результат, — всё в одной полностью нагруженной цифре.
Показательный кейс — открытие банковского счёта. В процессе задействованы от пяти до семи агентов наряду с несколькими детерминированными системами, а надзор обеспечивают от двух до четырёх команд. Полностью нагруженная стоимость одного завершённого онбординга падает примерно с 50-150 долларов до 10-30 долларов (McKinsey QuantumBlack, 2026).
Это улучшение в три-пять раз. Так что это не аргумент против того, что агенты окупаются. Это аргумент о том, что вы отслеживаете не ту статью расходов, чтобы понять, окупаются ли ваши.
Для масштаба: клиентские процессы с одним агентом McKinsey оценивает в некоторых банках в 20 000-30 000 долларов в год эксплуатации, а мультиагентную команду — в 100 000-200 000 долларов. Эти цифры получены из анализа McKinsey публичных исследований и публичных прайс-листов, а не из аудированных книг клиентов — держитесь крепко за пропорции и свободно за абсолютные суммы.
Что на самом деле определяет стоимость ИИ-агента: доля исключений, а не модель
В банковском онбординге клиентов McKinsey ожидает, что от 10 до 20 процентов агентных запусков будут проверены экспертами по рискам и функциональными специалистами.
Эта доля проверок — вся игра целиком, и арифметику стоит пройти медленно: пример ниже мой, не McKinsey, но исходные данные — их.
Возьмите процесс с долей проверок 15% и 20 минутами экспертного времени на проверку. На 1 000 запусков это 50 часов старшего функционального времени. Снизьте долю проверок до 5% — и те же 1 000 запусков обойдутся примерно в 17 часов. Вы убрали две трети дорогой статьи, не тронув ни модель, ни промпт, ни контракт с поставщиком.
И обратите внимание, кто выполняет эту проверку. McKinsey указывает функциональных экспертов и специалистов по рискам — тех людей, чьё суждение процесс и существует защищать, а не младший уровень QA, который можно укомплектовать дёшево. Стоимость надзора высока именно потому, что дешёвый надзор — это не надзор; проверяющий должен быть достаточно старшим, чтобы иметь право отменить решение агента. Любой план, предполагающий делегирование слоя проверки вниз, — это на самом деле план перестать проверять.
Теперь сравните это с рычагом, который все на деле дёргают. McKinsey называет лишь три драйвера стоимости токенов: качество модели, требование к задержке и частоту задачи. Цены переднего края в начале июля 2026 года составляли около 5 долларов за миллион входных токенов и 30 долларов за миллион выходных для модели высшего класса против 0,20 и 1,25 доллара для более раннего облегчённого варианта. Разброс в двадцать пять раз — применительно к четверти счёта.
И вот ловушка внутри очевидной оптимизации. Понижаете модель, чтобы сократить токены, — повышаете долю ошибок. Более высокая доля ошибок повышает долю исключений. Более высокая доля исключений повышает часы проверки, то есть те самые три четверти. Экономия на токенах регулярно финансирует рост надзора, который никто не измеряет, и процесс дорожает, пока дашборд показывает удешевление.
Почему проверочные часы не исчезают
Есть независимые свидетельства того, что статья надзора структурна, а не является болезнью роста, которую перерастают.
MIT Technology Review Insights и Microsoft опросили 300 технологических руководителей и практиков и ранжировали 101 агентную задачу по шкале доверия от 0 до 100. Доверие следовало за проверяемостью задачи и полнотой бизнес-контекста, а не за возможностями модели: автоматическая генерация отчётов получила 83,5, шаблонный код — 82,5, у обоих есть единая объективная метрика оценки, тогда как конфигурация service mesh получила 37,5, а тесты аварийного восстановления — 43: те же базовые модели, но без чистого способа понять, верен ли результат. Подотчётность тревожила 48% респондентов, галлюцинации — 47%, а 59% уже планируют постоянный человеческий надзор (MIT Technology Review Insights, 2026).
Производственные данные указывают в ту же сторону. Исследование агентного продукта Perplexity в сравнении с её поисковым продуктом показало, что выполнение сопоставимых задач сократилось с 269 минут до 36 — на 87% по времени и на 94% по стоимости, — тогда как последующая работа пользователей сместилась вверх, к проверке и расширению (arXiv 2606.07489, 2026).
Человеческая работа перемещается на этап проверки. McKinsey просто первой назначила цену тому месту, куда она приземляется.
Объём и переиспользование решают, сходится ли математика
Вторая половина экономики McKinsey — постоянные затраты, и именно эта половина определяет, преодолевают ли агентные программы среднего бизнеса планку вообще.
Разговорный агент, обрабатывающий онбординг 2 500 новых клиентов в год, стоит 10 000-15 000 долларов. Удвойте объём — и стоимость вырастет лишь до 15 000-20 000 долларов, потому что ИИ-инфраструктура и оркестрация агентов в основном постоянны, а постоянные затраты амортизируются. Обратите внимание, что заложено в статью оркестрации: постоянные мощности data science для поддержки агента в продакшене, который, как отмечает McKinsey, «часто нуждается в правках каждые пару дней».
Поэтому процессы с малым объёмом проигрывают дважды. Они не получают амортизации постоянных затрат, а их коэффициент надзора остаётся высоким, потому что они никогда не накапливают достаточно запусков, чтобы кто-то нашёл шаблоны исключений и устранил их проектным решением.
Выход для среднего бизнеса — переиспользование, а не масштаб. Если ни один отдельный процесс не даёт объёма, достаточного для амортизации инфраструктуры и оркестрации, вопрос становится другим: сколько процессов может работать на одной сборке агента? Формулировка McKinsey — построить один раз, развернуть на множестве процессов. Три смежных процесса, разделяющие агента, слой контекста и протокол проверки, преодолевают порог постоянных затрат, который ни один из них не берёт в одиночку. Это архитектурное решение принимается до первого пилота, и его крайне трудно внедрить задним числом, когда три команды уже купили каждая своё точечное решение.
Эта асимметрия видна в данных по внедрению. State of AI 2026 от McKinsey показал, что доля организаций с выручкой свыше 1 млрд долларов, масштабирующих агентов, выросла с 27% до 40%, тогда как организации с выручкой ниже 1 млрд остались на уровне 22%. Около 20% сообщили, что операционные затраты на ИИ ограничивали их использование, а доля тех, кто приписывает ИИ хоть какое-то влияние на EBIT, осталась на 37% — без изменений год к году (McKinsey, 2026).
Внедрение накапливается. Заявленный финансовый эффект — нет. Это подпись статьи затрат, которой никто не управляет.
Честное возражение: это банки, и это оценка
Две оговорки, которые лучше услышать от меня, чем от вашего финансового директора.
Во-первых, цифра 70-75% взята из регулируемых финансовых услуг, обращённых к клиенту. Интенсивность надзора — функция регуляторной подверженности и последствий ошибки. Внутренняя сортировка заявок в логистической компании на 200 человек лежит на другой кривой, и там разделение может быть ближе к паритету.
Во-вторых, это смоделированные затраты, построенные на публичных ценах и публичных исследованиях, а не измеренные книги из клиентского проекта. Считайте их хорошо специфицированной оценкой, а не измерением.
Но заметьте, в какую сторону идёт ошибка. Цены на токены стабильно падали и будут падать дальше. Зарплаты проверяющих не падали и не будут. Каждый прошедший месяц сдвигает пропорцию ещё дальше против токенов, а не обратно к ним. Если 70-75% неверно для вашего контекста сегодня, честная поправка — спросить, во что это превратится через восемнадцать месяцев, а не предполагать, что оно вернётся к чему-то, что способен увидеть токен-дашборд.
Оцените часы проверки до того, как одобрите пилот
Пять вещей, которые стоит изменить в оценке следующего агентного предложения.
- Внесите долю исключений в бизнес-кейс как поимённую цифру. Процент запусков, требующих человеческой проверки, ожидаемые минуты на проверку, нагруженная часовая стоимость проверяющего. Если никто не готов подписаться под этими тремя цифрами, у вас нет бизнес-кейса — у вас демо с прикреплённым бюджетом.
- Сконструируйте проверяемость прежде, чем расширять периметр. Рейтинг MIT–Microsoft показывает, что доверие следует за задачами с единственной читаемой метрикой успеха. Это свойство создаётся: инструментируйте метрику, закодируйте бизнес-контекст, сузьте периметр. Стройте очередь развёртываний по проверяемости, а не по тому, какая задача выглядит проще.
- Ранжируйте кандидатов в первую очередь по числу запусков в год. Переиспользование и объём — это то, что амортизирует постоянные затраты. Остроумный кейс с малым объёмом — всегда худшая инвестиция, чем скучный с большим.
- Заложите статью сопровождения явно. Агенты, которые правят каждые пару дней, требуют постоянных инженерных мощностей. Это постоянная фиксированная статья, а не проектный расход.
- Отчитывайтесь по ROI завершённой работы. Полностью нагруженная стоимость доведения работы до конца — люди, агенты и детерминированные системы вместе — против ценности этой работы. Не стоимость за токен и не условно сэкономленные часы.
Собственный рецепт McKinsey обратен инстинкту: вместо оптимизации выбора модели перепроектируйте процесс, чтобы снизить долю исключений и упростить процедуры проверки, запускающие дорогое человеческое вмешательство. Это мандат на инжиниринг процессов, спрятанный внутри того, что все считали закупочным решением.
Что решить в этом квартале
Найдите агентный пилот, ожидающий вашей подписи, и запросите одну цифру, которой нет в презентации: ожидаемые часы проверки на сто запусков.
Если ответом будет пожатие плечами, вас просят одобрить не программное обеспечение. Вас просят укомплектовать команду проверки, которую никто не заложил в бюджет, — и сделать это на тех трёх четвертях стоимости ИИ-агента, которые ваш дашборд никогда не был построен вам показывать.