Scovai Scovai
AI & Operations 2026-07-22 1 min read

Доверие определяется проверяемостью, а не способностью: новый индекс доверия к агентам от MIT и Microsoft по 101 задаче называет порядок развёртывания, который операции среднего рынка выстроили наоборот

DSL

Dr. Sarah Liu

Доверие определяется проверяемостью, а не способностью: новый индекс доверия к агентам от MIT и Microsoft по 101 задаче называет порядок развёртывания, который операции среднего рынка выстроили наоборот

Расстояние между самой доверенной задачей агента и наименее доверенной составляет 46 пунктов по 100-балльной шкале — и ни один из этих пунктов не является разрывом в способности. В отчёте, опубликованном 29 июня 2026 года, MIT Technology Review Insights и Microsoft ранжировали 101 задачу агентного ИИ по шкале доверия от 0 до 100, опросив 300 технологических руководителей, тимлидов и специалистов из 12 отраслей (MIT Technology Review Insights, 2026). Автоматическая генерация отчётов получила 83,5, а шаблонный код — 82,5. Тестирование аварийного восстановления оказалось на отметке 43, а конфигурация service mesh — 37,5. Модели, выполняющие все четыре задачи, одни и те же. Их разделяет то, может ли человек чисто проверить результат, — и именно эта единственная переменная должна переупорядочить ваш порядок развёртывания ИИ-агентов в этом квартале.

Большинство развёртываний среднего рынка выстраивается по прокси, который кажется интуитивным и молчаливо ошибочен: сначала разворачивать задачи, которые выглядят проще всего. Индекс говорит, что операционный вопрос не в том, «насколько задача сложна для модели», а в том, «насколько легко я могу проверить результат». Это разные оси, и их смешение — это способ, которым хорошо профинансированное развёртывание застревает через полгода с агентами, которым никто не доверяет настолько, чтобы оставить без надзора.

Что индекс действительно измерил

Методология важна, потому что именно она делает вывод применимым, а не анекдотичным. Исследовательская команда опросила 300 практиков — руководителей, тимлидов и отдельных специалистов — в феврале и марте 2026 года, из 12 отраслей и организаций от стартапов до фирм с годовой выручкой свыше 10 миллиардов долларов (Microsoft Cloud Blog, 2026). Затем они оценили 101 отдельную задачу в рабочих процессах ИИ, данных и облака по шкале доверия от 0 до 100, где оценка отражает, насколько практики готовы передать задачу агенту.

Результат — это не рейтинг того, что ИИ может делать. Это рейтинг того, что операторы готовы оставить без надзора, — и разрыв между этими двумя вещами и есть вся суть. Формулировка самого отчёта пряма: задачи, скапливающиеся наверху, объединяют проверяемость и полноту бизнес-контекста, тогда как задачам внизу их не хватает (MIT Technology Review Insights, 2026). Способность не была различающей переменной. Проверяемость — была.

Почему «самое простое» — неверный ключ сортировки

Рассмотрим две верхние задачи. Автоматическая генерация отчётов (83,5) и шаблонный код (82,5) доверенны не потому, что тривиальны, — сгенерировать связный отчёт из беспорядочных входных данных действительно трудная задача моделирования. Они доверенны, потому что у каждой есть единственный объективный оценочный сигнал. Шаблонный код либо проходит свои тесты и вливается, либо нет; merge rate — это чистая метрика «прошёл/не прошёл», которую человек может проверить за секунды. Сгенерированный отчёт можно сверить с исходными данными, которые он резюмирует. Работа агента читаема.

Теперь посмотрим на низ. Конфигурация service mesh (37,5) и тестирование аварийного восстановления (43) малодоверенны не потому, что модель хуже справляется с ними (Forbes, 2026). Они малодоверенны, потому что нет чистой единственной метрики, которая скажет вам, что агент сделал правильно, — и потому что правильность зависит от бизнес-контекста, которым агент не владеет: какие сервисы несущие, какова ваша реальная толерантность к отказоустойчивости, какие зависимости — недокументированное неявное знание. Вы не можете проверить результат, не восстановив тот самый контекст, который изначально и сделал задачу трудной. Режим отказа — это не неправильный ответ; это ответ, который вы не можете уверенно оценить, пока что-то не сломается в продакшене.

Это ключ сортировки, который большинство развёртываний путают. Задачи «на вид простые» и задачи «проверяемые» кажутся одним множеством. Это не так. Задача может быть простой в описании и почти невозможной для проверки — сверить два расходящихся источника данных, составить исключение из политики, отсортировать неоднозначный тикет. Индекс говорит: перестаньте сортировать по видимой простоте и начните сортировать по более трудному и честному вопросу: когда этот агент закончил, какова единственная метрика, говорящая мне, что он преуспел, — и могу ли я прочитать её, не переделывая работу?

Метрика — это настоящие врата вашего порядка развёртывания

Переформулируйте секвенирование развёртывания как проблему доступности метрик — и весь план развёртывания переупорядочится сам.

Для каждого рабочего процесса-кандидата тест на допуск не «может ли агент сделать это», а «есть ли к этому привязан чистый сигнал успеха». Там, где существует merge rate, проверка сверки «прошла/не прошла», результат валидации схемы или сопоставление с эталонными данными, агент может работать под лёгким надзором, и вы получаете реальный рычаг. Там, где единственный способ узнать, что агент прав, — это чтобы опытный человек перепроверил ситуацию от начала до конца, вы не автоматизировали задачу — вы добавили черновой шаг перед работой, которую всё равно надо делать. Это всё ещё может быть оправданно. Но это принципиально иное экономическое предложение, и притворяться, что две категории — одно, — это способ, которым «прирост производительности» испаряется в накладные расходы на проверку.

Практический шаг — провести аудит целевых рабочих процессов и разделить их именно по этой линии. Задачи с нативной объективной метрикой успеха идут в начало очереди развёртывания. Задачи, корректность которых зависит от бизнес-контекста, которого у агента нет — и который человек, следовательно, должен полностью восстанавливать, чтобы их проверить, — идут в конец, за намеренной работой по построению этой проверяемости: инструментировать метрику, закодировать недостающий контекст или сузить задачу до тех пор, пока не появится чистая проверка. Проверяемость — не фиксированное свойство задачи. Это то, что можно спроектировать, — и спроектировать её и есть настоящая предпосылка масштабирования агентов, а не выбор модели.

Подотчётность — это ограничение, скрытое за цифрами

Индекс также выявляет, почему этот порядок не опционален. На вопрос, что их беспокоит в агентном развёртывании, респонденты назвали подотчётность (48%) и галлюцинации (47%) главными опасениями — и 59% сказали, что уже планируют постоянный человеческий надзор, а не относятся к нему как к временной обучающей фазе (MIT Technology Review Insights, 2026). Прочтите эти три числа вместе — и механизм ясен. Подотчётность требует, чтобы, когда что-то идёт не так, назначенный человек мог это перехватить. Это возможно только когда результат проверяем. На непроверяемой задаче «человеческий надзор» — это театр: человек подписывает работу, которую на самом деле не может проверить.

Так что 59%, планирующие постоянный надзор, — сформулировали они это так или нет — признают, что значительная доля их агентных рабочих процессов лежит на низкопроверяемом конце индекса. Честный ответ на это — не больше шагов согласования. Это секвенировать развёртывание так, чтобы надзор ложился туда, где он может делать реальную работу, — на высокоценные задачи с чистой метрикой — и придержать задачи, где надзор нефальсифицируем, пока вы не построите метрику, придающую подотчётности смысл. 48%, называющие подотчётность, не просят более медленного ИИ. Они просят проверяемого ИИ, и порядок развёртывания — это то, где это решается.

Что развернуть первым — а что придержать

Ничто из этого не аргумент за замедление. Это аргумент за смену сортировки. Вот конкретное переупорядочивание, которое поддерживает индекс:

Разверните первыми: задачи с нативной объективной метрикой успеха — генерация отчётов, оцениваемая по исходным данным, код, оцениваемый по test-and-merge, валидация данных, оцениваемая по соответствию схеме, сопоставление и сверка, оцениваемые по эталону. Это ваши задачи с оценкой выше 80. Они наращивают доверие, потому что каждый успех виден.

Инструментируйте, затем разверните: задачи, которые ценны, но сейчас непроверяемы, где вы можете добавить метрику — определить проверку приёмки, логировать сравнение с эталоном, сузить объём, пока не появится сигнал «прошёл/не прошёл». Именно здесь живёт большая часть неиспользованного ROI, и он невидим, если вы сортируете только по видимой сложности.

Придержите: насыщенные контекстом, плотные по суждению задачи, где проверка означает полное восстановление ситуации, — аналоги аварийного восстановления и service mesh в вашей собственной работе. Автоматизировать их первыми — это способ породить тревогу подотчётности, которую измерил индекс.

Есть слой таргетирования, который большинство развёртываний пропускают. Толерантность к непроверенному результату агента неоднородна в команде — некоторые роли и поведенческие профили будут чрезмерно доверять низкопроверяемому агенту, а другие откажутся использовать даже высокопроверяемого. Секвенирование агентов по проверяемости задачи — структурная половина проблемы; сопоставление того, кто управляет каким классом агента, с тем, как люди на самом деле калибруют доверие, — половина человеческая. Сделать обе части правильно — это разница между развёртыванием, которое строит доверие задача за задачей, и тем, что тратит свои первые два квартала на изготовление надзора, который не может поддерживать.

Единственная сортировка этого квартала

Вам не нужно ничего перепроектировать, чтобы действовать на основе этого. Вам нужно пересортировать один список. Возьмите ваш текущий порядок развёртывания агентов — последовательность рабочих процессов, которые вы планируете автоматизировать в этом квартале, — и переранжируйте его по единственному вопросу к каждой задаче: когда агент закончил, есть ли единственная чистая метрика, говорящая мне, что он преуспел, и могу ли я прочитать её, не переделывая работу? Каждое «да» поднимается. Каждое «нет» опускается, за явной работой по построению этой метрики. Затем наблюдайте, какие агенты зарабатывают устойчивое доверие, а какие молча накапливают очередь непроверяемого результата, который кто-то в конце концов перестаёт просматривать.

Индекс MIT–Microsoft оценил это для вас по 101 задаче: граница того, что вы можете безопасно делегировать, проведена не способностью. Она проведена проверяемостью. Отсортируйте развёртывание по неверной оси — и вы автоматизируете первыми задачи, которые не можете проверить, а цену узнаете лишь тогда, когда одна из них окажется неверной в продакшене. Отсортируйте по верной — и каждый агент, которого вы разворачиваете, делает следующего легче для доверия.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.