Scovai Scovai
AI & Operations 2026-08-12 1 min read

У вашего флота агентов есть потолок — нейробиологи Harvard оценили его в 16

DSL

Dr. Sarah Liu

У вашего флота агентов есть потолок — нейробиологи Harvard оценили его в 16

Добавляйте агентов к задаче — и коллективная точность растёт, примерно до шестнадцати. За этой точкой она падает: группа перестаёт сходиться к ответу и начинает распадаться на лагеря, подтверждающие друг друга (NTT Research, 2026). Это не предел мощности. Не предел бюджета. Это предел координации — тот же, что управляет человеческими командами, и он приходит в дорожную карту, исходившую из того, что больше агентов означает больше результата.

Само число специфично для задачи и не перенесётся на ваши процессы. Переносится форма кривой, и эта форма превращает размер флота агентов из закупочной переменной в проектную: в любом агентном внедрении есть точка, где предельный агент отнимает, а не добавляет.

Что на самом деле измерила Flag Game

Эксперимент провели Элизабет Павлова, старший специалист по данным Center for Brain Science в Harvard, и Хиденори Танака, руководитель Physics of Artificial Intelligence Lab в NTT Research и программы Physics of Intelligence в Harvard CBS. Работа — Flag Game: Interpreting Decision Mechanisms of Bounded Social Agents — представлена на воркшопе AI4Good в рамках ICML 2026 (Pavlova & Tanaka, 2026).

Постановка нарочито аскетична. Каждый агент видит один небольшой случайно назначенный фрагмент скрытого национального флага. В одиночку опознать его невозможно. Чтобы ответить, популяция должна общаться: агенты передают догадки слушателю, транслируют их группе или обращаются к системе-менеджеру, возвращающей мнение. Игра завершается, когда 85 % и более агентов сходятся на одном флаге в течение трёх раундов подряд, либо когда исчерпан бюджет шагов (The Register, 2026).

Именно эта структура делает результат достойным внимания операционного руководителя. Она изолирует ровно то напряжение, которое содержит любой агентный процесс: приватное свидетельство агента против социального входа из остальной части конвейера. Их согласование — не вопрос способностей модели. Это вопрос структуры коммуникации.

Ниже примерно шестнадцати агентов популяция не собирает достаточно фрагментов, чтобы обосновать уверенный коллективный ответ. Выше режим отказа переворачивается: образуются подгруппы, и каждая подтверждает свою позицию внутри себя, а не против данных. Коллективная точность снижается, хотя общий объём информации в системе продолжает расти.

Почему кривая разворачивается вниз

Интуиция большинства дорожных карт такова: мультиагентная система деградирует плавно — больше агентов, больше шума, убывающая отдача, в конце плато. Результат Flag Game хуже плато. Это спад, и механизм за ним социальный, а не технический.

«Простое добавление ИИ-агентов не обязательно улучшает результат — так же как наём большего числа людей не делает компанию автоматически эффективнее», — сказал Танака при публикации. «Коммуникация усложняется, и группы могут раскалываться на конкурирующие лагеря» (NTT Research, 2026).

Как операционное утверждение это неудобно, потому что поляризованные популяции агентов снаружи не выглядят сломанными. Они выдают уверенный, внутренне согласованный результат. Консенсус по-прежнему формируется — внутри каждого лагеря. Исчезает то свойство, ради которого вы платили: независимые свидетельства в агрегате. Флот из двадцати агентов, выдающий чёткий неверный ответ, гораздо дороже флота из шести, выдающего неуверенный, и лишь одно из этих состояний видно в вашем мониторинге.

Стимул вендора направлен в другую сторону

Обе крупные лаборатории продвигают мультиагентные архитектуры как способ масштабировать ценность ИИ — OpenAI через рамку «swarm» и теперь Agents SDK, Anthropic через мультиагентную оркестрацию (The Register, 2026). Подразумевается, что производительность растёт с числом агентов. Заметьте, кто платит, когда она растёт.

Это не обвинение в недобросовестности; оркестрация действительно полезна. Это замечание о том, куда указывает совет по умолчанию, когда исследование говорит, что полезный диапазон ограничен, а найти эту границу за вас никто в цепочке поставок не заинтересован.

Два вывода, которые важнее числа 16

Заголовочное число будут цитировать год. Но именно два побочных вывода меняют то, что операционная команда среднего бизнеса делает в понедельник.

Структура важнее масштаба. Формулировка исследователей: эффективность корпоративного ИИ зависит не только от того, сколько агентов вы развернули, но и от того, как они общаются, как организованы и как люди направляют их взаимодействие (NTT Research, 2026). Задача, по их словам, не в том, чтобы строить более крупные ИИ-организации, а в том, чтобы проектировать более эффективные.

Разнообразие моделей названо проектной переменной. Исследование описывает организационный успех как баланс масштаба, коммуникации, структуры и разнообразия моделей, где агенты дополняют, а не дублируют друг друга. Публичная версия не приводит количественного сравнения смешанных и однородных команд, поэтому направление стоит трактовать как проектную рекомендацию авторов, а не как измеренный эффект. Но оно прямо противоречит инстинкту стандартизации на одном вендоре — состоянию по умолчанию для большинства закупочных функций.

Почему у тезиса о разнообразии есть независимая опора

Есть отдельная доказательная база, указывающая в ту же сторону. Систематический обзор с метаанализом по 19 исследованиям и 61 размеру эффекта показал, что со-творчество с генеративным ИИ даёт небольшую, но устойчивую гомогенизацию результата, d = 0,334, не объяснимую публикационным смещением (de Rooij & Biskjaer, 2026). Механизм — якорение: модель задаёт отправную точку, человек развивает, и развитие сохраняет качество, разрушая независимость.

Эти работы сравнивали труд с ИИ и без, а не организации с одним вендором против нескольких. Расширение на концентрацию вендоров — вывод по аналогии, а не результат; отмечаю это явно. Но две независимые линии исследований сходятся на одной операционной осторожности: популяция агентов с идентичными априорными допущениями согласится быстрее и будет значить меньше. В Flag Game согласие — условие победы. В вашем бизнесе согласие — ровно то, что вы пытались проверить.

Чем 16 не является

Три ограничения, зафиксированные до того, как кто-то превратит их в политику.

Это не переносимая константа. Шестнадцать — пик для одной синтетической задачи консенсуса с конкретной топологией коммуникации и конкретным правилом остановки. Конвейер извлечения документов, флот код-ревью и система триажа клиентов имеют иную структуру свидетельств и достигнут пика в другом месте — возможно, на четырёх, возможно, на сорока.

Это не утверждение о качестве агентов. Спад — свойство коммуникации популяции, а не рассуждений отдельного агента. Более сильные модели его очевидно не чинят; более независимые источники свидетельств — возможно.

Это работа воркшопа, а не лонгитюдное корпоративное исследование. AI4Good — рецензируемый воркшоп-трек ICML, то есть достоверная ранняя наука, а не воспроизведённый полевой результат на производственных внедрениях. Считайте это хорошо построенным предупреждением о механизме, а не таблицей калибровки.

Что переживает все три оговорки — асимметрия. Если коллективная эффективность по числу агентов — перевёрнутая U, а не растущая прямая, то любой агентной дорожной карте нужно число, на котором она останавливается, — и почти ни у одной его нет.

Человеческое сравнение, которое вы уже ведёте

Аналогия Танаки с наймом — не украшение. Операционные руководители уже управляют потолком координации и уже знают его число, потому что оно есть в оргструктуре.

Данные Gallup 2026 о норме управляемости ставят среднего американского менеджера на 12,1 прямого подчинённого против 10,9 годом ранее — но медиана держится на пяти-шести с 2013 года, а среднее вытягивает вверх тонкий хвост команд свыше 25 (Gallup, 2026). Никто не утверждает, что менеджер с 40 подчинёнными втрое эффективнее менеджера с 13. Мы справедливо полагаем, что издержки координации съедают выигрыш.

Флоты агентов были выведены из этой логики по одной причине: на марже агенты выглядят бесплатными. По точности на марже они не бесплатны, и Flag Game — первая чистая демонстрация того, что издержка в точности приходит раньше строки расходов.

Между тем кривая внедрения не ждёт. Work Trend Index 2026 от Microsoft сообщает о росте активных агентов в экосистеме Microsoft 365 в 15 раз год к году и в 18 раз в крупных компаниях (Microsoft, 2026). Размеры флотов задаются прямо сейчас, тем, кто настраивает процесс, — при полном отсутствии объявленного потолка.

Проектируйте флот, а не только его размер

Четыре шага в порядке дешевизны.

Ограничьте размер флота на задачу и зафиксируйте лимит письменно. Не глобальная политика — число на каждый процесс, выбранное осознанно и записанное рядом с процессом. Важна не столько величина, сколько наличие величины, за которую кто-то отвечает.

Потратьте следующий предельный доллар на инструкции, а не на численность. Центральный тезис исследования — коллективную эффективность двигает то, как люди структурируют и направляют систему. Уточнение спецификации задачи для существующего флота стоит одного вечера; семнадцатый агент стоит лицензии и может стоить точности.

Смешивайте модели там, где задача — суждение, а не пропускная способность. Для механической параллельной работы однородность нормальна и проще в эксплуатации. Там, где флот существует, чтобы взвешивать конфликтующие свидетельства, идентичные априорные допущения — это режим отказа, а стандартизация на одном вендоре — кратчайший путь к нему.

Измеряйте поляризацию, а не только точность. Логируйте динамику согласия: как быстро формируется консенсус, сколько различимых кластеров ответов появляется до него, исчезает ли несогласие раньше по мере масштабирования. Флот, который сходится быстрее по мере роста, показывает вам тревожный сигнал, а не улучшение.

Одно решение в этом квартале

Возьмите самый ответственный агентный процесс — тот, чей результат уходит клиенту, регулятору или в P&L. Прогоните его при нынешнем размере флота, затем при половинном. Если точность держится, вы нашли свободную маржу и рабочий потолок. Если падает — у вас есть доказательство в пользу уже выбранного размера, а это больше, чем способно предъявить большинство дорожных карт.

Вопрос, который финансирует расширение флота, — сколько мы можем запустить. Вопрос, который определяет, работает ли это, — сколько из них должны разговаривать друг с другом. Ответ в исследовании есть только у одного из них, и он меньше, чем подразумевает слайд вашего вендора.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.