Bir göreve ajan ekleyin, kolektif doğruluk yükselir — yaklaşık on altıya kadar. O noktadan sonra düşer; grup tek bir cevapta buluşmayı bırakır ve birbirini onaylayan kamplara bölünmeye başlar (NTT Research, 2026). Bir kapasite sınırı değil. Bir maliyet sınırı da değil. Bir koordinasyon sınırı — insan ekiplerini yöneten sınırın aynısı — ve daha fazla ajanın daha fazla çıktı demek olduğunu varsayan bir yol haritasının üstüne düşüyor.
Sayının kendisi göreve özgüdür ve sizin iş akışlarınıza taşınmaz. Taşınan şey eğrinin biçimidir; o biçim ajan filosu büyüklüğünü bir satın alma değişkeninden bir tasarım değişkenine dönüştürür: her ajan tabanlı dağıtımda, marjinal ajanın katkı değil eksiltme yaptığı bir nokta vardır.
Flag Game aslında neyi ölçtü
Deney, Harvard Center for Brain Science'ta kıdemli veri bilimci Elizabeth Pavlova ile NTT Research'ün Physics of Artificial Intelligence Lab'ini ve Harvard CBS'teki Physics of Intelligence programını yöneten Hidenori Tanaka'dan geliyor. Makale — Flag Game: Interpreting Decision Mechanisms of Bounded Social Agents — ICML 2026'daki AI4Good çalıştayında sunuldu (Pavlova & Tanaka, 2026).
Kurgu bilinçli olarak sade. Her ajan gizli bir ulusal bayrağın rastgele atanmış küçük bir parçasını görür. Hiçbir ajan bayrağı tek başına tanıyamaz. Cevap için popülasyonun iletişim kurması gerekir — ajanlar tahminlerini bir dinleyiciye iletir, gruba yayın yapar ya da görüş döndüren bir yönetici sisteme danışır. Oyun, ajanların %85'i veya daha fazlası üç ardışık turda aynı bayrakta uzlaştığında ya da adım bütçesi tükendiğinde biter (The Register, 2026).
Sonucu bir operasyon liderinin dikkatine değer kılan şey tam da bu yapı. Her ajan tabanlı iş akışının içerdiği gerilimi izole ediyor: bir ajanın özel kanıtı ile hattın geri kalanından gelen sosyal girdi. İkisini uzlaştırmak bir model yeteneği sorunu değildir. Bir iletişim yapısı sorunudur.
Yaklaşık on altı ajanın altında popülasyon, güvenli bir kolektif cevabı gerekçelendirecek kadar parça bir araya getiremez. Üstünde ise hata modu tersine döner: alt gruplar oluşur ve her biri konumunu kanıta karşı değil kendi içinde doğrular. Sistemdeki toplam bilgi artmaya devam etse bile kolektif doğruluk düşer.
Eğri neden aşağı kırılıyor
Çoğu yol haritasının taşıdığı sezgi, çok ajanlı bir sistemin zarifçe bozulacağıdır — daha fazla ajan, daha fazla gürültü, azalan getiri, sonunda bir plato. Flag Game sonucu platodan kötüdür. Bu bir düşüş ve arkasındaki mekanizma teknik değil sosyal.
"Sadece daha fazla yapay zekâ ajanı eklemek performansı zorunlu olarak iyileştirmez — tıpkı daha fazla insan işe almanın bir şirketi otomatik olarak daha etkili kılmaması gibi," dedi Tanaka yayın sırasında. "İletişim zorlaşır ve gruplar rakip kamplara bölünebilir" (NTT Research, 2026).
Bunu bir operasyon ifadesi olarak okumak rahatsız edicidir, çünkü kutuplaşmış ajan popülasyonları dışarıdan bozuk görünmez. Kendinden emin, kendi içinde tutarlı çıktı üretirler. Uzlaşı hâlâ oluşur — her kampın içinde. Kaybolan şey satın aldığınız özelliktir: bağımsız kanıtın toplanması. Keskin ama yanlış bir cevap döndüren yirmi ajanlık bir filo, belirsiz bir cevap döndüren altı ajanlık filodan çok daha pahalıdır ve bu iki durumdan yalnızca biri izleme ekranınızda görünür.
Tedarikçi teşviki ters yöne işaret ediyor
İki büyük laboratuvar da çok ajanlı mimarileri yapay zekâ değerini ölçeklemenin yolu olarak tanıttı — OpenAI "swarm" çerçevesi ve ardından Agents SDK ile, Anthropic çok ajanlı orkestrasyon ile (The Register, 2026). Bu konumlandırmanın taşıdığı ima, verimliliğin ajan sayısıyla birlikte arttığıdır. Arttığında kimin ödediğine dikkat edin.
Bu bir kötü niyet suçlaması değil; orkestrasyon gerçekten yararlı. Bu, araştırma yararlı aralığın sınırlı olduğunu söylerken ve tedarik zincirinde o sınırı sizin için bulmaya teşvikli kimse yokken, varsayılan tavsiyenin hangi yöne işaret ettiğine dair bir not.
16'dan daha önemli iki bulgu
Manşet sayı bir yıl boyunca alıntılanacak. Orta ölçekli bir operasyon ekibinin pazartesi ne yapacağını değiştiren ise iki ikincil sonuç.
Yapı ölçeği yener. Araştırmacıların çerçevesi şu: kurumsal yapay zekâ performansı yalnızca kaç ajan dağıttığınıza değil, o ajanların nasıl iletişim kurduğuna, nasıl örgütlendiğine ve insanların iş birliğini nasıl yönlendirdiğine bağlıdır (NTT Research, 2026). Onların ifadesiyle mesele daha büyük yapay zekâ organizasyonları kurmak değil — daha etkili olanları tasarlamaktır.
Model çeşitliliği bir tasarım değişkeni olarak adlandırılıyor. Araştırma, organizasyonel başarıyı ölçek, iletişim, yapı ve model çeşitliliği arasında bir denge olarak konumlandırıyor; ajanların birbirini kopyalamak yerine tamamlaması gerektiğini vurguluyor. Kamuya açık metin, karma modelli ile tek modelli ekipler arasında sayısallaştırılmış bir karşılaştırma yayımlamıyor; bu nedenle yönü ölçülmüş bir etki olarak değil yazarların tasarım rehberliği olarak ele alın — ama çoğu satın alma biriminin varsayılanı olan "tek tedarikçide standartlaşma" içgüdüsünün tam karşısına düştüğünü not edin.
Çeşitlilik noktasının bağımsız desteği neden var
Aynı yöne işaret eden ayrı bir kanıt tabanı mevcut. 19 çalışma ve 61 etki büyüklüğünü kapsayan sistematik derleme ve meta-analiz, üretken yapay zekâ ile ortak üretimin çıktıda küçük ama sağlam bir homojenleşme ürettiğini buldu: d = 0,334, yayın yanlılığıyla açıklanmıyor (de Rooij & Biskjaer, 2026). Mekanizma çıpalama: model başlangıç noktasını verir, insan geliştirir ve geliştirme kaliteyi korurken bağımsızlığı yok eder.
Bu çalışmalar yapay zekâ destekli işi desteksiz işle karşılaştırdı; tek tedarikçili organizasyonları çok tedarikçili olanlarla değil. Tedarikçi yoğunlaşmasına uzatma bir çıkarımdır, bir bulgu değil — bunu açıkça işaretliyorum. Ama iki bağımsız araştırma hattı artık aynı operasyonel ihtiyatta buluşuyor: aynı ön kabullerden beslenen bir ajan popülasyonu daha hızlı uzlaşır ve daha az şey ifade eder. Flag Game'de uzlaşma kazanma koşuludur. Sizin işinizde uzlaşma, tam da sınamaya çalıştığınız şeydir.
16 ne değildir
Biri bunu politikaya çevirmeden önce üç sınır.
Aktarılabilir bir sabit değildir. On altı, belirli bir iletişim topolojisi ve belirli bir durma kuralı olan tek bir sentetik uzlaşma görevinin zirvesidir. Bir belge çıkarma hattı, bir kod inceleme filosu ve bir müşteri triyaj sistemi farklı kanıt yapılarına sahiptir ve zirveleri başka yerde olur — belki dörtte, belki kırkta.
Ajan kalitesi hakkında bir iddia değildir. Düşüş, popülasyonun iletişiminin bir özelliğidir; herhangi bir tek ajanın muhakemesinin değil. Daha iyi modeller bunu bariz biçimde düzeltmez; daha bağımsız kanıt kaynakları düzeltebilir.
Bu bir çalıştay makalesidir, boylamsal bir kurumsal çalışma değil. AI4Good, hakemli bir ICML çalıştay kolu — güvenilir erken aşama bilim, üretim dağıtımlarında tekrarlanmış bir saha sonucu değil. Onu bir kalibrasyon tablosu gibi değil, bir mekanizmaya dair iyi kurgulanmış bir uyarı gibi ele alın.
Üçünden de sağ çıkan şey asimetridir. Ajan sayısına karşı kolektif performans yükselen bir doğru değil ters bir U ise, her ajan yol haritasının durduğu bir sayıya ihtiyacı vardır — ve neredeyse hiçbirinde yoktur.
Zaten yürüttüğünüz insan karşılaştırması
Tanaka'nın işe alım benzetmesi süs değil. Operasyon liderleri zaten bir koordinasyon tavanı yönetiyor ve sayısını zaten biliyorlar, çünkü o sayı organizasyon şemasında duruyor.
Gallup'un 2026 kontrol alanı verileri, ortalama ABD yöneticisini 12,1 doğrudan rapora yerleştiriyor; önceki yıl 10,9'du — ama medyan 2013'ten beri beş ile altıda sabit ve ortalamayı yukarı çeken şey 25'in üzerindeki ekiplerden oluşan ince bir kuyruk (Gallup, 2026). Kimse 40 raporu olan bir yöneticinin 13 raporu olandan 3 kat etkili olduğunu savunmuyor. Haklı olarak koordinasyon maliyetinin kazancı yediğini varsayıyoruz.
Ajan filoları bu muhakemeden tek bir nedenle muaf tutuldu: marjda ajanlar bedava görünüyor. Doğruluk açısından marjda bedava değiller ve Flag Game, doğruluk maliyetinin gider kaleminden önce geldiğinin ilk temiz göstergesi.
Bu arada dağıtım eğrisi beklemiyor. Microsoft'un 2026 Work Trend Index'i, Microsoft 365 ekosistemindeki aktif ajanların yıllık bazda 15 kat, büyük kurumlarda 18 kat büyüdüğünü bildiriyor (Microsoft, 2026). Filo büyüklükleri şu anda, iş akışını kim yapılandırıyorsa onun tarafından, ilan edilmiş hiçbir tavan olmadan belirleniyor.
Filoyu tasarlayın, sadece boyutlandırmayın
Ucuzluk sırasına göre dört hamle.
Görev başına filo büyüklüğüne tavan koyun ve tavanı yazın. Küresel bir politika değil — iş akışı başına, bilinçli seçilmiş, iş akışının yanına kaydedilmiş bir sayı. Değerin kendisinden çok, sahibi olan bir değerin var olması önemlidir.
Bir sonraki marjinal doları talimata harcayın, kadroya değil. Araştırmanın merkezî iddiası, insanların sistemi nasıl yapılandırıp yönlendirdiğinin kolektif performansı hareket ettirdiğidir. Mevcut bir filo için görev tanımını netleştirmek bir öğleden sonraya mal olur; on yedinci ajan bir lisansa ve muhtemelen doğruluğa mal olur.
Görev muhakeme gerektiriyorsa modelleri bilinçli karıştırın; iş hacimse gerekmez. Mekanik paralel iş için homojenlik sorun değildir ve işletmesi daha basittir. Filonun var olma nedeni çelişkili kanıtı tartmaksa, aynı ön kabuller hata modudur — ve tek tedarikçide standartlaşmak oraya giden en hızlı yoldur.
Yalnızca doğruluğu değil kutuplaşmayı da ölçün. Uzlaşma dinamiklerini kaydedin: uzlaşı ne kadar hızlı oluşuyor, öncesinde kaç ayrı cevap kümesi beliriyor, ölçek büyüdükçe muhalefet daha erken mi kayboluyor. Büyüdükçe daha hızlı yakınsayan bir filo size iyileşmeyi değil uyarı işaretini gösteriyordur.
Bu çeyrek için tek bir karar
En yüksek riskli ajan iş akışınızı alın — çıktısı bir müşteriye, bir düzenleyiciye ya da gelir tablosuna giden. Onu mevcut filo büyüklüğünde, sonra yarısında çalıştırın. Doğruluk korunuyorsa bedava marj ve işleyen bir tavan buldunuz. Düşüyorsa, zaten seçtiğiniz büyüklük için kanıtınız var — ki bu çoğu yol haritasının üretebildiğinden fazlasıdır.
Ajan genişlemesini finanse eden soru kaç tane çalıştırabiliriz. İşe yarayıp yaramadığını belirleyen soru kaç tanesi birbiriyle konuşmalı. Bu ikisinden yalnızca birinin araştırmada bir cevabı var ve o cevap, tedarikçinizin slaytının ima ettiğinden küçük.