Scovai Scovai
AI & Operations 2026-07-22 1 min read

Güven, Yetenekle Değil Doğrulanabilirlikle Belirlenir: MIT ve Microsoft'un 101 Görevlik Yeni Ajan Güven Endeksi, Orta Ölçekli Operasyonların Ters Kurduğu Dağıtım Sırasını Ortaya Koyuyor

DSL

Dr. Sarah Liu

Güven, Yetenekle Değil Doğrulanabilirlikle Belirlenir: MIT ve Microsoft'un 101 Görevlik Yeni Ajan Güven Endeksi, Orta Ölçekli Operasyonların Ters Kurduğu Dağıtım Sırasını Ortaya Koyuyor

En çok güvenilen ajan görevi ile en az güvenilen görev arasındaki fark, 100 puanlık bir ölçekte 46 puandır — ve bunun hiçbiri bir yetenek açığı değildir. 29 Haziran 2026'da yayımlanan bir raporda MIT Technology Review Insights ve Microsoft, 12 sektörden 300 teknoloji yöneticisi, ekip lideri ve katkı sağlayanı anket ederek 101 ajanik yapay zekâ görevini 0-100 güven ölçeğinde sıraladı (MIT Technology Review Insights, 2026). Otomatik rapor üretimi 83,5, standart şablon kod (boilerplate) 82,5 aldı. Felaket kurtarma testi 43'te, service mesh yapılandırması 37,5'te kaldı. Dördünü de çalıştıran modeller aynı. Onları ayıran şey, bir insanın çıktıyı temiz biçimde doğrulayıp doğrulayamayacağıdır — ve bu tek değişken, bu çeyrekte yapay zekâ ajanı dağıtım sıranızı yeniden düzenlemelidir.

Çoğu orta ölçekli dağıtım, sezgisel görünen ve sessizce yanlış olan bir vekil ölçüte göre sıralanır: en basit görünen görevleri önce dağıtmak. Endeks, operasyonel sorunun "bu görev model için ne kadar zor" değil, "sonucu ne kadar kolay doğrulayabilirim" olduğunu söylüyor. Bunlar farklı eksenlerdir ve onları karıştırmak, iyi finanse edilmiş bir dağıtımın altı ay sonra, kimsenin gözetimsiz bırakacak kadar güvenmediği ajanlarla tıkanma biçimidir.

Endeks Aslında Neyi Ölçtü

Metodoloji önemlidir; çünkü bulguyu anekdot olmaktan çıkarıp kullanılabilir kılan şey odur. Araştırma ekibi, Şubat ve Mart 2026'da, 12 sektörden ve girişimlerden yıllık geliri 10 milyar doların üzerinde olan firmalara kadar uzanan kuruluşlardan 300 uygulayıcıyı — yöneticiler, ekip liderleri ve bireysel katkı sağlayanları — anket etti (Microsoft Cloud Blog, 2026). Ardından yapay zekâ, veri ve bulut iş akışlarındaki 101 ayrı görevi 0-100 güven ölçeğinde puanladılar; puan, uygulayıcıların görevi bir ajana devretmeye ne kadar istekli olduğunu yansıtıyor.

Sonuç, yapay zekânın ne yapabileceğinin bir sıralaması değildir. Operatörlerin gözetimsiz yapılmasına rahatça izin verdiği şeyin bir sıralamasıdır — ve bu ikisi arasındaki fark, hikâyenin tamamıdır. Raporun kendi ifadesi nettir: tepede kümelenen görevler doğrulanabilirliği ve eksiksiz iş bağlamını paylaşırken, dipteki görevler her ikisinden de yoksundur (MIT Technology Review Insights, 2026). Ayırt edici değişken yetenek değildi. Doğrulanabilirlikti.

Neden "En Basit" Yanlış Sıralama Anahtarı

Tepedeki iki göreve bakalım. Otomatik rapor üretimi (83,5) ve şablon kod (82,5), önemsiz oldukları için güvenilir değildir — dağınık girdilerden tutarlı bir rapor üretmek, gerçekten zor bir modelleme problemidir. Güvenilirdirler; çünkü her birinin tek, nesnel bir puanlama sinyali vardır. Şablon kod ya testlerini geçer ve birleştirilir ya da geçmez; bir birleştirme oranı (merge rate), bir insanın saniyeler içinde denetleyebileceği temiz bir geç/kal ölçütüdür. Üretilen bir rapor, özetlediği kaynak verilerle karşılaştırılabilir. Ajanın işi okunabilir.

Şimdi dibe bakalım. Service mesh yapılandırması (37,5) ve felaket kurtarma testi (43), model onlarda daha kötü olduğu için güvenilmez değildir (Forbes, 2026). Güvenilmezdirler; çünkü ajanın doğru yaptığını size söyleyen temiz, tek bir ölçüt yoktur — ve doğru yapmak, ajanın sahip olmadığı bir iş bağlamına bağlıdır: hangi hizmetler yük taşıyor, gerçek yük devretme (failover) toleransınız nedir, hangi bağımlılıklar belgelenmemiş kurumsal örtük bilgidir. Görevi baştan zorlaştıran o bağlamı yeniden inşa etmeden çıktıyı doğrulayamazsınız. Başarısızlık biçimi yanlış bir cevap değildir; üretimde bir şey kırılana dek güvenle puanlayamayacağınız bir cevaptır.

Çoğu dağıtımın ters çevirdiği sıralama anahtarı budur. "Basit görünen" görevler ile "doğrulanabilir" görevler aynı kümeymiş gibi hissettirir. Değildirler. Bir görev tanımlanması basit ama denetlenmesi neredeyse imkânsız olabilir — birbiriyle çelişen iki veri kaynağını uzlaştırmak, bir politika istisnası taslağı hazırlamak, muğlak bir talebi triyaj etmek. Endeks, görünürdeki basitliğe göre sıralamayı bırakıp daha zor ve daha dürüst bir soruya göre sıralamaya başlamanızı söylüyor: bu ajan bittiğinde, başardığını bana söyleyen tek ölçüt nedir — ve işi yeniden yapmadan onu okuyabilir miyim?

Ölçüt, Dağıtım Sıranızın Gerçek Kapısıdır

Dağıtım sıralamasını bir ölçüt-erişilebilirliği problemi olarak yeniden çerçevelediğinizde, tüm dağıtım planı kendiliğinden yeniden düzenlenir.

Aday her iş akışı için giriş testi "bir ajan bunu yapabilir mi" değil, "buna bağlı temiz bir başarı sinyali var mı"dır. Bir birleştirme oranının, geçen ya da kalan bir uzlaştırma kontrolünün, bir şema doğrulama sonucunun veya temel gerçekle (ground truth) bir karşılaştırmanın olduğu yerde, bir ajan hafif gözetimle çalışabilir ve gerçek kaldıraç elde edersiniz. Ajanın doğru yaptığını bilmenin tek yolunun, deneyimli bir insanın durumu baştan sona yeniden incelemesi olduğu yerde, görevi otomatikleştirmiş olmazsınız — hâlâ yapılması gereken bir işin önüne bir taslak adımı eklemiş olursunuz. Yine de buna değebilir. Ama bu, temelde farklı bir ekonomik önermedir ve iki kategorinin tek olduğunu varsaymak, "verimlilik kazanımlarının" inceleme yüküne buharlaştığı yoldur.

Pratik hamle, hedef iş akışlarınızı denetlemek ve onları tam olarak bu çizgide ikiye ayırmaktır. Yerel, nesnel bir başarı ölçütü olan görevler dağıtım kuyruğunun başına geçer. Doğruluğu ajanın sahip olmadığı bir iş bağlamına bağlı olan — ve bu yüzden bir insanın kontrol etmek için tümüyle yeniden türetmesi gereken — görevler sona geçer; o doğrulanabilirliği inşa etmek için yapılan kasıtlı işin arkasına: bir ölçüt yerleştirmek, eksik bağlamı kodlamak ya da temiz bir kontrol oluşana dek görevi daraltmak. Doğrulanabilirlik bir görevin sabit bir özelliği değildir. Mühendisliğini yapabileceğiniz bir şeydir — ve onun mühendisliğini yapmak, ajanları ölçeklemenin gerçek ön koşuludur; model seçimi değil.

Hesap Verebilirlik, Sayıların Ardında Saklanan Kısıttır

Endeks ayrıca bu sıralamanın neden isteğe bağlı olmadığını da ortaya çıkarıyor. Ajanik dağıtımda kendilerini neyin kaygılandırdığı sorulduğunda katılımcılar, başlıca endişeleri olarak hesap verebilirliği (%48) ve halüsinasyonları (%47) saydı — ve %59'u, bunu geçici bir eğitim aşaması gibi ele almak yerine kalıcı insan gözetimini şimdiden planladığını söyledi (MIT Technology Review Insights, 2026). Bu üç sayıyı birlikte okuyun, mekanizma nettir. Hesap verebilirlik, bir şey ters gittiğinde adı belli bir insanın onu yakalayabilmiş olmasını gerektirir. Bu yalnızca çıktı doğrulanabilir olduğunda mümkündür. Doğrulanamaz bir görevde "insan gözetimi" bir tiyatrodur — bir kişinin, aslında kontrol edemediği bir işi onaylaması.

Yani kalıcı gözetim planlayan %59, ister böyle çerçevelemiş olsunlar ister olmasınlar, ajan iş akışlarının büyük bir kısmının endeksin düşük doğrulanabilirlik ucunda yattığını kabul ediyor. Buna dürüst yanıt daha fazla onay adımı değildir. Gözetimin gerçek iş yapabileceği yere — temiz bir ölçütü olan yüksek değerli görevlere — inecek şekilde dağıtımı sıralamak; ve gözetimin yanlışlanamaz olduğu görevleri, hesap verebilirliği anlamlı kılan ölçütü inşa edene dek geri tutmaktır. Hesap verebilirliği anan %48, daha yavaş bir yapay zekâ istemiyor. Doğrulanabilir bir yapay zekâ istiyor ve dağıtım sırası, bunun karara bağlandığı yerdir.

Önce Neyi Dağıtmalı — Neyi Geri Tutmalı

Bunların hiçbiri yavaşlamak lehine bir argüman değildir. Sıralamayı değiştirmek lehine bir argümandır. Endeksin desteklediği somut yeniden düzenleme şöyledir:

Önce dağıtın: yerel, nesnel bir başarı ölçütü olan görevler — kaynak verilere göre puanlanan rapor üretimi, test-and-merge ile puanlanan kod, şema uygunluğuna göre puanlanan veri doğrulama, temel gerçeğe göre puanlanan eşleştirme ve uzlaştırma. Bunlar 80 ve üzeri görevlerinizdir. Güveni biriktirirler; çünkü her başarı görünürdür.

Önce ölçütle donatın, sonra dağıtın: değerli ama şu an doğrulanamaz olan, bir ölçüt ekleyebileceğiniz görevler — bir kabul kontrolü tanımlamak, temel gerçekle bir karşılaştırmayı günlüğe almak, bir geç/kal sinyali oluşana dek kapsamı daraltmak. Kullanılmamış ROI'nin çoğu burada yaşar ve yalnızca görünürdeki zorluğa göre sıralarsanız görünmez kalır.

Geri tutun: doğrulamanın durumu tümüyle yeniden inşa etmek anlamına geldiği bağlam-yoğun, yargı-yoğun görevler — kendi operasyonunuzdaki felaket kurtarma ve service mesh karşılıkları. Onları önce otomatikleştirmek, endeksin ölçtüğü hesap verebilirlik kaygısını ürettiğiniz yoldur.

Çoğu dağıtımın atladığı bir hedefleme katmanı vardır. Doğrulanmamış ajan çıktısına tolerans, bir ekip içinde tek biçimli değildir — bazı roller ve davranış profilleri düşük doğrulanabilirlikli bir ajana aşırı güvenecek, bazıları ise yüksek doğrulanabilirlikli bir ajanı bile kullanmayı reddedecektir. Ajanları görev doğrulanabilirliğine göre sıralamak, sorunun yapısal yarısıdır; hangi ajan sınıfını kimin çalıştırdığını, insanların güveni gerçekte nasıl kalibre ettiğiyle eşleştirmek ise insani yarısıdır. İkisini de doğru yapmak, güveni görev görev inşa eden bir dağıtım ile ilk iki çeyreğini sürdüremeyeceği bir gözetimi imal etmekle geçiren bir dağıtım arasındaki farktır.

Bu Çeyreğin Tek Sıralaması

Buna göre hareket etmek için hiçbir şeyi yeniden mimarileştirmenize gerek yok. Bir listeyi yeniden sıralamanız gerekiyor. Mevcut ajan dağıtım sıranızı — bu çeyrekte otomatikleştirmeyi planladığınız iş akışları dizisini — alın ve her göreve sorulan tek bir soruya göre yeniden sıralayın: ajan bittiğinde, başardığını bana söyleyen tek ve temiz bir ölçüt var mı ve işi yeniden yapmadan onu okuyabilir miyim? Her "evet" yükselir. Her "hayır" düşer, o ölçütü inşa etmeye yönelik açık işin arkasına. Sonra hangi ajanların kalıcı güven kazandığını, hangilerinin ise birinin sonunda incelemeyi bıraktığı, kontrol edilemez bir çıktı kuyruğunu sessizce biriktirdiğini izleyin.

MIT–Microsoft endeksi bunu sizin için 101 görev üzerinde fiyatlandırdı: güvenle devredebileceğiniz şeyin sınırı yetenekle çizilmez. Doğrulanabilirlikle çizilir. Dağıtımınızı yanlış eksene göre sıralayın; kontrol edemediğiniz görevleri önce otomatikleştirir ve maliyeti ancak biri üretimde yanlış çıktığında keşfedersiniz. Doğru eksene göre sıralayın; dağıttığınız her ajan, bir sonrakine güvenmeyi daha kolay kılar.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.