Scovai Scovai
Organizational Behavior 2026-08-04 1 min read

Her on yöneticiden altısı zam ve işten çıkarma kararlarında yapay zekâ kullanıyor. Yeni bir I-O kıyaslaması tam da orada en zayıf olduğunu gösteriyor.

DSL

Dr. Sarah Liu

Her on yöneticiden altısı zam ve işten çıkarma kararlarında yapay zekâ kullanıyor. Yeni bir I-O kıyaslaması tam da orada en zayıf olduğunu gösteriyor.

Çalışan geri bildirimine ilişkin bir sorunun net ve doğrulanabilir bir yanıtı olduğunda öncü yapay zekâ modelleri %64 ile %82 arasında puan alıyor. Görev; eksik, duygusal yüklü ve bağlama bağlı sinyalleri tartıp savunulabilir tek bir sonuca bağlamayı gerektirdiğinde ise en iyileri %33'e düşüyor (PYX Labs, 2026).

Bu ikinci kategorinin şirketinizde bir adı var. Adı: kimin terfi edeceğine karar vermek.

Her on yöneticiden altısı doğrudan bağlı çalışanları hakkındaki kararlarda yapay zekâyı hâlihazırda kullanıyor — zamlar, terfiler, küçülmeler, işten çıkarmalar (Resume Builder, 2025). Yetkinlik eğrisi ile kullanım eğrisi zıt yönleri gösteriyor ve ikisi arasındaki çizgiyi neredeyse hiç kimse çizmemiş durumda.

PYX-Voice kıyaslaması aslında neyi ölçtü

15 Temmuz 2026'da, Perceptyx tarafından desteklenen bir araştırma laboratuvarı olan PYX Labs, öncü yapay zekâ modellerinin çalışan geri bildirimini ne kadar iyi anladığını değerlendirmek için özel olarak kurgulanan ilk kıyaslama olan PYX-Voice'u yayımladı. OpenAI, Google, Anthropic ve xAI'den yedi lider model, 84 gerçek çalışan dinleme görevinden geçirildi ve endüstri-örgüt psikologları (I-O) ile örgütsel davranış uzmanlarının tanımladığı 208 ölçüte göre puanlandı (Perceptyx, 2026).

Asıl mesele puanlama ölçütleri. Bir modele anket yanıtlarından oluşan bir tabloyu vermek basit iştir. O verinin doğru okumasının neye benzediğini tanımlamak — yetkin bir I-O psikoloğunun neyi çıkaracağını ve neyi çıkarmayı reddedeceğini belirlemek — zor kısımdır ve hiçbir genel amaçlı yapay zekâ kıyaslamasının test etmediği kısımdır.

Öne çıkan bulgu, modellerin kötü olduğu değildi. Değiller. Görevin yorum yükü arttıkça güvenilirlik keskin ve öngörülebilir biçimde düştü (PYX Labs, 2026). Sahadaki en güçlü model genelde %76'yı aştı. Test edilen her model — istisnasız — en zayıf yetkinliği olarak sentezi kaydetti.

Bu tutarlılık, mutlak puanlardan daha önemli. Dört farklı laboratuvardan çıkan her modelin paylaştığı bir zayıflık, satın alarak çözebileceğiniz bir tedarikçi sorunu değildir. Görevin kendisine ait bir özelliktir.

Uçurum tam da riskin bulunduğu yerde

Kıyaslamanın performans profili, çoğu operasyon liderinin zaten sezgisel olarak yaptığı ama araçlarına nadiren yansıttığı bir ayrımla neredeyse kusursuz örtüşüyor.

Modeller, geri bildirimin iyi tanımlanmış temalara temiz biçimde ayrıldığı yerde en iyi performansı gösterdi: hedefler, araçlar, metrikler ve kaynaklara ilişkin performans etkinleştirme soruları. Bunlar insan kaynakları kostümü giymiş sınıflandırma problemleridir. Doğru bir yanıt vardır, yanıt doğrulanabilir ve model onu bulur.

Performans, geniş ve nüanslı temalarda bozuldu — değişim, inovasyon ve bir şeyin yolunda gitmediğini söyleyip ne olduğunu söylemeyen o belirsiz yorum kategorisi. Burada modelin aynı anda birden fazla kısmi ve çelişkili sinyali tutup bir yargı üretmesi gerekir. Puanlar %33'e kadar düştü (PYX Labs, 2026).

Kıyaslamanın bu başarısızlığa dair kendi tanımı alıntılanmayı hak ediyor, çünkü belirtiyi değil mekanizmayı adlandırıyor: "Kopma tam olarak, eksik, duygusal ya da bağlama bağlı sinyalleri tartıp bunları tek bir net sonuca bağlamak zorunda kaldıklarında gerçekleşiyor" (HR Dive, 2026).

Bu tanımı bir daha okuyun ve terfi kararının ne olduğunu sorun. Eksik bilgidir, duygusal ağırlık taşır, güçlü biçimde bağlama bağlıdır ve tek bir net sonuca bağlanır. Kıyaslama performans yönetimini test etmedi. Performans yönetiminin bizzat kendisinden oluştuğu bilişsel işlemi test etti.

Bir yargı görevinde %33, biraz daha zayıf bir asistan demek değildir. Kendinden emin bir sesle atılan yazı turadır.

Üstelik hata biçimi puanın ima ettiğinden daha kötü, çünkü çıktı her iki durumda da aynı görünüyor. Çalışan geri bildirimini kötü sentezleyen bir model hata döndürmez, düşük güven işareti de vermez. Ekip moraline dair akıcı, iyi yapılandırılmış, tamamen makul bir paragraf döndürür. İnceleyen yöneticinin, %82'lik durumu %33'lük durumdan ayırt edecek hiçbir sinyali yoktur. PYX Labs ayrıca, modellerin uydurma istatistiksel çıktılar ürettiği ya da temeldeki veri kümesinin kısıtlarına sadık kalmadığı ender ama anlamlı örnekler kaydetti — özette yer alan ama veride hiç bulunmayan bir rakam (HR Dive, 2026).

Akıcılık kalibrasyon değildir. Muhakeme bozulurken sunum katmanında hiçbir şey bozulmaz.

Yapay zekâ destekli insan kararları zaten nerede alınıyor

Şimdi bu yetkinlik profilini yöneticilerin gerçek davranışının yanına koyun.

Resume Builder, Haziran 2025 sonunda doğrudan bağlı çalışanı olan 1.342 ABD'li yöneticiyle anket yaptı. Yüzde altmışı, çalışanları hakkındaki kararlarda yapay zekâ araçları kullanıyor. Kullananlar arasında: %78'i zamları belirlemek için, %77'si terfiler için, %66'sı küçülmeler için ve %64'ü işten çıkarmalar için kullanıyor (Resume Builder, 2025).

Aynı anketten üç rakam daha, yönetişim sorununu tam olarak tanımlıyor.

Her beş yöneticiden birden fazlası, nihai kararı hiçbir insan müdahalesi olmadan sık sık yapay zekâya bıraktığını söylüyor. İnsan yönetiminde yapay zekâ kullanan yöneticilerin üçte ikisi bu konuda hiçbir resmî eğitim almamış. Ve yalnızca %32'si bu araçların etik kullanımına dair herhangi bir resmî eğitim aldığını belirtiyor (HR Dive, 2025).

Risk kullanımda değil, güvende

Ekiplerini yönetmede yapay zekâdan yararlanan yöneticilerin onda yedisinden fazlası, teknolojinin çalışanlar hakkında adil ve önyargısız kararlar verdiğine güvendiğini ifade etti (HR Dive, 2025).

Yüzde yetmişin üzerinde güven. Yorum ucunda yüzde otuz üç yetkinlik. Bu açık, riskin tamamıdır ve daha iyi modellerle kapanmaz — daha iyi kapsam belirlemeyle kapanır.

Bunun ne olmadığına dikkat edin. Bu, yöneticilerin pervasız olduğu ya da yapay zekânın performans yönetiminde yeri olmadığı yönünde bir sav değil. 400 açık uçlu anket yanıtında tema çıkarımını devreden yöneticiler doğru karar veriyor; o, %82'lik görevdir ve elle yapmak kıdemli birinin haftasını çöpe atmaktır. Sorun şu ki aynı arayüz, aynı komut kutusu ve aynı kurumsal izin her iki görevi de kapsıyor — ve bunlardan yalnızca biri güvenli.

Bunu fazla okumamak için gerekçeler

Üç çekince, açıkça söylenmiş; çünkü her iki kaynağı da ıskontolama refleksi kısmen hak edilmiş durumda.

PYX Labs, çalışan dinleme teknolojisi satan Perceptyx tarafından destekleniyor. Çalışan geri bildirimini yorumlamanın göründüğünden zor olduğu — ve I-O uzmanlığı gerektirdiği — sonucuna varan bir kıyaslama, I-O uzmanlığı satan bir şirket için ticari olarak elverişlidir. Bunu not edin, sonra da kıyaslamanın yöntemi, görev sayısı ve puanlama ölçütlerinin açıklanmış olduğu ve sonuçların — modellerin iyi performans gösterdiği yerler dahil — eksiksiz yayımlandığı gerçeğiyle tartın.

Resume Builder bir özgeçmiş hizmetleri şirketi ve çalışması kişinin kendi beyanına dayalı bir çevrimiçi anket. "Yöneticilerin yüzde altmışı insan kararlarında yapay zekâ kullanıyor" ifadesi, evet demenin hiçbir bedeli olmadığı bir ankette yöneticilerin ne yaptıklarını söylediklerini ölçer. Yönü sağlam, ondalıkları gevşek kabul edin.

Ayrıca PYX-Voice tek bir kıyaslama; haftalar önce yayımlandı ve henüz bağımsız bir tekrarlamadan geçmedi. Tek bir kıyaslama kanıttır, ispat değil.

Üç çekicenin de ardından ayakta kalan şey, bulgunun biçimidir: yorum yükü arttıkça yetkinlik düşüyor, laboratuvarlar arasında tutarlı biçimde; kullanım ise tam olarak yorum yükünün zirve yaptığı yerde en yüksek. Bu tersliği hiçbir ticari çıkar imal etmedi. Sponsor yanlılığı ile anket yanlılığının aynı yönü göstermesi için epey tuhaf bir şans gerekirdi.

Bunun 50–500 çalışanlı bir şirkette anlamı

Kurumsal ölçekte bu sorunu süreç emer. Bir ücret komitesi, bir kalibrasyon oturumu, aynı geri bildirimi bağımsız olarak okuyan bir HR iş ortağı ve bir işten çıkarma kararına nasıl varıldığını soracak bir hukuk fonksiyonu vardır.

200 kişide ise bir yönetici, bir tablo ve bir teslim tarihi vardır.

Bu, orta ölçek operasyonlarına yönelik bir eleştiri değil; bu bulguyu burada 20.000 kişilik bir şirkete kıyasla daha acil kılan yapısal gerçekliktir. Orta ölçeğin yapay zekâya erişimi aynı, inceleme katmanı daha ince ve haksız fesih davasına toleransı belirgin biçimde düşüktür. Araç geldi; hatalarını yakalayacak kalibrasyon süreci gelmedi.

Adlandırmaya değer bir birikimli etki de var. Nüanslı geri bildirimi eksik okuyan bir model rastgele yanılmaz. Sistematik olarak okunabilir olanı anlamlı olana yeğler: açık yazılmış şikâyeti çekingen olana, kendini iyi ifade eden çalışanı suskun olana, anahtar kelimeli temayı kelimesiz olana. Bunu iki terfi döngüsü boyunca sessizce çalıştırın; bir hata yapmış olmazsınız. Belgelenmiş bir iziyle birlikte bir önyargı kurmuş olursunuz.

Çizgiyi bu çeyrekte çekin

İşi araca göre değil, doğrulanabilirliğe göre ayırın

Kullanılabilir sınır "İK için yapay zekâ, evet mi hayır mı" değildir. Şudur: çıktı, kaynağa karşı bir dakikadan kısa sürede kontrol edilebiliyor mu? 300 yorumu temalara kümelemek — kontrol edilebilir, devredin. İki adayı tek bir terfi kontenjanı için geri bildirimlerine göre sıralamak — kontrol edilemez, insanda kalsın. Bu testi yazıya dökün ve yönetici rehberine koyun; çünkü şu anda bu araçları kullanan yöneticilerinizin üçte ikisi hiçbir resmî eğitim almamış durumda (Resume Builder, 2025).

Yapay zekânın kapatamayacağı dört kararı adlandırın

Zamlar, terfiler, küçülmeler, işten çıkarmalar. Her biri için, kanıt olarak bir yapay zekâ özetini göstermeyen, belgelenmiş bir insan gerekçesi şart koşun. Bunun maliyeti yoktur ve bugün modelin denetimsiz karar vermesine izin veren o beşte birlik kesime doğrudan yanıt verir.

Bir döngüyü geriye doğru denetleyin

Son performans ya da ücret döngüsünü ele alın. Her yöneticiye tek bir soru sorun: yapay zekâ buna nerede dokundu ve siz neyi kontrol ettiniz? İhlal aramıyorsunuz. Bunun zaten nerede gerçekleştiğine dair dürüst haritayı arıyorsunuz — ki incelediğim çoğu orta ölçekli şirkette bu, yönetim ekibinin varsaydığından daha ileride.

Bu çeyrekte tek bir karar

Yöneticilerinizin son doksan günde aldığı, sonuçları en ağır insan kararını seçin ve kanıt zincirinin herhangi bir yerinde yapay zekâ tarafından üretilmiş bir özetin bulunup bulunmadığını sorun. Bulunduysa ikinci soruyu sorun: yalnızca çıktıya bakarak, o özetin %82'lik türden mi yoksa %33'lük türden mi olduğunu herhangi biri anlayabilir miydi?

Yanıt hayırsa, bir yapay zekâ sorununuz yok. Kapsamı çizilmemiş bir yetki devriniz var — ve çözüm, daha iyi bir model değil, bir politika belgesindeki tek bir satır.

Her on yöneticiden altısı o çizgiyi çoktan geçti. Neredeyse hiçbirine çizginin nerede olduğu söylenmedi.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.