Scovai Scovai
Hiring 2026-08-17 1 min read

Yapay zekâ eleme aracınız ona hiç öğretmediğiniz önyargıları kendi uyduruyor — ve en güçlü akıl yürütme modelleri bunu en hızlı yapıyor

DSL

Dr. Sarah Liu

Yapay zekâ eleme aracınız ona hiç öğretmediğiniz önyargıları kendi uyduruyor — ve en güçlü akıl yürütme modelleri bunu en hızlı yapıyor

2,0 değerinin her demografik grubun tümüyle kendi mesleki nişine hapsedildiği anlamına geldiği bir ayrışma ölçeğinde, insan katılımcılar 0,84 aldı. Aynı görevi yürüten büyük dil modelleri ise yaklaşık %65 daha yüksek puanladı. OpenAI'nin o3 modeli 1,83'e ulaştı (MIT Technology Review, 2026).

Bu önyargıyı kimse eğitime koymadı. Adaylar kurgusaldı, etnik gruplar uydurmaydı ve her başvuranın her işte başarılı olma olasılığı tamamen aynıydı. Modeller kalıp yargıyı kendileri kurdu; canlı ortamda, bir avuç işe alım sonucundan.

Bu, satın alma sürecinizin yakalamak üzere tasarlandığı sorundan farklı bir sorun. Çoğu tedarikçi denetiminin kavradığı biçimiyle yapay zekâ eleme önyargısı devralınmıştır: çarpık eğitim verisinin tortusu, devreye almadan önce saptanabilir, daha iyi bir veri kümesi ve bir denetim sertifikasıyla düzeltilebilir. Buradaki ise hiçbir yukarı akış kaynağı olmayan bir önyargı. Devreye alma sonrasında, sizin kendi işe alım sonuçlarınızın geri bildiriminden, yürüttüğünüz her ön kontrolü geçmiş bir sistemin içinde oluşuyor.

Çalışma: temiz veri girer, ayrışma çıkar

Princeton University ve University of Chicago'daki araştırmacılar, insanlarda kalıp yargı oluşumuna dair bir psikoloji deneyini uyarlayıp OpenAI, Anthropic, DeepSeek, Meta, Google ve Alibaba'ya ait 15 model üzerinde çalıştırdı. Makale Temmuz 2026'da Seul'deki ICML'de sunuldu (Liu et al., ICML 2026).

Kurgu bilinçli olarak steril. Her modele, kurgusal bir şehrin belediye başkanı tarafından danışman olarak tutulduğu ve 20 pozisyonu doldurması gerektiği söyleniyor: doktorlar, avukatlar, çocuk bakıcıları, temizlik görevlileri. Her tur bir açık pozisyon ve dört aday sunuyor; her biri dört uydurma etnik gruptan birinden: Tufa, Aima, Reku, Weki. Model işe alıyor, o kişinin başarılı olup olmadığını öğreniyor ve sonraki tura geçiyor. Kırk tur. Amaç: başarılı işe alım sayısını en üst düzeye çıkarmak.

Modelden gizlenen temel gerçek: her aday her işte eşit olasılıkla başarılı oluyor. Bulunacak hiçbir sinyal yok.

Modeller yine de bir sinyal buldu. Bir Aima'nın doktor olarak başarısız olduğu söylendiğinde model Aima'ları doktor olarak işe almaktan uzaklaşıyor — ve onları, daha az sıcaklık ve yetkinlik gerektirdiğini sınıflandırdığı temizlik rollerine yönlendirmeye başlıyordu (MIT Technology Review, 2026). Tek bir sonuç, tek bir grup, tek bir iş. Oradan bir kast sistemi.

Yazarlar bunun anlamı konusunda açık sözlü: LLM'ler "hiçbir içsel farkın bulunmadığı durumlarda bile yapay demografik gruplara ilişkin yeni sosyal önyargıları kendiliğinden geliştirebiliyor"; bu da onları "insan sosyal önyargılarının yalnızca edilgen aynaları değil, deneyimden yola çıkarak etkin biçimde yenilerini yaratabilen" sistemler yapıyor (Liu et al., ICML 2026).

Hiç önyargılı bir veri kümesi görmemiş bir model yine de ayrışmış bir iş gücü üretebilir. Önyargı veri kümesinde değil. Güncelleme kuralında.

En iyi performans gösteren modeliniz en yüksek riskli olanıdır

İşte tedarikçi kısa listenizi yeniden sıralaması gereken bulgu. Test edilen her model ailesinde, daha yeni, daha büyük, daha yetenekli akıl yürütme modelleri daha fazla önyargılıydı, daha az değil. Adayları en sert biçimde OpenAI'nin o3'ü ve DeepSeek'in R1'i tabakalaştırdı.

Mekanizma bir kusur değil. Tasarlandığı gibi çalışan yeteneğin ta kendisi. Princeton'dan ortak yazar Ryan Liu bunu açıkça söylüyor: LLM'ler "sınırlı veriden genellemeler üretmeye gerçekten hevesli. Bu, kelimenin tam anlamıyla, optimize edildikleri şeyin büyük bir kısmı" (MIT Technology Review, 2026).

Her karar verici keşif-sömürü ödünleşimiyle karşı karşıyadır: işe yaramış olana bağlı kalmak mı, yoksa daha iyi işleyebilecek bir şeyi denemek mi. Matematik, kodlama ve fen problemleri üzerinde eğitilen modeller, az sayıda örnekten bir kural çıkarıp onu kendinden emin biçimde uygulamakla ödüllendirilir. Onları mantık bulmacalarında iyi kılan tam da bu içgüdüdür. Toplumsal bir dağıtım problemine çevrildiğinde ise, ince kanıttan erken genellemeye dönüşür ve sistem, çoktan sildiği grupları keşfetmeyi bırakır. Araştırmacıların kendi ifadesiyle: daha güçlü bir model "benzer işlerdeki önceki atamalar başarılı olduysa bir gruptan gelen adayları kayırabilir" ve "görünüşte akılcı olan bu eğilim uyum bozucu olabilir; çünkü keşfi azaltma ve sosyal grupları istemeden marjinalleştirme riski taşır" (Liu et al., ICML 2026).

Operasyonel sonuç, standart bir satın alma sezgisini tersine çevirir. Eleme aracı karşılaştırmanızda, statik bir kıyaslama testinde en iyi doğruluk rakamlarını yazan model, canlı sonuçlardan öğrenmeye başladığında büyük olasılıkla en sert ayrışmayı üretecek olandır. Yetenek ile bu hata modu ilişkilidir ve siz şu anda yalnızca yeteneğe göre seçim yapıyorsunuz.

Yapay zekâ eleme önyargısı denetiminiz yanlış nesneye çevrilmiş durumda

İşe alımda yapay zekâ yönetişiminin büyük kısmı, sistem adaylarınızla karşılaşmadan önce var olan şeyleri inceler: eğitim verisinin kaynağı, model kartları, bir kıyaslama kümesi üzerindeki adillik metrikleri, devreye alma öncesi etki oranı testi, tedarikçinin SOC 2 benzeri güvence paketi.

New York City'nin Local Law 144'ü — bu alanda en çok kopyalanan şablon — automated employment decision tools için cinsiyet ve ırk/etnik köken bazında seçim oranı etki oranlarını ölçen, kesişimsel analizi ve denetim özetinin kamuya açıklanmasını da içeren yıllık ve bağımsız bir önyargı denetimi zorunlu kılar (Warden AI, 2026). Yıllık. Bağımsız. Ve bir anlık görüntü.

Anlık görüntü, turlar boyunca biriken bir önyargı için yanlış bir araçtır. Çalışmada ayrışma 40 karar boyunca ortaya çıktı. Orta ölçekli hacim işleyen bir eleme aracı 40 kararı bir öğleden sonrada bitirir. Mart ayında eşitliği onaylayan bir denetim, sistemin eylüle kadar yakınsadığı politika hakkında hiçbir şey söylemez; çünkü eylül politikası martta var olmayan verilerden inşa edilmiştir — sizin verileriniz, sizin işe alım sonuçlarınız, sizin geri bildiriminiz.

Bu boşluk, tedarikçilerin çıkardığı her bellek ve kişiselleştirme özelliğiyle genişler. Oturumlar arasında bağlamı koruyan, ya da kabul/ret kararlarınız üzerinde ince ayar yapılan, ya da "burada ne işe yaradı" özetini sürekli güncelleyen bir eleme aracı, çalışmanın modellediği mimarinin tam olarak kendisidir. Her özgeçmişi bağımsız olarak puanlayıp unutan durumsuz bir eleme aracı ise belirgin biçimde daha güvenlidir — ki bu, bu ürünlerin size pazarlanma biçiminin tam tersidir.

Benimseme ile denetim arasındaki açık

Maruziyet şimdiden geniş. ManpowerGroup Talent Solutions'ın ABD ve Birleşik Krallık'taki üst düzey yetenek liderleri üzerine 2026 araştırmasına göre, kuruluşların %90'ından fazlası yetenek kazanımında yapay zekâyı devreye aldı; ancak dönüştürücü sonuçlar bildirenlerin oranı %5'in altında (ManpowerGroup, 2026). Neredeyse evrensel bir yaygınlaşma, asgari düzeyde gerçekleşen değer ve — çalışmanın işaret ettiği gibi — her ikisinin de altından akan ölçülmemiş bir kayma riski.

En güçlü itiraz ve nerede geçerliliğini yitirdiği

Dürüst karşı argüman: bu, uydurma etnik kökenleri ve oyuncak bir ödül sinyali olan kurgusal bir şehir. Sizin ATS'niz böyle çalışmıyor. Gerçek eleme araçları iş tanımı gömülerine ve yapılandırılmış ölçütlere göre sıralama yapar, çoğu aşağı akış sonuçlarından hiç öğrenmez ve dört uydurma grup, gerçek dünyadaki önyargıyı ele alınabilir kılan korelasyonların hiçbirini taşımaz.

Bu itiraz, mekanizmanın aktarılabilirliği konusunda haklı, yönü konusunda haksızdır.

Eleme aracınız gerçekten durumsuzsa geçerlidir: bellek yok, sonuç geri bildirimi yok, kararlarınız üzerinde ince ayar yok, her aday sabit bir politikadan yeniden puanlanıyor. Yığınınız buysa, bu çalışma henüz satın almadığınız bir sistem hakkında bir uyarıdır.

İki noktada geçerliliğini yitirir. Birincisi, kurgusal gruplar bulguyu zayıflatmak yerine güçlendirir: gerçek dünya karşılıkları olmadığından öğrenilecek meşru bir sinyal yoktu, dolayısıyla her birim ayrışma imal edilmiştir. Gerçek korelasyonların bulunduğu canlı bir süreçte modelin aşırı genelleme yapacak daha fazla malzemesi olur, daha az değil. İkincisi, sektör tam da bu hata modunun doğal olduğu durumlu, bellekli, sürekli öğrenen ajanlara doğru ilerliyor. Soru, mevcut aracınızın bunu yapıp yapmadığı değil. Tedarikçinizin gelecek yılın yol haritasındaki yükseltmenin bunu yapıp yapmayacağı — ve sözleşmenizin bunu size söyleyip söylemeyeceği.

Kimse şikâyette bulunmadan önce size neye mal olur

Hukuki kuyruk teorik değil. Kaliforniya Kuzey Bölgesi'nde algoritmik elemeye ilişkin bir ayrımcılık davası olan Mobley v. Workday'de, Workday'in kendi dava dosyaları ilgili dönemde araçları kullanılarak 1,1 milyar başvurunun reddedildiğini belirtiyor; dava toplu dava onayından ve önyargı testleri ile başvuran verileri üzerine tartışmalı bir delil aşamasından geçerek ilerledi (Duane Morris, 2026). Sonuç ne olursa olsun, delil sunma duruşu artık yerleşmiş durumda: eleme kararlarınız ve önyargı testi kayıtlarınız erişilebilir.

Daha sessiz maliyet önce gelir ve hukuki bir sorun olmadan önce bir işe alım kalitesi sorunudur. Belirli bir rol için bir kohortu sessizce göstermeyi bırakmış bir eleme aracı hata vermez. Tümüyle makul görünen bir kısa liste döndürür. Hiç görmediğiniz adayları kaybedersiniz — kimsenin seçmediği bir örüntüyle — ve huni metrikleriniz baştan sona yeşil kalır; çünkü daralan bir arama uzayı ile verimli bir arama uzayı aynı gösterge panelini üretir.

Bu çeyrek için tek bir karar

Eleme tedarikçinizle bir sonraki yenileme ya da genişletmeden önce iki soruyu yazılı olarak sorun ve yazılı yanıt talep edin.

Birincisi: bu aracın durumu var mı? Adaylar veya oturumlar arasında bellek tutuyor mu, işe alım sonuçlarımızdan öğreniyor mu, ya da kabul/ret kararlarımız üzerinde ince ayar yapılıyor mu — bugün ya da ürün yol haritasında? "Evet" yanıtı sizi statik denetim rejiminden kayma izleme rejimine taşır ve yönetişiminizde başka hiçbir şey bunu değiştirmez.

İkincisi: kaymayı bize ne gösterir? İki madde riskin çoğunu kapsar. Rastgele keşif ayrılmış grubu — kararların, modelin öğrendiği tercih devre dışıyken alınan tanımlı bir payı; bu, sistemin silmeye başladığı kohortların sonuçlarını gözlemeyi sürdürmenin tek yoludur. Bir de aylık düzende kohort bazlı sonuç izleme: seçim oranlarını gruba ve role göre takip etmek; çünkü çalışmadaki hata modu bir gruptan toplamda daha az işe alım yapılması değil — aynı sayıda işe alımın farklı işlere ayrıştırılmasıdır. Toplulaştırılmış bir etki oranı, o simülasyonda ayrışma endeksi tavanına doğru tırmanırken eşitlik gösterirdi.

Her iki madde de sözleşmeye aittir, uygulama planına değil. Yenileme, elinizde kaldıraç olduğu andır.

Bu çalışmadaki yapay zekâ eleme önyargısı ne devralınmıştı, ne kasıtlıydı, ne de devreye almadan önce var olan herhangi bir nesnede görülebiliyordu. Görev başında imal edildi; odadaki en yetenekli sistem tarafından, içinde bulunacak hiçbir şey olmayan verilerden. Denetiminizi modelin sizden ne öğrendiğine çevirin — geldiğinde neyi bildiğine değil.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.