Il 63 percento dei candidati attivi ha ormai sostenuto un colloquio con l'AI — 13 punti percentuali in più in sei mesi. Il 70 percento non è stato informato chiaramente che sarebbe stato valutato da un'AI, e il 21 percento lo ha scoperto solo a colloquio già iniziato (Greenhouse, 2026).
Questi due numeri descrivono la maggior parte dei funnel di selezione del mid-market. Un nuovo studio pubblicato su Information Systems Research spiega quanto ti costa il secondo.
I candidati che non vedono come vengono giudicati esagerano. Il punteggio dell'AI non è in grado di accorgersene. E il revisore umano che hai inserito come salvaguardia guarda il punteggio e smette di usare il proprio giudizio.
Non sono tre problemi. È un'unica modalità di fallimento in tre fasi, e la fase centrale è invisibile dalla tua dashboard.
Il paradosso della trasparenza, testato su otto studi
Akshat Lakhiwal (University of Georgia), Che-Wei Liu (Arizona State), Hillol Bala (Indiana) e Hung-Yue Suen (National Taiwan Normal University) hanno pubblicato "From Opacity to Transparency: User Behavior and Downstream Effects in Algorithmic Evaluation" su Information Systems Research il 30 luglio 2026. Otto studi, tra cui due esperimenti principali e una replica quasi-sperimentale sul campo, tutti ambientati in colloqui video asincroni a senso unico (Lakhiwal et al., Information Systems Research, 2026).
La tensione di partenza è reale, ed è la ragione per cui la maggior parte dei datori di lavoro è rimasta in silenzio sui propri strumenti. Se dichiari cosa misura l'algoritmo puoi ridurre l'ansia del candidato — oppure gli stai semplicemente consegnando le risposte del test. Gli autori chiamano questo il paradosso della trasparenza, e poi vanno a misurare quale dei due lati prevale.
Esperimento I: la valutazione algoritmica, confrontata con quella umana, ha aumentato lo stress e l'impression management ingannevole degli intervistati. La trasparenza ha contrastato entrambi gli effetti, "allineandoli strettamente alla valutazione umana."
La comunicazione che ha ottenuto questo risultato non era un briefing tecnico. Ai candidati è stato detto che il sistema avrebbe osservato le espressioni facciali, il sentiment verbale e specifiche parole chiave, e che li avrebbe valutati su lavoro di squadra, competenze legate al ruolo, stile di lavoro e personalità. Quel gruppo ha poi mostrato lo stesso livello di comportamento autentico dei candidati che credevano di essere valutati da un essere umano (UGA Today, 2026).
Vale la pena conservare il modo in cui Lakhiwal spiega perché l'opacità sia controproducente:
"Se ti candidi per un lavoro nell'azienda dei tuoi sogni e l'azienda dei tuoi sogni vuole intervistarti usando l'AI, non hai davvero molta scelta. Non vuoi dire no, ma non sai nemmeno come funziona."
I candidati colmano quel vuoto tirando a indovinare. "C'erano molte esagerazioni," ha detto Lakhiwal. "Sembravano buttare dentro qualsiasi cosa per dare al 'valutatore' quello che pensavano stesse cercando."
L'obiezione secondo cui i candidati "giocherebbero il sistema" si rivela rovesciata. Nascondere i criteri non ha impedito il gaming. Lo ha prodotto, perché un candidato che ottimizza contro una griglia immaginaria esagera in tutte le direzioni contemporaneamente.
Il punteggio del colloquio AI non distingueva l'onesto dall'esagerato
Ecco la parte che dovrebbe cambiare il modo in cui leggi i tuoi report di screening.
L'agente AI più diffuso nel settore, usato nello studio, non ha penalizzato i candidati che forzavano la verità. Li ha valutati bene quanto i candidati che descrivevano onestamente le stesse qualifiche (UGA Today, 2026).
Quando i valutatori umani hanno guardato gli stessi video, sono riusciti a cogliere la differenza. In generale hanno penalizzato chi esagerava e hanno dato i voti più alti ai candidati che si comportavano in modo più autentico.
Quindi il giudizio umano funziona. È la metà incoraggiante del risultato, e sopravvive solo fino al momento in cui dici all'essere umano cosa ha pensato la macchina.
Poi gli esseri umani hanno smesso di guardare
L'Esperimento II si è spostato a valle, confrontando tre configurazioni decisionali: solo umana, AI-aumentata — decisori umani assistiti da punteggi AI — e completamente automatizzata.
La trasparenza ha continuato a fare il suo lavoro sul lato candidato in tutte e tre. Sul lato valutatore si è fermata. Nelle parole degli autori, il suo effetto correttivo sulla performance del colloquio "era vincolato sul lato della valutazione." Quando i punteggi AI erano presenti, i valutatori si sono ancorati a essi, scontando il proprio giudizio, anche se i punteggi AI non riuscivano a distinguere i comportamenti onesti da quelli ingannevoli (Lakhiwal et al., Information Systems Research, 2026).
Leggi le configurazioni in ordine di quanto sono diffuse nel mid-market. Lo screening completamente automatizzato è raro e ampiamente riconosciuto come rischioso. Lo screening solo umano è ciò da cui stai cercando di allontanarti per ragioni di costo. L'AI-aumentata — un punteggio, poi un revisore umano che firma — è ciò che quasi tutti hanno effettivamente acquistato, ed è la configurazione in cui un essere umano che sarebbe in grado di rilevare le esagerazioni smette sistematicamente di farlo.
La salvaguardia non è neutrale. Ripulisce il punteggio.
Lo stesso fallimento è emerso in un esperimento sul campo
Non è il risultato di un singolo paper. Lane, Boussioux, Ayoubi e colleghi hanno condotto un esperimento sul campo con 228 valutatori che hanno esaminato 48 candidature reali, confrontando la valutazione solo umana, una raccomandazione del modello a scatola chiusa, e la stessa raccomandazione accompagnata da una spiegazione narrativa (Lane et al., HBS Working Paper 25-001).
Le raccomandazioni a scatola chiusa hanno migliorato la qualità delle decisioni. Le stesse raccomandazioni con una spiegazione allegata no — pur producendo una compliance più alta. I valutatori hanno seguito in misura sproporzionata le raccomandazioni di rifiuto, aumentando sostanzialmente i falsi negativi, con l'effetto più forte nei casi borderline.
Due team di ricerca diversi, due domini diversi, un unico meccanismo: un output fluente della macchina sostituisce la fase di verifica umana invece di informarla. E i falsi negativi sono l'unica classe di errore che un funnel strutturalmente non può vedere. Un'assunzione sbagliata si manifesta in sei mesi. Un buon candidato scartato non si manifesta mai.
Quello che chiedono i candidati non è quello che ti protegge
Ora rimetti i dati del sondaggio lato candidato accanto agli esperimenti, perché la sovrapposizione è scomoda.
Il 38 percento dei candidati dice di voler sapere che un essere umano rivede la valutazione dell'AI prima che venga presa qualsiasi decisione. Il 39 percento vuole una spiegazione chiara di cosa stia misurando l'AI (Greenhouse, 2026).
La seconda richiesta è quella con prove a supporto. La trasparenza ha ripristinato in modo misurabile il comportamento autentico.
La prima richiesta — revisione umana della valutazione dell'AI — descrive, quasi esattamente, la configurazione AI-aumentata in cui l'essere umano si rimette alla macchina. È la salvaguardia che i candidati vogliono, la salvaguardia che il tuo fornitore ti venderà volentieri, e la salvaguardia che l'esperimento ha trovato carente. Non perché la revisione umana sia inutile, ma perché l'ordine conta: rivedere una valutazione è un compito cognitivo diverso dal valutare una registrazione.
Nel frattempo il 38 percento dei candidati ha già abbandonato un processo di selezione perché includeva un colloquio con l'AI, e il singolo fattore principale è un video pre-registrato valutato dall'AI senza alcun essere umano presente (33 percento). Stai perdendo candidati reali a causa di una configurazione che inoltre non funziona.
Il contro-argomento onesto
Quattro limiti, dichiarati chiaramente.
Nessuna dimensione dell'effetto, deliberatamente. Il testo completo è dietro un paywall e l'abstract pubblicato e il comunicato stampa riportano direzioni, non magnitudini — "un aumento considerevole," "centinaia di candidati online." Chiunque ti citi una percentuale da questo studio la sta inventando. Ciò che è stabilito è la direzione e l'ordine degli effetti; considera la dimensione come ignota.
Un solo agente di un solo fornitore, un solo momento storico. Il fallimento nel punteggio è stato osservato nello specifico agente più diffuso nel settore usato dai ricercatori. Uno strumento diverso potrebbe discriminare meglio l'inganno. Nessuno di essi oggi dichiara di saperlo fare, il che è già informativo, ma non generalizzare una capacità a partire da un singolo sistema.
La ricerca precedente supporta l'obiezione sul gaming. Lakhiwal lo riconosce direttamente: esistono lavori che mostrano che dire ai candidati come vengono valutati permette loro di manipolare la valutazione. Questo studio trova l'effetto netto opposto in questo contesto. Un singolo studio ben progettato non archivia una letteratura.
Lane et al. è un working paper su un terreno adiacente. Valuta candidature di innovazione, non candidati a un lavoro, e il manoscritto precede la sua circolazione nel 2026. Corrobora il meccanismo dell'ancoraggio; non è una replica nel contesto della selezione.
Cosa cambiare prima del tuo prossimo ciclo di screening
Quattro mosse. Nessuna richiede una nuova voce di budget, e due sono cambi di sequenza che puoi fare questa settimana.
- Pubblica cosa misura il sistema, in linguaggio semplice. Non il nome del modello, non l'architettura del fornitore — Lakhiwal è esplicito sul fatto che i candidati non ne hanno bisogno. Di' loro quali comportamenti vengono osservati e quali attributi vengono valutati. La comunicazione usata nella condizione sperimentale era lunga quattro righe e ha ripristinato il comportamento autentico. Risolvi anche il problema del 70 percento di mancata informazione che sta spingendo i candidati fuori dal tuo funnel.
- Fai venire prima la valutazione umana. Fai in modo che il tuo revisore valuti la registrazione prima che il punteggio AI sia visibile, e conserva entrambi. È l'unico cambiamento che affronta direttamente il risultato sull'ancoraggio, e non costa nulla se non l'ordine dell'interfaccia. Nota che è un'inferenza di Scovai dal risultato, non una condizione testata dai ricercatori — il paper mostra l'ancoraggio, non la cura.
- Smetti di considerare "un essere umano ha firmato" come una traccia di audit. Se l'essere umano ha visto prima il punteggio, la sua firma porta con sé gli errori del punteggio, con il nome di una persona attaccato. Ciò che rende difendibile una decisione di screening è un giudizio umano registrato in modo indipendente, tracciato per ogni assunzione — la postura enterprise di Scovai, incluso il log della decisione umana previsto dall'Articolo 14 dell'EU AI Act, documenta un modo in cui questo viene strutturato.
- Fai audit sui falsi negativi, non sull'accuratezza. Prendi un campione di candidati che il tuo screening AI ha scartato al margine e fai valutare le registrazioni alla cieca da qualcuno. Il risultato di Lane dice che gli errori sul lato rifiuto sono dove si concentra la compliance, e le tue metriche sono strutturalmente cieche a essi.
Il tuo stack di colloqui AI probabilmente ha già un essere umano dentro. La domanda di ricerca non è se ci sia — è se abbia formato un giudizio prima che la macchina gli dicesse cosa pensare.
Vai a guardare lo schermo del tuo revisore. Se il punteggio si carica sopra la registrazione, non hai un essere umano nel loop. Hai un testimone.