Soixante-trois pour cent des candidats actifs ont désormais passé un entretien avec l'IA — soit 13 points de pourcentage de plus en six mois. Soixante-dix pour cent n'ont jamais été clairement informés qu'une IA les évaluerait, et 21 pour cent ne l'ont découvert qu'une fois l'entretien commencé (Greenhouse, 2026).
Ces deux chiffres décrivent la plupart des tunnels de recrutement du mid-market. Une nouvelle étude publiée dans Information Systems Research explique ce que le second vous coûte.
Les candidats qui ne voient pas comment ils sont jugés embellissent. Le score de l'IA est incapable de s'en apercevoir. Et l'évaluateur humain que vous avez ajouté comme garde-fou regarde le score et cesse d'utiliser son propre jugement.
Ce ne sont pas trois problèmes. C'est un seul mode de défaillance en trois étapes, et l'étape centrale est invisible depuis votre tableau de bord.
Le paradoxe de la transparence, testé sur huit études
Akshat Lakhiwal (University of Georgia), Che-Wei Liu (Arizona State), Hillol Bala (Indiana) et Hung-Yue Suen (National Taiwan Normal University) ont publié "From Opacity to Transparency: User Behavior and Downstream Effects in Algorithmic Evaluation" dans Information Systems Research le 30 juillet 2026. Huit études, dont deux expériences principales et une réplication quasi expérimentale sur le terrain, toutes situées dans des entretiens vidéo asynchrones à sens unique (Lakhiwal et al., Information Systems Research, 2026).
La tension de départ est réelle, et c'est la raison pour laquelle la plupart des employeurs sont restés discrets sur leurs outils. Révélez ce que mesure l'algorithme et vous réduirez peut-être l'anxiété du candidat — ou vous lui livrerez simplement les réponses du test. Les auteurs appellent cela le paradoxe de la transparence, puis vont mesurer lequel des deux effets l'emporte.
Expérience I : l'évaluation algorithmique, comparée à l'évaluation humaine, a augmenté le stress et la gestion trompeuse de l'impression (impression management) des candidats. La transparence a contré les deux effets, « les alignant étroitement sur l'évaluation humaine ».
La divulgation qui a produit ce résultat n'était pas un briefing technique. On a dit aux candidats que le système observerait les expressions faciales, le sentiment verbal et des mots-clés spécifiques, et qu'il les noterait sur le travail d'équipe, les compétences liées au poste, le style de travail et la personnalité. Ce groupe a ensuite affiché le même niveau de comportement authentique que les candidats qui croyaient être évalués par un humain (UGA Today, 2026).
La manière dont Lakhiwal explique pourquoi l'opacité se retourne contre l'employeur mérite d'être retenue :
« Si vous postulez dans l'entreprise de vos rêves et que l'entreprise de vos rêves veut vous interviewer avec une IA, vous n'avez pas vraiment le choix. Vous ne voulez pas dire non, mais vous ne savez pas non plus comment cela fonctionne. »
Les candidats comblent ce vide par des suppositions. « Il y avait beaucoup d'embellissement », dit Lakhiwal. « Ils semblaient tout jeter dans la balance pour donner à l'"évaluateur" ce qu'ils imaginaient qu'il cherchait. »
L'objection du contournement se révèle inversée. Dissimuler les critères n'a pas empêché le contournement. Elle l'a produit, car un candidat qui optimise contre une grille imaginaire surcompense dans toutes les directions à la fois.
Le score de votre entretien IA ne distinguait pas l'honnête de l'embelli
Voici la partie qui devrait changer votre lecture de vos rapports de présélection.
L'agent IA le plus répandu du secteur, utilisé dans l'étude, n'a pas pénalisé les candidats qui arrangeaient la vérité. Il les a notés aussi bien que les candidats qui décrivaient honnêtement les mêmes qualifications (UGA Today, 2026).
Quand des évaluateurs humains ont visionné les mêmes vidéos, ils ont su faire la différence. Ils ont globalement pénalisé ceux qui embellissaient et attribué leurs meilleures notes aux candidats dont le comportement était le plus authentique.
Le jugement humain fonctionne donc. C'est la moitié encourageante du résultat, et elle ne survit que jusqu'au moment où vous dites à l'humain ce que la machine a pensé.
Puis les humains ont arrêté de regarder
L'Expérience II s'est déplacée en aval, comparant trois configurations de décision : humaine seule, augmentée par l'IA — des décideurs humains assistés par des scores IA — et entièrement automatisée.
La transparence a continué de faire son travail côté candidat dans les trois cas. Côté évaluateur, elle s'est arrêtée. Selon les auteurs, son effet correctif sur la performance en entretien « était contraint du côté de l'évaluation ». Lorsque les scores IA étaient présents, les évaluateurs s'y sont ancrés, dévaluant leur propre jugement, alors même que les scores IA ne parvenaient pas à distinguer les comportements honnêtes des comportements trompeurs (Lakhiwal et al., Information Systems Research, 2026).
Lisez ces configurations dans l'ordre de leur fréquence réelle dans le mid-market. La présélection entièrement automatisée est rare et largement reconnue comme risquée. La présélection purement humaine est ce dont vous essayez de vous éloigner pour des raisons de coût. L'augmentée par l'IA — un score, puis un évaluateur humain qui valide — est ce que presque tout le monde a réellement acheté, et c'est la configuration dans laquelle un humain qui saurait détecter l'embellissement cesse systématiquement de le faire.
Le garde-fou n'est pas neutre. Il blanchit le score.
La même défaillance est apparue dans une expérience de terrain
Ce n'est pas le résultat d'un seul article. Lane, Boussioux, Ayoubi et leurs collègues ont mené une expérience de terrain avec 228 évaluateurs examinant 48 dossiers réels, comparant l'évaluation purement humaine, une recommandation de modèle en boîte noire, et la même recommandation accompagnée d'une explication narrative (Lane et al., HBS Working Paper 25-001).
Les recommandations en boîte noire ont amélioré la qualité des décisions. Les mêmes recommandations assorties d'une explication, non — tout en produisant une conformité plus élevée. Les évaluateurs ont suivi de façon disproportionnée les recommandations de rejet, augmentant sensiblement les faux négatifs, l'effet étant le plus fort dans les cas limites.
Deux équipes de recherche différentes, deux domaines différents, un seul mécanisme : une sortie machine fluide se substitue à l'étape de vérification humaine au lieu de l'alimenter. Et les faux négatifs sont la seule classe d'erreur qu'un tunnel est structurellement incapable de voir. Un mauvais recrutement se manifeste en six mois. Un bon candidat rejeté ne se manifeste jamais.
Ce que demandent les candidats n'est pas ce qui vous protège
Replacez maintenant les données d'enquête côté candidat à côté des expériences, car le recoupement est inconfortable.
Trente-huit pour cent des candidats disent vouloir savoir qu'un humain examine l'évaluation de l'IA avant toute décision. Trente-neuf pour cent veulent une explication claire de ce que l'IA mesure (Greenhouse, 2026).
La seconde demande est celle qui est étayée par des preuves. La transparence a rétabli de manière mesurable le comportement authentique.
La première demande — un examen humain de l'évaluation de l'IA — décrit, presque exactement, la configuration augmentée par l'IA dans laquelle l'humain s'en remet à la machine. C'est le garde-fou que veulent les candidats, le garde-fou que votre fournisseur vous vendra volontiers, et le garde-fou que l'expérience a trouvé défaillant. Non parce que l'examen humain est sans valeur, mais parce que l'ordre compte : examiner une évaluation est une tâche cognitive différente d'évaluer un enregistrement.
Pendant ce temps, 38 pour cent des candidats ont déjà abandonné un processus de recrutement parce qu'il comportait un entretien avec l'IA, et le principal déclencheur est une vidéo préenregistrée notée par l'IA sans aucun humain présent (33 pour cent). Vous perdez de vrais candidats à cause d'une configuration qui, de surcroît, ne fonctionne pas.
L'objection honnête
Quatre limites, énoncées clairement.
Aucune taille d'effet ici, délibérément. Le texte intégral est derrière un péage et le résumé publié comme le communiqué de presse rapportent des directions, pas des magnitudes — « une augmentation considérable », « des centaines de candidats en ligne ». Quiconque vous cite un pourcentage tiré de cette étude l'invente. Ce qui est établi, c'est la direction et l'ordre des effets ; considérez l'ampleur comme inconnue.
Un agent, un fournisseur, un instant. La défaillance de notation a été observée sur l'agent spécifique, le plus répandu du secteur, utilisé par les chercheurs. Un autre outil pourrait mieux discriminer la tromperie. Aucun ne prétend aujourd'hui en être capable, ce qui est en soi instructif, mais ne généralisez pas une capacité à partir d'un seul système.
La recherche antérieure appuie l'objection du contournement. Lakhiwal le reconnaît directement : il existe des travaux montrant que dire aux candidats comment ils sont évalués leur permet de manipuler l'évaluation. Cette étude trouve l'effet net inverse dans ce contexte. Une seule étude bien conçue ne met pas une littérature au rebut.
Lane et al. est un working paper sur un terrain adjacent. Il évalue des dossiers d'innovation, pas des candidats à l'emploi, et le manuscrit précède sa circulation en 2026. Il corrobore le mécanisme d'ancrage ; ce n'est pas une réplication en recrutement.
Ce qu'il faut changer avant votre prochain cycle de présélection
Quatre actions. Aucune ne nécessite une nouvelle ligne budgétaire, et deux sont des changements de séquence réalisables cette semaine.
- Publiez ce que le système mesure, en langage clair. Pas le nom du modèle, pas l'architecture du fournisseur — Lakhiwal est explicite : les candidats n'en ont pas besoin. Dites-leur quels comportements sont observés et quels attributs sont notés. La divulgation utilisée dans la condition expérimentale tenait en quatre lignes et a rétabli le comportement authentique. Vous réglez aussi le problème des 70 pour cent de non-divulgation qui pousse les candidats hors de votre tunnel.
- Faites passer la notation humaine en premier. Demandez à votre évaluateur de noter l'enregistrement avant que le score IA ne soit visible, et conservez les deux. C'est le seul changement qui répond directement au résultat sur l'ancrage, et il ne coûte rien d'autre que l'ordre d'affichage. Notez qu'il s'agit d'une inférence de Scovai à partir du résultat, et non d'une condition testée par les chercheurs — l'article montre l'ancrage, pas le remède.
- Cessez de considérer qu'« un humain a validé » constitue une piste d'audit. Si l'humain a vu le score d'abord, sa validation porte les erreurs du score, avec le nom d'une personne attaché. Ce qui rend une décision de présélection défendable, c'est un jugement humain enregistré de façon indépendante, journalisé pour chaque recrutement — la posture entreprise de Scovai, incluant le journal de décision humaine prévu à l'article 14 de l'EU AI Act, documente une manière de structurer cela.
- Auditez les faux négatifs, pas l'exactitude. Prélevez un échantillon de candidats que votre présélection IA a rejetés à la marge et faites noter les enregistrements en aveugle. Le résultat de Lane indique que les erreurs du côté rejet sont là où la conformité se concentre, et vos indicateurs y sont structurellement aveugles.
Votre dispositif d'entretien IA comporte probablement déjà un humain. La question de recherche n'est pas de savoir s'il est là — c'est de savoir s'il a formé un jugement avant que la machine ne lui dise quoi penser.
Allez regarder l'écran de votre évaluateur. Si le score s'affiche au-dessus de l'enregistrement, vous n'avez pas un humain dans la boucle. Vous avez un témoin.