Scovai Scovai
Hiring 2026-10-09 1 min read

Tu entrevistador de IA no detecta las exageraciones — y en cuanto muestra una puntuación, tus reclutadores tampoco las detectan

DSL

Dr. Sarah Liu

Tu entrevistador de IA no detecta las exageraciones — y en cuanto muestra una puntuación, tus reclutadores tampoco las detectan

El 63 por ciento de los candidatos activos ya ha pasado una entrevista con IA — 13 puntos porcentuales más en seis meses. Al 70 por ciento nunca se le dijo con claridad que una IA lo evaluaría, y el 21 por ciento lo descubrió solo una vez iniciada la entrevista (Greenhouse, 2026).

Esos dos números describen la mayoría de los embudos de selección del mid-market. Un nuevo estudio publicado en Information Systems Research explica lo que te cuesta el segundo.

Los candidatos que no ven cómo se les juzga exageran. La puntuación de la IA no es capaz de detectarlo. Y el revisor humano que añadiste como salvaguarda mira la puntuación y deja de usar su propio criterio.

No son tres problemas. Es un único modo de fallo en tres fases, y la fase intermedia es invisible desde tu panel de control.

La paradoja de la transparencia, puesta a prueba en ocho estudios

Akshat Lakhiwal (University of Georgia), Che-Wei Liu (Arizona State), Hillol Bala (Indiana) y Hung-Yue Suen (National Taiwan Normal University) publicaron "From Opacity to Transparency: User Behavior and Downstream Effects in Algorithmic Evaluation" en Information Systems Research el 30 de julio de 2026. Ocho estudios, entre ellos dos experimentos principales y una replicación cuasi experimental de campo, todos situados en entrevistas de vídeo asíncronas de una sola vía (Lakhiwal et al., Information Systems Research, 2026).

La tensión de partida es real, y es la razón por la que la mayoría de los empleadores han guardado silencio sobre sus herramientas. Si revelas qué mide el algoritmo puedes reducir la ansiedad del candidato — o simplemente le estás entregando las respuestas del examen. Los autores llaman a esto la paradoja de la transparencia, y luego van y miden qué lado gana.

Experimento I: la evaluación algorítmica, comparada con la humana, aumentó el estrés y la gestión engañosa de la impresión (impression management) de los entrevistados. La transparencia contrarrestó ambos efectos, "alineándolos estrechamente con la evaluación humana".

La información que logró esto no era un briefing técnico. A los candidatos se les dijo que el sistema observaría las expresiones faciales, el sentimiento verbal y palabras clave específicas, y que los puntuaría en trabajo en equipo, habilidades relacionadas con el puesto, estilo de trabajo y personalidad. Ese grupo mostró después el mismo nivel de comportamiento auténtico que los candidatos que creían ser evaluados por una persona (UGA Today, 2026).

Vale la pena retener cómo explica Lakhiwal por qué la opacidad resulta contraproducente:

"Si te postulas a un trabajo en la empresa de tus sueños y la empresa de tus sueños quiere entrevistarte usando IA, en realidad no tienes muchas opciones. No quieres decir no, pero tampoco sabes cómo funciona."

Los candidatos rellenan ese vacío con conjeturas. "Había mucha exageración", dijo Lakhiwal. "Parecían echar mano de todo para darle al 'evaluador' lo que imaginaban que estaba buscando."

La objeción de que los candidatos manipularían el sistema resulta estar invertida. Ocultar los criterios no evitó la manipulación. La produjo, porque un candidato que optimiza contra una rúbrica imaginaria se excede en todas las direcciones a la vez.

La puntuación de tu entrevista con IA no distinguía lo honesto de lo exagerado

Esta es la parte que debería cambiar cómo lees tus informes de cribado.

El agente de IA más extendido del sector, usado en el estudio, no penalizó a los candidatos que estiraban la verdad. Los puntuó igual de bien que a los candidatos que describían con honestidad las mismas cualificaciones (UGA Today, 2026).

Cuando evaluadores humanos vieron los mismos vídeos, sí supieron distinguirlo. En general penalizaron a quienes exageraban y dieron sus mejores valoraciones a los candidatos que se comportaban de forma más auténtica.

Así que el juicio humano funciona. Es la mitad alentadora del hallazgo, y sobrevive solo hasta el momento en que le dices a la persona lo que pensó la máquina.

Y entonces los humanos dejaron de mirar

El Experimento II se movió aguas abajo, comparando tres configuraciones de decisión: solo humana, aumentada por IA — decisores humanos asistidos por puntuaciones de IA — y totalmente automatizada.

La transparencia siguió haciendo su trabajo del lado del candidato en las tres. Del lado del evaluador se quedó sin recorrido. En palabras de los autores, su efecto correctivo sobre el desempeño en la entrevista "estaba restringido en el lado de la evaluación". Cuando las puntuaciones de IA estaban presentes, los evaluadores se anclaron en ellas, descontando su propio juicio, incluso cuando las puntuaciones de IA no lograban distinguir los comportamientos honestos de los engañosos (Lakhiwal et al., Information Systems Research, 2026).

Lee las configuraciones en orden de lo comunes que son en el mid-market. El cribado totalmente automatizado es raro y ampliamente reconocido como arriesgado. El cribado solo humano es aquello de lo que intentas alejarte por coste. El aumentado por IA — una puntuación y luego un revisor humano que firma — es lo que casi todo el mundo ha comprado en realidad, y es la configuración en la que una persona que sí sería capaz de detectar la exageración deja de hacerlo de forma sistemática.

La salvaguarda no es neutral. Blanquea la puntuación.

El mismo fallo apareció en un experimento de campo

No es el resultado de un solo artículo. Lane, Boussioux, Ayoubi y colegas realizaron un experimento de campo con 228 evaluadores revisando 48 candidaturas reales, comparando la evaluación solo humana, una recomendación de modelo de caja negra, y la misma recomendación envuelta en una explicación narrativa (Lane et al., HBS Working Paper 25-001).

Las recomendaciones de caja negra mejoraron la calidad de las decisiones. Las mismas recomendaciones con una explicación adjunta no — y aun así produjeron un cumplimiento mayor. Los evaluadores siguieron de forma desproporcionada las recomendaciones de rechazo, aumentando sustancialmente los falsos negativos, con el efecto más fuerte en los casos límite.

Dos equipos de investigación distintos, dos dominios distintos, un mismo mecanismo: una salida fluida de la máquina sustituye el paso de verificación humana en lugar de alimentarlo. Y los falsos negativos son la única clase de error que un embudo es estructuralmente incapaz de ver. Una mala contratación se manifiesta en seis meses. Un buen candidato rechazado no se manifiesta nunca.

Lo que piden los candidatos no es lo que te protege

Ahora pon los datos de la encuesta del lado del candidato junto a los experimentos, porque el solapamiento es incómodo.

El 38 por ciento de los candidatos dice querer saber que una persona revisa la evaluación de la IA antes de tomar cualquier decisión. El 39 por ciento quiere una explicación clara de qué está midiendo la IA (Greenhouse, 2026).

La segunda petición es la que tiene evidencia detrás. La transparencia restableció de forma medible el comportamiento auténtico.

La primera petición — revisión humana de la evaluación de la IA — describe, casi exactamente, la configuración aumentada por IA en la que la persona se remite a la máquina. Es la salvaguarda que quieren los candidatos, la salvaguarda que tu proveedor te venderá con gusto, y la salvaguarda que el experimento encontró deficiente. No porque la revisión humana carezca de valor, sino porque el orden importa: revisar una evaluación es una tarea cognitiva distinta de evaluar una grabación.

Mientras tanto, el 38 por ciento de los candidatos ya ha abandonado un proceso de selección porque incluía una entrevista con IA, y el principal desencadenante es un vídeo pregrabado puntuado por IA sin ninguna persona presente (33 por ciento). Estás perdiendo candidatos reales por una configuración que, además, no funciona.

La objeción honesta

Cuatro límites, expuestos con claridad.

Aquí no hay tamaños de efecto, deliberadamente. El texto completo está detrás de un muro de pago, y tanto el resumen publicado como el comunicado de prensa informan de direcciones, no de magnitudes — "un aumento considerable", "cientos de candidatos en línea". Quien te cite un porcentaje de este estudio se lo está inventando. Lo que está establecido es la dirección y el orden de los efectos; trata la magnitud como desconocida.

Un agente, un proveedor, un momento. El fallo de puntuación se observó en el agente concreto, el más extendido del sector, que usaron los investigadores. Otra herramienta podría discriminar mejor el engaño. Ninguna anuncia hoy que sepa hacerlo, lo cual es en sí mismo informativo, pero no generalices una capacidad a partir de un solo sistema.

La investigación previa respalda la objeción de la manipulación. Lakhiwal lo reconoce directamente: existen trabajos que muestran que decir a los candidatos cómo se les evalúa les permite manipular la evaluación. Este estudio encuentra el efecto neto contrario en este contexto. Un solo estudio bien diseñado no jubila una literatura.

Lane et al. es un working paper sobre un terreno adyacente. Evalúa candidaturas de innovación, no candidatos a un empleo, y el manuscrito es anterior a su circulación en 2026. Corrobora el mecanismo del anclaje; no es una replicación en selección de personal.

Qué cambiar antes de tu próxima ronda de cribado

Cuatro movimientos. Ninguno requiere una nueva partida presupuestaria, y dos son cambios de secuencia que puedes hacer esta semana.

  1. Publica qué mide el sistema, en lenguaje llano. No el nombre del modelo, no la arquitectura del proveedor — Lakhiwal es explícito en que los candidatos no lo necesitan. Diles qué comportamientos se observan y qué atributos se puntúan. La información usada en la condición experimental ocupaba cuatro líneas y restableció el comportamiento auténtico. También resuelves el problema del 70 por ciento de no divulgación que está expulsando candidatos de tu embudo.
  2. Haz que la valoración humana vaya primero. Que tu revisor puntúe la grabación antes de que la puntuación de IA sea visible, y guarda ambas. Es el único cambio que aborda directamente el resultado del anclaje, y no cuesta nada más que el orden de la interfaz. Ten en cuenta que es una inferencia de Scovai a partir del hallazgo, no una condición que los investigadores probaran — el artículo muestra el anclaje, no la cura.
  3. Deja de tratar "una persona lo firmó" como una pista de auditoría. Si la persona vio la puntuación primero, su firma arrastra los errores de la puntuación con el nombre de alguien adjunto. Lo que hace defendible una decisión de cribado es un juicio humano registrado de forma independiente, con traza por cada contratación — la postura empresarial de Scovai, incluido el registro de decisión humana del artículo 14 del EU AI Act, documenta una forma de estructurarlo.
  4. Audita los falsos negativos, no la exactitud. Toma una muestra de candidatos que tu cribado de IA rechazó en el margen y que alguien valore las grabaciones a ciegas. El resultado de Lane dice que los errores del lado del rechazo son donde se concentra el cumplimiento, y tus métricas son estructuralmente ciegas a ellos.

Tu dispositivo de entrevistas con IA probablemente ya tiene a una persona dentro. La pregunta de investigación no es si está ahí — es si formó un juicio antes de que la máquina le dijera qué pensar.

Ve a mirar la pantalla de tu revisor. Si la puntuación carga por encima de la grabación, no tienes una persona en el circuito. Tienes un testigo.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.