Scovai Scovai
Hiring 2026-10-09 1 min read

O seu entrevistador de IA não deteta exageros — e assim que mostra uma pontuação, os seus recrutadores também deixam de os detetar

DSL

Dr. Sarah Liu

O seu entrevistador de IA não deteta exageros — e assim que mostra uma pontuação, os seus recrutadores também deixam de os detetar

Sessenta e três por cento dos candidatos ativos já fizeram uma entrevista com IA — 13 pontos percentuais acima de há seis meses. Setenta por cento nunca foram informados com clareza de que uma IA os iria avaliar, e 21 por cento só descobriram depois de a entrevista começar (Greenhouse, 2026).

Estes dois números descrevem a maioria dos funis de seleção do mid-market. Um novo estudo publicado na Information Systems Research explica o que o segundo lhe custa.

Os candidatos que não veem como estão a ser julgados exageram. A pontuação da IA não consegue detetá-lo. E o revisor humano que acrescentou como salvaguarda olha para a pontuação e deixa de usar o seu próprio juízo.

Não são três problemas. É um único modo de falha em três fases, e a fase intermédia é invisível a partir do seu painel.

O paradoxo da transparência, testado em oito estudos

Akshat Lakhiwal (University of Georgia), Che-Wei Liu (Arizona State), Hillol Bala (Indiana) e Hung-Yue Suen (National Taiwan Normal University) publicaram "From Opacity to Transparency: User Behavior and Downstream Effects in Algorithmic Evaluation" na Information Systems Research a 30 de julho de 2026. Oito estudos, incluindo duas experiências principais e uma replicação quase experimental de campo, todos situados em entrevistas de vídeo assíncronas de sentido único (Lakhiwal et al., Information Systems Research, 2026).

A tensão de partida é real, e é a razão pela qual a maioria dos empregadores se manteve em silêncio sobre as suas ferramentas. Revelar o que o algoritmo mede pode reduzir a ansiedade do candidato — ou pode simplesmente entregar-lhe as respostas do teste. Os autores chamam a isto o paradoxo da transparência, e depois vão medir qual dos lados vence.

Experiência I: a avaliação algorítmica, comparada com a avaliação humana, aumentou o stress e a gestão enganosa da impressão (impression management) dos entrevistados. A transparência contrariou ambos os efeitos, "alinhando-os estreitamente com a avaliação humana".

A divulgação que conseguiu isto não era um briefing técnico. Disseram aos candidatos que o sistema observaria expressões faciais, sentimento verbal e palavras-chave específicas, e que os classificaria em trabalho de equipa, competências relacionadas com a função, estilo de trabalho e personalidade. Esse grupo exibiu depois o mesmo nível de comportamento autêntico que os candidatos que acreditavam estar a ser avaliados por uma pessoa (UGA Today, 2026).

Vale a pena guardar a forma como Lakhiwal explica por que a opacidade sai pela culatra:

"Se se candidata a um emprego na empresa dos seus sonhos e a empresa dos seus sonhos o quer entrevistar usando IA, não tem realmente muita escolha. Não quer dizer não, mas também não sabe como funciona."

Os candidatos preenchem esse vazio com suposições. "Havia muito exagero", disse Lakhiwal. "Pareciam atirar tudo o que tinham para dar ao 'avaliador' aquilo que imaginavam que ele procurava."

A objeção de que os candidatos manipulariam o sistema revela-se invertida. Esconder os critérios não impediu a manipulação. Produziu-a, porque um candidato que otimiza contra uma grelha imaginária exagera em todas as direções ao mesmo tempo.

A pontuação da sua entrevista com IA não distinguia o honesto do exagerado

Esta é a parte que deveria mudar a forma como lê os seus relatórios de triagem.

O agente de IA mais usado no setor, utilizado no estudo, não penalizou os candidatos que esticavam a verdade. Classificou-os tão bem como os candidatos que descreviam honestamente as mesmas qualificações (UGA Today, 2026).

Quando avaliadores humanos viram os mesmos vídeos, conseguiram distinguir. Penalizaram em geral quem exagerava e deram as classificações mais altas aos candidatos que se comportavam de forma mais autêntica.

Portanto o juízo humano funciona. É a metade encorajadora do resultado, e sobrevive apenas até ao momento em que diz à pessoa o que a máquina pensou.

E então os humanos deixaram de olhar

A Experiência II avançou para jusante, comparando três configurações de decisão: apenas humana, aumentada por IA — decisores humanos assistidos por pontuações de IA — e totalmente automatizada.

A transparência continuou a fazer o seu trabalho do lado do candidato em todas as três. Do lado do avaliador, esgotou-se. Nas palavras dos autores, o seu efeito corretivo no desempenho da entrevista "estava limitado do lado da avaliação". Quando as pontuações de IA estavam presentes, os avaliadores ancoraram-se nelas, desvalorizando o seu próprio juízo, mesmo quando as pontuações de IA não conseguiam distinguir comportamentos honestos de enganosos (Lakhiwal et al., Information Systems Research, 2026).

Leia as configurações por ordem de frequência no mid-market. A triagem totalmente automatizada é rara e amplamente reconhecida como arriscada. A triagem apenas humana é aquilo de que está a tentar afastar-se por razões de custo. A aumentada por IA — uma pontuação e depois um revisor humano que assina — é o que quase todos efetivamente compraram, e é a configuração em que uma pessoa que conseguiria detetar o exagero deixa de o fazer de forma consistente.

A salvaguarda não é neutra. Branqueia a pontuação.

A mesma falha surgiu numa experiência de campo

Não é o resultado de um único artigo. Lane, Boussioux, Ayoubi e colegas conduziram uma experiência de campo com 228 avaliadores a analisar 48 candidaturas reais, comparando a avaliação apenas humana, uma recomendação de modelo em caixa negra, e a mesma recomendação acompanhada de uma explicação narrativa (Lane et al., HBS Working Paper 25-001).

As recomendações em caixa negra melhoraram a qualidade das decisões. As mesmas recomendações com uma explicação anexada não — ainda que produzindo uma adesão mais elevada. Os avaliadores seguiram desproporcionadamente as recomendações de rejeição, aumentando substancialmente os falsos negativos, com o efeito mais forte nos casos limite.

Duas equipas de investigação diferentes, dois domínios diferentes, um mecanismo: um resultado fluente da máquina substitui o passo de verificação humana em vez de o informar. E os falsos negativos são a única classe de erro que um funil é estruturalmente incapaz de ver. Uma má contratação manifesta-se em seis meses. Um bom candidato rejeitado nunca se manifesta.

O que os candidatos pedem não é o que o protege

Coloque agora os dados do inquérito do lado do candidato ao lado das experiências, porque a sobreposição é incómoda.

Trinta e oito por cento dos candidatos dizem querer saber que uma pessoa revê a avaliação da IA antes de qualquer decisão. Trinta e nove por cento querem uma explicação clara do que a IA está a medir (Greenhouse, 2026).

O segundo pedido é o que tem provas por trás. A transparência restabeleceu de forma mensurável o comportamento autêntico.

O primeiro pedido — revisão humana da avaliação da IA — descreve, quase exatamente, a configuração aumentada por IA em que a pessoa se submete à máquina. É a salvaguarda que os candidatos querem, a salvaguarda que o seu fornecedor lhe venderá de bom grado, e a salvaguarda que a experiência considerou insuficiente. Não porque a revisão humana não tenha valor, mas porque a ordem importa: revisar uma avaliação é uma tarefa cognitiva diferente de avaliar uma gravação.

Entretanto, 38 por cento dos candidatos já abandonaram um processo de seleção por incluir uma entrevista com IA, e o maior fator isolado é um vídeo pré-gravado pontuado por IA sem qualquer pessoa presente (33 por cento). Está a perder candidatos reais por causa de uma configuração que, além disso, não funciona.

A objeção honesta

Quatro limites, enunciados com clareza.

Aqui não há dimensões de efeito, deliberadamente. O texto integral está atrás de uma barreira de pagamento, e tanto o resumo publicado como o comunicado de imprensa reportam direções, não magnitudes — "um aumento considerável", "centenas de candidatos online". Quem lhe citar uma percentagem deste estudo está a inventá-la. O que está estabelecido é a direção e a ordem dos efeitos; trate a dimensão como desconhecida.

Um agente, um fornecedor, um momento. A falha de pontuação foi observada no agente específico, o mais usado no setor, que os investigadores utilizaram. Outra ferramenta poderá discriminar melhor o engano. Nenhuma anuncia hoje ser capaz disso, o que é em si informativo, mas não generalize uma capacidade a partir de um único sistema.

A investigação anterior apoia a objeção da manipulação. Lakhiwal reconhece-o diretamente: existem trabalhos que mostram que dizer aos candidatos como são avaliados permite-lhes manipular a avaliação. Este estudo encontra o efeito líquido oposto neste contexto. Um único estudo bem concebido não arquiva uma literatura.

Lane et al. é um working paper em terreno adjacente. Avalia candidaturas de inovação, não candidatos a emprego, e o manuscrito antecede a sua circulação em 2026. Corrobora o mecanismo de ancoragem; não é uma replicação em seleção.

O que mudar antes da sua próxima ronda de triagem

Quatro movimentos. Nenhum exige uma nova rubrica orçamental, e dois são mudanças de sequência que pode fazer esta semana.

  1. Publique o que o sistema mede, em linguagem simples. Não o nome do modelo, não a arquitetura do fornecedor — Lakhiwal é explícito quanto a os candidatos não precisarem disso. Diga-lhes quais os comportamentos observados e quais os atributos classificados. A divulgação usada na condição experimental tinha quatro linhas e restabeleceu o comportamento autêntico. Também resolve o problema dos 70 por cento de não divulgação que está a expulsar candidatos do seu funil.
  2. Faça o juízo humano vir primeiro. Peça ao seu revisor para classificar a gravação antes de a pontuação de IA estar visível, e guarde ambas. É a única mudança que aborda diretamente o resultado da ancoragem, e não custa nada além da ordem da interface. Note que é uma inferência da Scovai a partir do resultado, não uma condição testada pelos investigadores — o artigo mostra a ancoragem, não a cura.
  3. Deixe de tratar "uma pessoa assinou" como um registo de auditoria. Se a pessoa viu primeiro a pontuação, a sua assinatura carrega os erros da pontuação, com o nome de alguém anexado. O que torna uma decisão de triagem defensável é um juízo humano registado de forma independente, com registo por cada contratação — a postura empresarial da Scovai, incluindo o registo de decisão humana previsto no Artigo 14 do EU AI Act, documenta uma forma de estruturar isso.
  4. Audite os falsos negativos, não a exatidão. Retire uma amostra de candidatos que a sua triagem de IA rejeitou na margem e peça a alguém para classificar as gravações às cegas. O resultado de Lane diz que os erros do lado da rejeição são onde a adesão se concentra, e as suas métricas são estruturalmente cegas a eles.

O seu dispositivo de entrevistas com IA provavelmente já tem uma pessoa dentro. A questão de investigação não é se ela está lá — é se formou um juízo antes de a máquina lhe dizer o que pensar.

Vá olhar para o ecrã do seu revisor. Se a pontuação carrega acima da gravação, não tem uma pessoa no circuito. Tem uma testemunha.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.