Scovai Scovai
Hiring 2026-10-09 1 min read

Ihr KI-Interviewer erkennt Übertreibungen nicht — und sobald er eine Bewertung anzeigt, erkennen auch Ihre Recruiter sie nicht mehr

DSL

Dr. Sarah Liu

Ihr KI-Interviewer erkennt Übertreibungen nicht — und sobald er eine Bewertung anzeigt, erkennen auch Ihre Recruiter sie nicht mehr

63 Prozent der aktiv suchenden Bewerber haben inzwischen ein KI-Interview durchlaufen — 13 Prozentpunkte mehr als vor sechs Monaten. 70 Prozent wurde nie klar gesagt, dass eine KI sie bewerten würde, und 21 Prozent erfuhren es erst, als das Interview bereits begonnen hatte (Greenhouse, 2026).

Diese zwei Zahlen beschreiben die meisten Recruiting-Funnel im Mittelstand. Eine neue Studie in Information Systems Research erklärt, was die zweite Sie kostet.

Bewerber, die nicht sehen, wie sie beurteilt werden, übertreiben. Die KI-Bewertung kann das nicht erkennen. Und der menschliche Prüfer, den Sie als Schutzmechanismus eingezogen haben, schaut auf die Bewertung und hört auf, sein eigenes Urteil zu benutzen.

Das sind nicht drei Probleme. Es ist ein einziger Fehlermodus in drei Stufen, und die mittlere Stufe ist von Ihrem Dashboard aus unsichtbar.

Das Transparenzparadox, getestet über acht Studien

Akshat Lakhiwal (University of Georgia), Che-Wei Liu (Arizona State), Hillol Bala (Indiana) und Hung-Yue Suen (National Taiwan Normal University) veröffentlichten "From Opacity to Transparency: User Behavior and Downstream Effects in Algorithmic Evaluation" am 30. Juli 2026 in Information Systems Research. Acht Studien, darunter zwei Hauptexperimente und eine quasi-experimentelle Feldreplikation, alle im Kontext einseitiger asynchroner Video-Interviews (Lakhiwal et al., Information Systems Research, 2026).

Die Ausgangsspannung ist real, und sie ist der Grund, warum die meisten Arbeitgeber zu ihren Tools geschwiegen haben. Legen Sie offen, was der Algorithmus misst, senken Sie möglicherweise die Anspannung der Bewerber — oder Sie liefern ihnen schlicht die Prüfungsantworten. Die Autoren nennen das das Transparenzparadox und messen dann, welche Seite gewinnt.

Experiment I: Die algorithmische Bewertung erhöhte im Vergleich zur menschlichen Bewertung den Stress und das täuschende Impression Management der Interviewten. Transparenz wirkte beiden Effekten entgegen und brachte sie „nahe an die menschliche Bewertung heran".

Die Offenlegung, die das erreichte, war kein technisches Briefing. Den Bewerbern wurde gesagt, das System achte auf Gesichtsausdrücke, verbale Stimmung und bestimmte Schlüsselwörter und bewerte sie hinsichtlich Teamarbeit, berufsbezogener Fähigkeiten, Arbeitsstil und Persönlichkeit. Diese Gruppe zeigte anschließend dasselbe Maß an authentischem Verhalten wie Bewerber, die glaubten, von einem Menschen geprüft zu werden (UGA Today, 2026).

Lakhiwals Erklärung, warum Intransparenz nach hinten losgeht, lohnt das Festhalten:

„Wenn Sie sich bei Ihrem Traumunternehmen bewerben und dieses Traumunternehmen Sie mit einer KI interviewen will, haben Sie nicht wirklich eine Wahl. Sie wollen nicht nein sagen, aber Sie wissen auch nicht, wie es funktioniert."

Bewerber füllen diese Lücke mit Vermutungen. „Es wurde viel beschönigt", sagte Lakhiwal. „Sie schienen alles aufzufahren, um dem ‚Prüfer' zu geben, was sie für gesucht hielten."

Der Einwand, Bewerber würden das System austricksen, erweist sich als umgekehrt. Die Kriterien zurückzuhalten verhinderte das Austricksen nicht. Es erzeugte es, weil ein Bewerber, der gegen ein eingebildetes Raster optimiert, in alle Richtungen gleichzeitig überschießt.

Die Bewertung Ihres KI-Interviews konnte Ehrliches nicht von Übertriebenem trennen

Das ist der Teil, der verändern sollte, wie Sie Ihre Screening-Berichte lesen.

Der in der Studie verwendete, in der Branche führende KI-Agent bestrafte Bewerber nicht, die die Wahrheit streckten. Er bewertete sie genauso gut wie Bewerber, die dieselben Qualifikationen aufrichtig beschrieben (UGA Today, 2026).

Als menschliche Prüfer dieselben Videos sahen, konnten sie es unterscheiden. Sie bestraften die Beschönigenden im Allgemeinen und gaben ihre höchsten Bewertungen jenen Bewerbern, die sich am authentischsten verhielten.

Das menschliche Urteil funktioniert also. Das ist die ermutigende Hälfte des Befundes, und sie hält genau bis zu dem Moment, in dem Sie dem Menschen sagen, was die Maschine gedacht hat.

Dann hörten die Menschen auf hinzusehen

Experiment II ging weiter nach unten im Prozess und verglich drei Entscheidungskonfigurationen: rein menschlich, KI-gestützt — menschliche Entscheider, unterstützt von KI-Bewertungen — und vollautomatisiert.

Transparenz tat ihre Arbeit auf der Bewerberseite in allen drei weiter. Auf der Prüferseite war sie am Ende. In den Worten der Autoren war ihre korrigierende Wirkung auf die Interviewleistung „auf der Bewertungsseite eingeschränkt". Wenn KI-Bewertungen vorlagen, verankerten sich die Prüfer daran und entwerteten ihr eigenes Urteil, obwohl die KI-Bewertungen ehrliches nicht von täuschendem Verhalten unterscheiden konnten (Lakhiwal et al., Information Systems Research, 2026).

Lesen Sie die Konfigurationen in der Reihenfolge ihrer Verbreitung im Mittelstand. Vollautomatisiertes Screening ist selten und weithin als riskant erkannt. Rein menschliches Screening ist das, wovon Sie sich aus Kostengründen wegbewegen wollen. KI-gestützt — eine Bewertung, dann ein menschlicher Prüfer, der abzeichnet — ist das, was fast alle tatsächlich gekauft haben, und es ist die Konfiguration, in der ein Mensch, der Übertreibung erkennen könnte, verlässlich aufhört, es zu tun.

Der Schutzmechanismus ist nicht neutral. Er wäscht die Bewertung weiß.

Dasselbe Versagen zeigte sich in einem Feldexperiment

Das ist kein Einzelbefund. Lane, Boussioux, Ayoubi und Kollegen führten ein Feldexperiment mit 228 Prüfern durch, die 48 echte Einreichungen bewerteten, und verglichen rein menschliche Bewertung, eine Black-Box-Modellempfehlung und dieselbe Empfehlung mit einer narrativen Erklärung (Lane et al., HBS Working Paper 25-001).

Black-Box-Empfehlungen verbesserten die Entscheidungsqualität. Dieselben Empfehlungen mit angehängter Erklärung nicht — obwohl sie höhere Folgebereitschaft erzeugten. Prüfer folgten Ablehnungsempfehlungen überproportional und erhöhten damit die falsch Negativen deutlich, mit dem stärksten Effekt in Grenzfällen.

Zwei verschiedene Forschungsteams, zwei verschiedene Domänen, ein Mechanismus: Eine flüssige Maschinenausgabe ersetzt den menschlichen Prüfschritt, anstatt ihn zu informieren. Und falsch Negative sind die eine Fehlerklasse, die ein Funnel strukturell nicht sehen kann. Eine Fehlbesetzung zeigt sich in sechs Monaten. Ein abgelehnter guter Bewerber zeigt sich nie.

Was Bewerber verlangen, ist nicht, was Sie schützt

Legen Sie nun die Bewerberbefragung wieder neben die Experimente, denn die Überlappung ist unbequem.

38 Prozent der Bewerber sagen, sie wollen wissen, dass ein Mensch die KI-Bewertung prüft, bevor eine Entscheidung fällt. 39 Prozent wollen eine klare Erklärung dessen, was die KI misst (Greenhouse, 2026).

Die zweite Forderung ist die mit Belegen dahinter. Transparenz stellte authentisches Verhalten messbar wieder her.

Die erste Forderung — menschliche Prüfung der KI-Bewertung — beschreibt fast genau die KI-gestützte Konfiguration, in der sich der Mensch der Maschine beugt. Es ist der Schutzmechanismus, den Bewerber wollen, der Schutzmechanismus, den Ihr Anbieter Ihnen gern verkauft, und der Schutzmechanismus, den das Experiment als mangelhaft befand. Nicht weil menschliche Prüfung wertlos wäre, sondern weil die Reihenfolge zählt: eine Bewertung zu prüfen ist eine andere kognitive Aufgabe als eine Aufnahme zu bewerten.

Unterdessen haben 38 Prozent der Bewerber einen Bewerbungsprozess bereits abgebrochen, weil er ein KI-Interview enthielt, und der größte einzelne Auslöser ist ein vorab aufgezeichnetes Video, das von einer KI ohne jeden Menschen bewertet wird (33 Prozent). Sie verlieren echte Bewerber an eine Konfiguration, die zudem nicht funktioniert.

Der ehrliche Einwand

Vier Grenzen, klar benannt.

Hier stehen bewusst keine Effektstärken. Der Volltext liegt hinter einer Bezahlschranke, und das veröffentlichte Abstract wie die Pressemitteilung berichten Richtungen, nicht Größenordnungen — „ein erheblicher Anstieg", „Hunderte von Online-Jobsuchenden". Wer Ihnen aus dieser Studie einen Prozentwert nennt, erfindet ihn. Etabliert sind Richtung und Rangfolge der Effekte; behandeln Sie die Größe als unbekannt.

Ein Agent, ein Anbieter, ein Zeitpunkt. Das Bewertungsversagen wurde an dem spezifischen, in der Branche führenden Agenten beobachtet, den die Forscher einsetzten. Ein anderes Werkzeug könnte Täuschung besser trennen. Keines bewirbt das heute, was selbst aufschlussreich ist, aber verallgemeinern Sie keine Fähigkeit aus einem einzigen System.

Frühere Forschung stützt den Austricksen-Einwand. Lakhiwal räumt es direkt ein: Es gibt Arbeiten, die zeigen, dass Bewerber die Beurteilung manipulieren können, wenn man ihnen sagt, wie beurteilt wird. Diese Studie findet in diesem Kontext den umgekehrten Nettoeffekt. Eine gut angelegte Studie legt keine Literatur still.

Lane et al. ist ein Working Paper auf benachbartem Terrain. Es bewertet Innovationseinreichungen, keine Jobbewerber, und das Manuskript liegt vor seiner Verbreitung 2026. Es stützt den Verankerungsmechanismus; es ist keine Replikation im Recruiting.

Was Sie vor Ihrer nächsten Screening-Runde ändern sollten

Vier Schritte. Keiner braucht eine neue Budgetposition, und zwei sind Reihenfolgeänderungen, die Sie diese Woche umsetzen können.

  1. Veröffentlichen Sie in einfacher Sprache, was das System misst. Nicht den Modellnamen, nicht die Anbieterarchitektur — Lakhiwal ist eindeutig, dass Bewerber das nicht brauchen. Sagen Sie ihnen, welche Verhaltensweisen beobachtet und welche Merkmale bewertet werden. Die Offenlegung in der Experimentalbedingung war vier Zeilen lang und stellte authentisches Verhalten wieder her. Sie lösen damit auch das 70-Prozent-Problem der Nichtoffenlegung, das Bewerber aus Ihrem Funnel treibt.
  2. Lassen Sie das menschliche Urteil zuerst kommen. Ihr Prüfer soll die Aufnahme bewerten, bevor die KI-Bewertung sichtbar ist, und beides wird gespeichert. Das ist die eine Änderung, die den Verankerungsbefund direkt adressiert, und sie kostet nichts außer der Reihenfolge in der Oberfläche. Beachten Sie: Das ist Scovais Schlussfolgerung aus dem Befund, keine von den Forschern getestete Bedingung — die Studie zeigt die Verankerung, nicht die Heilung.
  3. Hören Sie auf, „ein Mensch hat abgezeichnet" als Prüfspur zu behandeln. Hat der Mensch die Bewertung zuerst gesehen, trägt seine Freigabe die Fehler der Bewertung — mit einem Namen daran. Was eine Screening-Entscheidung verteidigungsfähig macht, ist ein unabhängig erfasstes menschliches Urteil, pro Einstellung protokolliert — Scovais Enterprise-Aufstellung, einschließlich des nach Artikel 14 des EU AI Act protokollierten menschlichen Entscheids, dokumentiert eine Art, das zu strukturieren.
  4. Prüfen Sie auf falsch Negative, nicht auf Treffergenauigkeit. Ziehen Sie eine Stichprobe von Bewerbern, die Ihr KI-Screening im Grenzbereich abgelehnt hat, und lassen Sie die Aufnahmen blind bewerten. Lanes Befund sagt, dass sich die Folgebereitschaft auf der Ablehnungsseite konzentriert — und Ihre Kennzahlen sind dafür strukturell blind.

In Ihrem KI-Interview-Stack sitzt wahrscheinlich schon ein Mensch. Die Forschungsfrage ist nicht, ob er da ist — sondern ob er ein Urteil gebildet hat, bevor die Maschine ihm sagte, was zu denken ist.

Schauen Sie auf den Bildschirm Ihres Prüfers. Lädt die Bewertung über der Aufnahme, haben Sie keinen Menschen in der Schleife. Sie haben einen Zeugen.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.