Ihr Team verbringt 87 Minuten pro Tag in KI-Werkzeugen. Davon entfallen 42 % auf das Beheben von Fehlern und das Nachjustieren von Prompts, gegenüber 35 % auf Arbeit, die die Aufgabe tatsächlich voranbringt (BambooHR, 2026). KI-Fehlerbehebungszeit ist inzwischen die größte einzelne Kategorie an KI-Zeit im durchschnittlichen Arbeitstag — größer als die produktive Kategorie, die diese Werkzeuge ausweiten sollten.
Aufs Jahr gerechnet entsprechen die 87 Minuten rund 47 Achtstundentagen. Etwa 20 dieser Tage gehen dafür drauf, das Werkzeug zum gewünschten Verhalten zu bewegen.
Das ist kein Adoptionsproblem. Die Adoption funktioniert. Es ist ein Messproblem: Nahezu jedes Dashboard, das diesen Rollout verfolgt, zählt die 87 Minuten — und keines schlüsselt sie auf.
Die Studie, mit der Ihr Verlängerungsgespräch beginnen sollte
BambooHRs Redesigning Work: AI's Performance Review befragte 1.608 festangestellte US-Vollzeitbeschäftigte, darunter eine Teilgruppe von 520 HR-Fachleuten; Feldphase 26. Juni bis 15. Juli 2026, durchgeführt von Method Research, veröffentlicht am 1. September (BambooHR, 2026). Die Befragten deckten mehr als ein Dutzend Branchen ab, gleichmäßig nach Geschlecht verteilt, mit Streuung über Altersgruppen und Regionen.
Die zentrale Aufteilung ist der Befund:
- 42 % der KI-Zeit — Fehlerbehebung und Prompt-Iteration
- 35 % der KI-Zeit — produktive Arbeit, die das Pensum der Person voranbringt
- 23 % — alles Übrige
Merken Sie sich das Verhältnis, nicht die Prozentwerte. Für je drei Minuten, die Ihr Team aufwendet, um aus einem KI-Werkzeug Wert zu ziehen, wendet es vier auf, um das Werkzeug zu etwas Brauchbarem zu bewegen. Dieses Verhältnis hat Kosten, es hat eine Verteilung, und beides taucht in keinem Lizenzbericht auf.
Unterdessen haben 63 % der Organisationen ihre Budgets für KI-Werkzeuge bereits erhöht. Die Ausgaben skalieren gegen einen Nenner, den niemand zerlegt hat.
Die Last kehrt Ihr Organigramm um
Das ist der Teil, der ändern sollte, wo Sie hinschauen.
Tägliche Minuten in KI-Werkzeugen, nach Ebene (BambooHR, 2026):
- VPs und C-Level: 101 Minuten
- Manager und Direktoren: 89 Minuten
- Individual Contributors: 54 Minuten
Führungskräfte verbringen fast doppelt so lange in diesen Werkzeugen wie die Menschen, die an sie berichten. Hält der Fehlerbehebungsanteil auch nur ungefähr über die Ebenen hinweg, wird der größte Pool unproduktiver KI-Zeit in Ihrem Unternehmen von dessen teuerster Arbeitskraft erzeugt.
Rechnen Sie es auf Mittelstandsgröße hoch. Ein Unternehmen mit 200 FTE und 15 Personen auf VP-Ebene oder darüber: 101 Minuten täglich, davon 42 % Fehlerbehebung, ergibt rund 42 Minuten pro Führungskraft und Tag. Auf 15 Personen sind das über 10 Führungsstunden täglich — mehr als ein zusätzlicher Senior-FTE in Vollzeit, vollständig aufgewendet für Prompt-Iteration und Fehlerkorrektur, finanziert aus dem teuersten Posten Ihrer Gehaltsliste.
Diese Stelle hat niemand genehmigt. Sie kam über ein Werkzeugbudget.
Warum Seniorität die Kosten bündelt
Die Richtung überrascht nicht, sobald man betrachtet, wofür erfahrene Mitarbeitende KI einsetzen. Ihre Arbeit ist weniger schablonenhaft, urteilsdichter und stärker kontextabhängig — genau das Profil, das mehr Iteration, mehr Korrektur und mehr verworfene Ergebnisse erzeugt. Die Aufgaben mit der saubersten KI-Ausbeute sind eher die strukturierten, weiter unten im Organigramm.
Aus dem Euroraum kommt ein passender Befund. Die Consumer Expectations Survey der EZB fand, dass die Aufgaben mit der höchsten KI-Zeitausbeute eng und untergenutzt sind — Codegenerierung und Debugging bringen fast acht Stunden pro Woche, doch nur etwa 8 % der Beschäftigten setzen KI dort ein — während die häufigsten Anwendungen, Recherche, Informationsbeschaffung, Schreiben und Redigieren, deutlich weniger einsparen (EZB, 2026). Breite, unstrukturierte, kontextreiche Arbeit ist genau dort, wo die Stunden hineingehen und die geringste Ausbeute herauskommt. Das beschreibt den Tag einer Führungskraft recht genau.
Warum sich niemand beschwert hat
Weil es sich nicht nach Verschwendung anfühlt. Genau das hält das Problem über einen ganzen Budgetzyklus unsichtbar.
BambooHR fand, dass 65 % der Beschäftigten sich sicher und begeistert im Umgang mit KI bei der Arbeit fühlen, und 58 % nennen Zeitersparnis als Hauptmotivation — während sie in derselben 42/35-Aufteilung sitzen.
Culture Amps erster AI-at-Work-Benchmark zeigt dieselbe Entkopplung im großen Maßstab. Über rund 112.000 Beschäftigte und 343.000 Antworten, erhoben in den 12 Monaten bis Juli 2026, sagten 71 % der Beschäftigten, KI-Werkzeuge hälfen ihnen, sich produktiver zu fühlen — bei den intensivsten Nutzern steigt der Wert auf 93 %. Gefragt, ob ihr Arbeitspensum angemessen sei, kamen Power-User jedoch auf 72 % gegenüber 69 % der Nichtnutzer — ein Unterschied von drei Punkten (Culture Amp, 2026).
Die empfundene Produktivität steigt mit der Nutzungsintensität um 22 Punkte. Die empfundene Entlastung beim Pensum bewegt sich um drei. Diese beiden Kurven sollten gemeinsam verlaufen — sie tun es nicht.
Selbstauskunft ist hier das schwache Instrument
Die Lücke zwischen wahrgenommener und gemessener Wirkung ist dokumentiert, und sie verläuft in eine Richtung. METRs randomisierte Studie mit erfahrenen Open-Source-Entwicklern ergab, dass KI-Werkzeuge von Anfang 2025 sie 19 % langsamer machten, während die Teilnehmenden glaubten, schneller geworden zu sein; METRs spätere Befragung von 349 technischen Fachkräften berichtet, dass die Teilnehmenden jener Studie den Effekt der KI auf die Bearbeitungszeit um etwa 40 Prozentpunkte überschätzten (METR, 2026).
Die Evaluationen der britischen Regierung zeigen dieselbe Stauchung bei besserer Methodik. Das ressortübergreifende Microsoft-365-Copilot-Experiment — 20.000 Beschäftigte im öffentlichen Dienst — meldete eine durchschnittliche Ersparnis von 26 Minuten pro Tag, eine Zahl, die die Teilnehmenden anhand vorgegebener Intervalle selbst schätzten (GDS, 2025). Als das DWP seinen eigenen Teil dieses Versuchs gegen eine Vergleichsgruppe von Nichtnutzern auswertete und dabei demografische, berufliche und KI-Affinitätsvariablen kontrollierte, lag die Schätzung bei 19 Minuten pro Tag über acht Routineaufgaben (DWP, 2025).
Andere Grundgesamtheiten, anderer Aufgabenzuschnitt — es ist also kein sauberer Vorher-Nachher-Vergleich. Aber es sind zwei Messungen desselben Rollouts, und die mit Vergleichsgruppe ist die kleinere. Der GDS-Bericht ist in seinen Schlussfolgerungen deutlich: „Aufgrund experimenteller Beschränkungen war es nicht möglich zu ermitteln, wie die eingesparte Zeit verwendet wurde."
Die Begeisterung Ihres Teams ist echt. Ein Beleg ist sie nicht.
KI-Fehlerbehebungszeit bricht Ihre Adoptionskennzahlen
Lizenzzahlen, Lizenznutzung und Login-Raten messen allesamt die 87 Minuten. Keine davon trennt die 42 von den 35. Ein Adoptions-Dashboard mit starker Nutzung ist nach dieser Evidenz genauso vereinbar mit einem Team, das echten Hebel erzielt, wie mit einem Team, das 20 Arbeitstage im Jahr gegen sein Werkzeug kämpft.
Schlimmer noch: Die Kennzahl belohnt die falsche Bewegung. Steigende Minuten im Werkzeug lesen sich als Erfolg. Bleibt der Fehlerbehebungsanteil stabil, sind steigende Minuten überwiegend steigende Nacharbeit.
Der EZB-Befund liefert die zweite Korrektur. Der mediane KI-Nutzer im Euroraum spart rund drei Stunden pro Woche, etwa 7,7 % der Arbeitszeit — doch da nur 48,8 % der Beschäftigten KI nutzen und damit Zeit sparen, liegt der gesamtwirtschaftliche Gewinn bei etwa 3,8 % (EZB, 2026). Werte pro Nutzer mal Belegschaft überschätzen den Ertrag um rund das Doppelte. Ein Business Case nach dem Muster „X gesparte Minuten × alle" irrt zweifach: einmal bei der Teilnahme, einmal beim Fehlerbehebungsanteil innerhalb der Minuten, die er überhaupt zählt.
Der ehrliche Einwand
Drei Grenzen, klar benannt.
Dies ist eine Anbieterstudie. BambooHR verkauft HR-Software an kleine und mittlere Unternehmen und hat ein kommerzielles Interesse am Argument, dass KI-Rollouts personalseitige Steuerung brauchen. Die Feldarbeit übernahm ein unabhängiges Forschungsinstitut, die Methodik ist offengelegt und die Stichprobe angemessen — aber es ist eine Umfrageveröffentlichung, kein begutachteter Fachaufsatz. Gewichten Sie entsprechend.
Es ist Selbstauskunft, und das gilt auch für das meiste, was sie stützt. Die 42/35-Aufteilung beruht darauf, dass Beschäftigte ihre eigene Zeitverwendung schätzen — genau jenes Instrument, das METR in diesem Feld als unzuverlässig gezeigt hat. Die ehrliche Lesart: Die Richtung ist über BambooHR, Culture Amp und die britischen Versuche gut abgesichert, die Größenordnungen sind weich. Zitieren Sie die 42 % nicht als gemessene Konstante. Zitieren Sie sie als Grund, Ihre eigene zu messen.
Der Seniortitätsunterschied ist eine Korrelation, kein Mechanismus. BambooHR berichtet Minuten je Ebene; den Fehlerbehebungsanteil je Ebene berichtet es nicht. Meine Hochrechnung oben unterstellt, dass die 42 % über die Ebenen hinweg ungefähr konstant bleiben. Diese Annahme ist plausibel und ungeprüft — Seniorarbeit könnte mehr Iteration erzeugen, oder Senior-Nutzer könnten geschickter darin sein, sie zu vermeiden. Behandeln Sie die Führungsstundenzahl als Größenordnung zum Nachprüfen, nicht als Zahl für ein Board Deck.
Was in diesem Quartal zu entscheiden ist
Vier Schritte. Keiner erfordert neue Software.
- Schlüsseln Sie die Minutenzählung vor der nächsten Verlängerung auf. Ihre heutige Kennzahl sind Minuten im Werkzeug. Fügen Sie eine Dimension hinzu: Welcher Anteil dieser Zeit erzeugt Ergebnisse, welcher erzeugt einen brauchbaren Prompt. Ein zweiwöchiges Selbstprotokoll bei 20 Personen liefert Ihnen eine belastbare interne Zahl — und es ist die einzige Zahl in diesem Artikel, die Ihr Unternehmen betrifft.
- Erheben Sie nach Rollenband, nicht nach Durchschnitt. Ziehen Sie das Senior-Band getrennt heraus. Hält die von BambooHR gefundene Form in Ihrer Organisation, konzentriert sich das teure Problem auf fünfzehn Kalender, nicht auf zweihundert — was es zugleich bearbeitbar macht.
- Machen Sie den Fehlerbehebungsanteil zum Adoptions-KPI. Ersetzen Sie die Login-Rate durch das Verhältnis. Ein Rollout, bei dem die Minuten steigen und der Fehlerbehebungsanteil sinkt, funktioniert. Einer, bei dem beides steigt, ist eine Nacharbeits-Pipeline im Gewand eines Adoptions-Dashboards.
- Bestimmen Sie das Ziel der Stunden, bevor Sie sie zählen. Beide britischen Evaluationen konnten eingesparte Zeit messen, und keine konnte sagen, wohin sie floss. Eine Zeitersparniszahl ohne benanntes Ziel ist kein ROI-Input. Entscheiden Sie, was aufhört, bevor Sie verbuchen, was beginnt.
Die 63 %, die dieses Jahr ihre KI-Budgets erhöht haben, taten es auf Basis einer Zahl, die die kämpfende und die arbeitende Minute gleich zählt.
Bevor Sie die nächste Tranche freigeben, finden Sie heraus, welche der beiden Sie eingekauft haben. Ihre erfahrensten Leute zahlen die Antwort das ganze Jahr — in KI-Fehlerbehebungszeit, die niemand ins Budget geschrieben hat.