Mehr als 15 % der OpenAI-Chats werden als "Edit written materials or documents" klassifiziert. Nur 2,4 % der Beschäftigten üben einen Beruf aus, der diese Aufgabe laut O*NET enthält (Bick, Blandin, Deming & Schumacher, NBER, 2026). Diese Lücke steckt mitten im KI-Nutzungsbenchmark, auf dem die meisten Betriebspläne für 2027 aufbauen.
Nun die Gegenrichtung. Die einzelne Aufgabe mit dem größten Anteil an der genAI-Nutzung in einer national repräsentativen Befragung ist "Direct organizational operations, activities, or procedures" — 4,1 % aller angegebenen Nutzungen, ausgeübt von 43 % der Beschäftigten. Ihr Anteil in den OpenAI-Daten: 0,0 %. Bei Microsoft: 0,0 %. Bei Anthropic: 0,2 %.
Genau die Arbeit, die für Operations am charakteristischsten ist, sehen die Chat-Logs überhaupt nicht. Wenn Ihr KI-Plan für 2027 anhand einer dieser Anbieter-Nutzungsstudien dimensioniert wurde — und das gilt für die meisten Mittelstandspläne, weil diese Studien kostenlos, aktuell und riesig sind — dann lesen Sie eine Karte, auf der Ihr eigenes Territorium fehlt.
Was diese Befragung leistet und Chat-Studien nicht können
Alexander Bick (Federal Reserve Bank of St. Louis), Adam Blandin (Vanderbilt), David Deming (Harvard Kennedy School) und Tyler Schumacher (Vanderbilt) haben den ersten aufgabenbezogenen genAI-Adoptionsindex aus einer national repräsentativen Befragung gebaut statt aus Plattform-Telemetrie (NBER Working Paper 35677, 2026).
Der Mechanismus ist entscheidend. Sie haben vier Wellen der Real-Time Population Survey zusammengeführt — 13.920 erwerbstätige Befragte zwischen 18 und 64 Jahren — und die angegebene genAI-Nutzung jeder Person mit ihrem detaillierten Beruf und den konkreten ONET-Arbeitsaktivitäten verknüpft, die dieser Beruf tatsächlich enthält. Weil sie den Beruf der Befragten kennen, können sie eine Nutzung einer Aufgabe innerhalb einer bekannten Stellenarchitektur* zuordnen.
Ein Chat-Klassifikator kann das nicht. Er liest den Text einer Konversation und weiß in der Regel nicht, was die Person beruflich macht. Also tut er das Einzige, was möglich ist: Er ordnet den Chat einem Aufgabentitel zu, der die sichtbare Handlung beschreibt. Bearbeiten. Informationen sammeln. Ein System entwerfen.
Das ist kein Fehler im Klassifikator irgendeines Anbieters. Es ist eine strukturelle Grenze des Inputs, und das Paper benennt sie klar: Chat-Klassifikatoren "sind möglicherweise dazu prädisponiert, Chats Aufgabentiteln zuzuordnen, die grundlegende, generische Handlungen beschreiben".
Wie weit der KI-Nutzungsbenchmark abdriftet
Die Folge ist extreme Konzentration. Zehn von 332 Aufgaben machen 53,0 % der Nutzung in den OpenAI-Daten aus, 46,0 % bei Anthropic und 60,8 % bei Microsoft — gegenüber 22,2 % in der Befragung (Bick et al., NBER, 2026). Die größte Einzelaufgabe nimmt in den drei Chat-Datensätzen 15,1 %, 16,7 % bzw. 23,2 % ein, gegenüber 4,1 % in der Befragung.
Und dann die Zahl, die die Debatte beenden sollte, ob es sich um zwei Blicke auf dieselbe Realität handelt. Die Korrelation zwischen den Aufgabenanteilen der Befragung und denen der Chat-Datensätze beträgt 0,11 für OpenAI, 0,34 für Anthropic und 0,10 für Microsoft. Zwei von drei stehen statistisch fast in keinem Zusammenhang damit, wie Beschäftigte ihre Werkzeuge über ihre realen Aufgaben hinweg nach eigener Aussage nutzen.
Der Fehler zweiter Ordnung ist der in Ihrem Plan
Der direkte Nutzungsanteil landet meist gar nicht im Business Case. Die Kette ist länger, und das Paper verfolgt sie: Chat-Aufgaben-Klassifikationen werden zu genAI-Anteilen je Beruf aggregiert, und diese Berufsanteile zirkulieren dann als Näherungswerte für die KI-Exposition je Rolle — der Input hinter Rollout-Reihenfolge, Schulungsbudgets und Personalprognosen. Die Autoren nennen vier publizierte Maße, die so gebaut sind, und schließen, diese Näherungswerte seien "wahrscheinlich ungenau und bieten ein verzerrtes Bild".
Wenn Ihnen also eine Präsentation sagt, welche Ihrer Funktionen am stärksten KI-exponiert sind, fragen Sie, woher das Ranking stammt. Führt es auf Chat-Logs zurück, erbt es einen Klassifikator, der nie wusste, welchen Beruf irgendjemand ausübt — und sein charakteristischer Fehler ist, Arbeit zu hoch zu bewerten, die im Transkript generisch aussieht.
Auch Ihr anderer Input ist schwächer, als er wirkt
Die naheliegende Korrektur: Nutzungsbenchmarks fallen lassen und stattdessen einen echten berufsbezogenen Expositionswert verwenden. Auch das hat das Paper getestet, gegen die beiden meistzitierten Indizes der Literatur.
Auf die tatsächliche Adoption regressiert, liefert das Maß von Eloundou et al. (2024) ein korrigiertes R² von 0,081 und das von Felten et al. (2021) 0,086 — rund die Hälfte der erklärbaren Varianz auf Berufsebene (Bick et al., NBER, 2026). Die Werte sind durchaus prädiktiv. Ausreichend sind sie bei Weitem nicht.
Darunter liegt eine härtere Grenze. Der Beruf selbst erklärt weniger als 20 % der Varianz der Adoption auf Personenebene (Bick et al., NBER, 2026). Was tatsächlich darüber entscheidet, wer adoptiert, sitzt überwiegend innerhalb der Stellenbezeichnung, nicht zwischen Stellenbezeichnungen. Zwei Analystinnen im selben Team, gleiche Werkzeuge, gleiche Aufgaben — eine hat ihre Woche um das Tool herum neu gebaut, die andere öffnet es zweimal im Monat.
Das ist ein Planungsproblem mit klarer Form. Jede Zuteilung nach Rolle — Lizenzen, Schulungsstunden, Enablement-Reihenfolge — beruht auf einer Variablen, die weniger als ein Fünftel des Ergebnisses erklärt, das Sie interessiert.
Es erklärt auch ein Muster, das die meisten Operations-Verantwortlichen längst gesehen und unter etwas anderem abgelegt haben. Eine Funktion kommt aus derselben Enablement-Session mit weit auseinanderliegenden Ergebnissen zurück; die Reflexdeutung lautet Motivation, Führungsqualität oder Veränderungswiderstand. Die Adoptionsdaten sagen: Ein großer Teil dieser Streuung wäre ohnehin entstanden, weil sie auf Personenebene liegt, die Intervention aber auf Rollenebene ansetzte. Die Session noch einmal zu fahren, nur nachdrücklicher, adressiert das nicht.
"Breit, aber flach" ist eine präzise Aussage, keine Absicherung
Das Adoptionsbild der Befragung lässt sich in beide Richtungen leicht falsch zitieren. Die präzise Fassung:
- Stand Mai 2026 nutzen 45 % der Beschäftigten genAI für die Arbeit; die Autoren behandeln das als Untergrenze, da eingebettete und passive Nutzungen häufig nicht angegeben werden.
- Mehr als 80 % der Berufe und 40 % der Aufgaben zeigen eine Adoption über 20 %.
- Aber nur 2,8 % der Aufgaben überschreiten 50 % Adoption, und keine überschreitet 70 %.
Lesen Sie das zusammen. Es gibt in der US-Wirtschaft keine Aufgabe, bei der genAI-Nutzung nahezu universell ist. Die Berufe mit sehr hoher Adoption — rund 15 % liegen über 70 % — kommen nicht über eine gesättigte Einzelaufgabe dorthin, sondern über eine Ansammlung mäßig adoptierter Aufgaben.
Unabhängige Daten bestätigen die Form. Googles ATLAS-Studie, gebaut auf 14,65 Millionen deidentifizierten Interaktionen statt auf Selbstauskunft, fand, dass der Median-Beruf Gemini für rund 21 % seiner Aufgaben nutzt, mit einer Ende-zu-Ende-Automatisierungsabsicht unter 10 % der nicht-routinemäßigen kognitiven Konversationen (Google ATLAS v1.0, 2026). Verhaltenstelemetrie über 120.620 Beschäftigte verortet nur 2 % auf der Reifestufe Workflow-Integration — KI innerhalb eines neu gestalteten Prozesses statt als Nachschlagen nebenher (ActivTrak Productivity Lab, 2026).
Drei Methoden, drei Datensätze, eine Schlussfolgerung: breite Abdeckung, dünne Durchdringung. Das heißt: Ein Plan, der eine KI-exponierte Rolle wie eine KI-transformierte Rolle modelliert, liegt um den größten Teil der Distanz daneben.
Der ehrliche Einwand
Drei Grenzen, die man aushalten muss.
Die 2,4-%-Zahl ist teilweise ein ONET-Artefakt, und die Autoren sagen das selbst. Ihre exakten Worte: "der Anteil der Beschäftigten, die Lektorat betreiben, ist eindeutig viel größer als 2,4 %". ONET bettet Bearbeiten in übergeordnete Aufgaben ein, etwa Berichte erstellen oder Rechtsdokumente verfassen. Die Lücke zwischen 15 % und 2,4 % ist also kein reiner Klassifikatorfehler — ein Teil davon ist eine Referenztaxonomie, die eine tatsächlich allgegenwärtige Tätigkeit nicht benennt. Die Richtung der Verzerrung ist gut belegt; die Größenordnung eines einzelnen Zahlenpaars ist weicher, als sie aussieht.
Selbstauskunft hat ebenfalls ihre Fehlermodi. Die Befragung weiß, was Menschen sagen, dass sie mit den Werkzeugen tun. Chat-Logs wissen, was tatsächlich durch das Fenster lief, in einem Maßstab, den keine Befragung je erreichen wird. Keines von beiden ist die Grundwahrheit; sie beantworten unterschiedliche Fragen, und der Beitrag des Papers besteht darin zu zeigen, wie weit die Antworten auseinanderliegen — nicht eine davon für falsch zu erklären.
Eine nationale Befragung ist nicht Ihr Unternehmen. Die RPS beschreibt die US-Erwerbsbevölkerung. Ihr Aufgabeninventar, Ihr Tool-Stack und Ihr Stellenzuschnitt sind nicht der nationale Durchschnitt, und nichts hiervon sagt Ihnen, welche Ihrer Rollen adoptieren werden.
Diese letzte Grenze ist die eigentlich entscheidende — und sie weist in eine einzige Richtung. Jeder externe Benchmark in diesem Feld, ob aus Chat-Logs oder Befragung, ist ein Prior. Keiner davon ist eine Messung Ihrer Organisation.
Was in diesem Quartal zu entscheiden ist
Vier Schritte. Keiner erfordert neue Ausgaben.
- Führen Sie jeden KI-Nutzungsbenchmark in Ihrem Plan auf seine Quelle zurück. Stammt eine Zahl aus Plattform-Chat-Logs, markieren Sie sie als richtungsweisenden Prior, nicht als Input für ein Personal- oder Budgetmodell. Das ist ein Dreißig-Minuten-Audit eines Dokuments, das Sie längst geschrieben haben.
- Bauen Sie ein Aufgabeninventar für genau eine Funktion. Zwanzig bis dreißig reale Tätigkeiten eines einzelnen Teams, in Ihrer Sprache formuliert statt in der von O*NET. Es ist das einzige Artefakt, mit dem Sie fragen können "berührt das Tool das hier?" statt "ist diese Rolle exponiert?" — und es überlebt jede Revision von Anbieter-Benchmarks, weil es Ihre Arbeit beschreibt und nicht den Traffic anderer. Planen Sie einen Nachmittag mit der Teamleitung ein, kein Beratungsmandat.
- Hören Sie auf, Enablement nach Rolle zuzuteilen. Wenn der Beruf weniger als 20 % der Adoption auf Personenebene erklärt, kommt ein rollenbasierter Rollout einem Münzwurf nahe. Teilen Sie stattdessen nach beobachteter Nutzung zu und lassen Sie die erste Kohorte aus denen bestehen, die in Ihrer eigenen Telemetrie bereits vorn liegen.
- Setzen Sie das Ziel auf die Aufgabe, nicht auf die Lizenz. Wählen Sie eine Aufgabe aus diesem Inventar und treiben Sie sie über 50 % Adoption. Weniger als drei von hundert Aufgaben haben diese Linie landesweit überschritten — genau deshalb ist ein bewusstes Überschreiten ein belastbares Ergebnis für Ihren Bericht.
Ihr KI-Nutzungsbenchmark hat eine Frage beantwortet, die Sie nie gestellt haben: Wie sehen Chats aus. Die Frage auf Ihrem Schreibtisch lautet, was Ihre Leute den ganzen Tag tun — und ob das Werkzeug irgendeinen Teil davon erreicht hat.
Eine dieser Fragen hat eine veröffentlichte Antwort. Die andere hat nur Ihre.