Kalkulieren Sie einen Kundenservice-Agenten im Bankwesen, und die Token-Rechnung liegt bei 20 bis 25 Prozent seiner variablen Betriebskosten. Die menschliche Aufsicht — Fach- und Risikoexperten, die die Arbeit des Agenten prüfen — liegt bei 70 bis 75 Prozent (McKinsey QuantumBlack, 2026).
Derselbe Workflow. Dieselbe Rechnung. Und nahezu jeder Agenten-Business-Case, den ich dieses Jahr gelesen habe, optimiert die kleinere Zahl.
Modellauswahl, Prompt-Caching, eine günstigere Inferenzstufe für Aufrufe mit geringem Risiko: Dorthin fließt die technische Aufmerksamkeit, weil dort die Kosten lesbar sind. Sie kommen monatlich, aufgeschlüsselt, zurechenbar. Die Aufsicht kommt als Gehaltsstunden in der Kostenstelle eines anderen — und wird deshalb nie als KI-Agentenkosten verbucht. Sie wird verbucht als der Grund, aus dem der Pilot still und leise nie skaliert hat.
Was McKinsey tatsächlich beziffert hat
Der QuantumBlack-Leitfaden vom 24. August 2026 zur Ökonomie agentischer Workflows tut etwas, das fast alle Agentenanalysen auslassen: Er bepreist die fertiggestellte Arbeit, nicht die Software. Agenten, deterministische Systeme und die Menschen, die das Ergebnis prüfen — alles in einer voll belasteten Zahl.
Der Referenzfall ist die Kontoeröffnung. Der Workflow nutzt fünf bis sieben Agenten neben mehreren deterministischen Systemen, mit zwei bis vier Teams, die die Aufsicht übernehmen. Die voll belasteten Kosten pro abgeschlossenem Onboarding sinken von rund 50-150 US-Dollar auf etwa 10-30 US-Dollar (McKinsey QuantumBlack, 2026).
Das ist eine Verbesserung um den Faktor drei bis fünf. Dies ist also kein Argument dagegen, dass Agenten sich rechnen. Es ist ein Argument dafür, dass Sie die falsche Kostenposition verfolgen, um herauszufinden, ob Ihre sich rechnen.
Zur Größenordnung: McKinsey veranschlagt kundenorientierte Einzelagenten-Workflows in einigen Banken mit 20.000 bis 30.000 US-Dollar Betriebskosten pro Jahr und ein Multiagenten-Team mit 100.000 bis 200.000 US-Dollar. Diese Zahlen stammen aus McKinseys Analyse öffentlicher Forschung und öffentlicher Preise, nicht aus geprüften Kundenbüchern — halten Sie die Verhältnisse fest und die absoluten Beträge locker.
Was die KI-Agentenkosten wirklich treibt: die Ausnahmequote, nicht das Modell
Beim Kunden-Onboarding im Bankwesen erwartet McKinsey, dass 10 bis 20 Prozent der agentischen Durchläufe von Risiko- und Fachexperten geprüft werden.
Diese Prüfquote ist das ganze Spiel, und es lohnt sich, die Rechnung langsam durchzugehen — die folgende Illustration stammt von mir, nicht von McKinsey, aber die Eingangsgrößen sind ihre.
Nehmen Sie einen Workflow mit 15 % Prüfquote und 20 Minuten Expertenzeit pro Prüfung. Über 1.000 Durchläufe sind das 50 Stunden hochwertiger Fachzeit. Senken Sie die Prüfquote auf 5 %, kosten dieselben 1.000 Durchläufe rund 17 Stunden. Sie haben zwei Drittel der teuren Position entfernt, ohne ein Modell, einen Prompt oder einen Lieferantenvertrag anzufassen.
Und beachten Sie, wer diese Prüfung vornimmt. McKinsey nennt Fach- und Risikoexperten — jene Menschen, deren Urteil der Workflow schützen soll, nicht eine günstig zu besetzende Junior-QA-Ebene. Aufsichtskosten sind gerade deshalb hoch, weil billige Aufsicht keine Aufsicht ist; der Prüfer muss senior genug sein, um den Agenten überstimmen zu können. Jeder Plan, der die Prüfebene nach unten delegieren will, ist in Wahrheit ein Plan, mit dem Prüfen aufzuhören.
Vergleichen Sie das nun mit dem Hebel, den alle tatsächlich ziehen. McKinsey identifiziert nur drei Treiber der Tokenkosten: Modellqualität, Latenzanforderung und Aufgabenhäufigkeit. Die Spitzenpreise lagen Anfang Juli 2026 bei etwa 5 US-Dollar je Million Input-Token und 30 US-Dollar je Million Output-Token für ein Spitzenmodell, gegenüber 0,20 und 1,25 US-Dollar für ein früheres leichtgewichtiges Modell. Eine Spanne vom Faktor fünfundzwanzig — angewandt auf ein Viertel der Rechnung.
Und hier liegt die Falle in der naheliegenden Optimierung. Stufen Sie das Modell herab, um Token zu sparen, steigt die Fehlerquote. Eine höhere Fehlerquote steigert die Ausnahmequote. Eine höhere Ausnahmequote steigert die Prüfstunden — also die drei Viertel. Token-Einsparungen finanzieren regelmäßig einen Aufsichtsanstieg, den niemand misst, und der Workflow wird teurer, während das Dashboard ihn billiger zeigt.
Warum die geprüften Stunden nicht verschwinden
Es gibt unabhängige Belege dafür, dass die Aufsichtsposition strukturell ist und kein Reifeproblem, das sich auswächst.
MIT Technology Review Insights und Microsoft befragten 300 Technologieführungskräfte und Praktiker und bewerteten 101 agentische Aufgaben auf einer Vertrauensskala von 0 bis 100. Das Vertrauen folgte der Überprüfbarkeit der Aufgabe und der Vollständigkeit des Geschäftskontexts, nicht der Modellfähigkeit: automatisierte Berichterstellung erreichte 83,5 und Boilerplate-Code 82,5 — beide mit einer einzigen objektiven Bewertungsmetrik —, während Service-Mesh-Konfiguration 37,5 und Disaster-Recovery-Tests 43 erreichten: dieselben zugrunde liegenden Modelle, nur ohne saubere Möglichkeit festzustellen, ob das Ergebnis korrekt war. Rechenschaftspflicht beunruhigte 48 % der Befragten, Halluzinationen 47 %, und 59 % planen bereits dauerhafte menschliche Aufsicht (MIT Technology Review Insights, 2026).
Produktionsdaten weisen in dieselbe Richtung. Eine Untersuchung des Agentenprodukts von Perplexity im Vergleich zum Suchprodukt fand, dass die Bearbeitungszeit vergleichbarer Aufgaben von 269 auf 36 Minuten sank — 87 % weniger Zeit und 94 % weniger Kosten —, während sich die Folgearbeit der Nutzer nach oben verschob, hin zu Verifikation und Erweiterung (arXiv 2606.07489, 2026).
Menschliche Arbeit verlagert sich in den Prüfschritt. McKinsey ist schlicht der Erste, der bepreist, wo sie landet.
Volumen und Wiederverwendung entscheiden, ob die Rechnung aufgeht
Die andere Hälfte von McKinseys Ökonomie sind die Fixkosten — und das ist die Hälfte, die darüber entscheidet, ob Agentenprogramme im Mittelstand die Schwelle überhaupt erreichen.
Ein Konversationsagent, der jährlich 2.500 Neukunden onboardet, kostet 10.000-15.000 US-Dollar. Verdoppeln Sie das Volumen, und die Kosten steigen nur auf 15.000-20.000 US-Dollar — weil KI-Infrastruktur und Agentenorchestrierung weitgehend fix sind und Fixkosten sich amortisieren. Beachten Sie, was in dieser Orchestrierungsposition steckt: dauerhafte Data-Science-Kapazität, um den Agenten im Produktivbetrieb zu halten, der laut McKinsey "oft alle paar Tage angepasst werden muss".
Workflows mit geringem Volumen verlieren daher doppelt. Sie erhalten keine Amortisation auf die Fixkosten, und ihre Aufsichtsquote bleibt hoch, weil sie nie genug Durchläufe ansammeln, damit jemand die Ausnahmemuster findet und wegkonstruiert.
Der Ausweg für den Mittelstand heißt Wiederverwendung statt Skalierung. Wenn kein einzelner Workflow genug Volumen trägt, um Infrastruktur und Orchestrierung zu amortisieren, lautet die Frage: Wie viele Workflows können auf einem Agenten-Build laufen? McKinseys Rahmung ist: einmal bauen, über mehrere Workflows ausrollen. Drei benachbarte Prozesse, die sich einen Agenten, eine Kontextschicht und ein Prüfprotokoll teilen, überspringen die Fixkostenschwelle, die keiner von ihnen allein schafft. Das ist eine Architekturentscheidung vor dem ersten Piloten — und sie lässt sich nur sehr schwer nachrüsten, wenn erst drei Teams je ihre eigene Punktlösung gekauft haben.
Diese Asymmetrie zeigt sich in den Adoptionsdaten. McKinseys State of AI 2026 fand, dass Organisationen mit über 1 Milliarde US-Dollar Umsatz, die Agenten skalieren, von 27 % auf 40 % stiegen, während Organisationen unter 1 Milliarde unverändert bei 22 % blieben. Rund 20 % gaben an, dass die KI-Betriebskosten ihre Nutzung begrenzten, und der Anteil, der der KI zumindest eine gewisse EBIT-Wirkung zuschreibt, verharrte bei 37 % — unverändert gegenüber dem Vorjahr (McKinsey, 2026).
Die Adoption kumuliert. Die berichtete finanzielle Wirkung nicht. Das ist die Signatur einer Kostenposition, die niemand steuert.
Der ehrliche Einwand: Das ist Bankwesen, und es ist eine Schätzung
Zwei Vorbehalte, die Sie besser von mir hören als von Ihrem CFO.
Erstens stammt die Zahl von 70-75 % aus regulierten, kundenorientierten Finanzdienstleistungen. Die Aufsichtsintensität ist eine Funktion der regulatorischen Exponierung und der Fehlerfolgen. Interne Ticket-Triage in einem Logistikunternehmen mit 200 Mitarbeitenden liegt auf einer anderen Kurve, und die Aufteilung dürfte dort näher am Gleichgewicht liegen.
Zweitens handelt es sich um modellierte Kosten auf Basis öffentlicher Preise und öffentlicher Forschung, nicht um gemessene Bücher aus einem Kundenmandat. Behandeln Sie sie als gut spezifizierte Schätzung, nicht als Messung.
Aber beachten Sie die Richtung des Fehlers. Tokenpreise sind stetig gefallen und werden weiter fallen. Prüfergehälter nicht, und sie werden es auch nicht. Jeder vergehende Monat verschiebt das Verhältnis weiter gegen die Token, nicht zurück zu ihnen. Falls 70-75 % für Ihren Kontext heute falsch ist, lautet die ehrliche Korrektur: fragen, was daraus in achtzehn Monaten wird — nicht annehmen, es falle zurück auf etwas, das das Token-Dashboard sehen kann.
Bepreisen Sie die Prüfstunden, bevor Sie den Piloten freigeben
Fünf Dinge, die Sie in der Bewertung des nächsten Agentenvorschlags ändern sollten.
- Schreiben Sie die Ausnahmequote als benannte Zahl in den Business Case. Anteil der Durchläufe mit menschlicher Prüfung, erwartete Minuten pro Prüfung, belasteter Stundensatz des Prüfers. Verpflichtet sich niemand auf diese drei Zahlen, haben Sie keinen Business Case — Sie haben eine Demo mit angehefteten Budget.
- Konstruieren Sie Überprüfbarkeit, bevor Sie den Umfang ausweiten. Das MIT–Microsoft-Ranking zeigt: Vertrauen folgt Aufgaben mit einer einzigen lesbaren Erfolgsmetrik. Diese Eigenschaft ist herstellbar — Metrik instrumentieren, Geschäftskontext kodieren, Umfang verengen. Sequenzieren Sie Rollouts nach Überprüfbarkeit, nicht danach, welche Aufgabe am einfachsten aussieht.
- Sortieren Sie Kandidaten-Workflows zuerst nach jährlicher Durchlaufzahl. Wiederverwendung und Volumen amortisieren die Fixkosten. Ein cleverer Anwendungsfall mit geringem Volumen ist jedes Mal die schlechtere Investition als ein langweiliger mit hohem Volumen.
- Budgetieren Sie die Wartungsposition ausdrücklich. Agenten, die alle paar Tage angepasst werden, erfordern dauerhafte Engineering-Kapazität. Das ist ein permanenter Fixkostenblock, keine Projektausgabe.
- Berichten Sie den ROI der fertiggestellten Arbeit. Voll belastete Kosten, um die Arbeit abzuschließen — Menschen, Agenten und deterministische Systeme zusammen —, gemessen am Wert der Arbeit. Nicht Kosten pro Token und nicht rechnerisch eingesparte Stunden.
McKinseys eigene Empfehlung ist das Gegenteil des Instinkts: Statt die Modellauswahl zu optimieren, sollten Sie den Workflow neu gestalten, um Ausnahmequoten zu senken und jene Prüfprozesse zu vereinfachen, die teure menschliche Eingriffe auslösen. Das ist ein Prozessengineering-Auftrag, der in etwas steckt, das alle als Einkaufsentscheidung behandelt haben.
Was in diesem Quartal zu entscheiden ist
Suchen Sie den Agentenpiloten, der auf Ihre Unterschrift wartet, und fragen Sie nach einer Zahl, die nicht in der Präsentation steht: erwartete Prüfstunden je hundert Durchläufe.
Ist die Antwort ein Schulterzucken, werden Sie nicht gebeten, eine Software freizugeben. Sie werden gebeten, ein Prüfteam zu besetzen, das niemand budgetiert hat — und zwar bei jenen drei Vierteln der KI-Agentenkosten, die Ihr Dashboard nie zeigen sollte.