Autonome Coding-Agenten steigerten die Commit-Aktivität von Entwicklern kumuliert um 240 %. Releases — die Stufe, auf der Software beim Kunden ankommt — stiegen um 30 % (Demirer, Musolff & Yang, NBER, 2026). Dieselben Entwickler, dieselben Werkzeuge, dieselbe Studie, dasselbe Zeitfenster. Acht Zehntel des gemessenen Gewinns haben das Haus nie verlassen.
Diese Lücke ist die Form der meisten KI-Business-Cases, die in diesem Jahr geschrieben wurden. Der Pilot misst die Stufe, die das Werkzeug beschleunigt. Niemand misst die Stufe, die über die Lieferung entscheidet, weil an dieser Stufe keine Lizenzgebühr hängt.
Das Papier heißt Writing Code vs. Shipping Code, und die Unterscheidung im Titel ist der gesamte Befund. KI-Produktivitätsgewinne sind real, groß und auf Aufgabenebene gemessen. Beim Kunden kommen sie stark abgezinst an.
Was eine Studie mit 500.000 Entwicklern sieht und ein Pilot nicht
Mert Demirer (MIT Sloan), Leon Musolff und Liyuan Yang verknüpften KI-Nutzungstelemetrie mit mehr als 500.000 GitHub-Entwicklern in einem gematchten Event-Study-Design und verfolgten den Effekt über aufeinanderfolgende Werkzeuggenerationen (NBER Working Paper 35275, 2026).
Die Ergebnisse nach Generation sollte man getrennt halten, denn das ist der Teil, den die meisten Leser zitieren wollen:
- Autovervollständigung: +30 % kumulierter Effekt auf Commits
- Interaktive Coding-Agenten: +180 %
- Autonome Coding-Agenten: +240 %
Jede Generation ist ein echter Sprung. Wer behauptet, agentische Werkzeuge bewegten den Durchsatz auf Aufgabenebene nicht, argumentiert gegen eine sehr große Stichprobe.
Dann die Abschwächung. Dieser 240-%-Commit-Effekt fällt auf 80 % bei der Anzahl der Projekte und auf 30 % bei tatsächlichen Releases. Und als die Autoren GitHub verließen und vier große Software-Marktplätze betrachteten, fanden sie einen deutlichen Anstieg der Zahl neuer Apps und keinen Anstieg der Gesamtnutzung.
Mehr Code geschrieben. Etwas mehr Projekte gestartet. Ein wenig mehr ausgeliefert. Nichts mehr genutzt.
Das Marktplatz-Ergebnis verdient eigenes Gewicht, weil es eine bequeme Lesart ausschließt. Eine reine Engpass-Erklärung würde einen Rückstau vorhersagen — Output, der hinter einem Tor wartet und zurückzuholen ist, sobald das Tor breiter wird. Doch neue Apps nahmen zu, während die Gesamtnutzung es nicht tat, und das deutet auf etwas jenseits der Release-Stufe: Der Markt nahm mehr Angebot auf, ohne mehr Nachfrage zu erzeugen. Ein Teil des fehlenden Gewinns steht in der Warteschlange hinter menschlicher Prüfung. Ein Teil wäre ohnehin nie Wert geworden, denn mehr Output von etwas, das niemand verlangt hat, ist kein Output. Beide Lesarten sollten eine operative Führungskraft vorsichtig machen gegenüber einem Business Case, der Geschwindigkeit auf Aufgabenebene direkt in Umsatz umrechnet.
Warum KI-Produktivitätsgewinne vor der letzten Stufe sterben
Die Erklärung der Autoren ist die Weak-Link-Hypothese, und sie ist älter und besser belegt als alles KI-Spezifische: In einer mehrstufigen Produktionskette wird der Gesamtoutput von der am wenigsten verbesserten Stufe bestimmt, nicht vom Durchschnitt.
Code schreiben ist eine Stufe. Review, Integrationstests, Sicherheitsfreigabe, Release-Genehmigung und Deployment sind die anderen — und keine Generation von Coding-Werkzeugen hat sie berührt. Also verschob sich die Restriktion. Sie verschwand nicht; sie wanderte zum ersten menschlichen Tor stromabwärts der Beschleunigung.
Die Elastizitätszahl ist das Argument
Das Papier setzt einen Koeffizienten darauf: eine geschätzte Substitutionselastizität von 0,23 zwischen KI und menschlicher Arbeit (Demirer et al., NBER, 2026).
Ganz nüchtern gelesen: Eine niedrige Elastizität bedeutet starke Komplementarität. KI und die Menschen stromabwärts sind keine Substitute, die um dieselbe Arbeit konkurrieren — sie sind Inputs, die einander in ungefährer Proportion brauchen. Verdreifachen Sie den einen, ohne den anderen anzufassen, und Sie erhalten nicht den dreifachen Output. Sie erhalten eine Warteschlange.
Das ist die Zahl, die man jedem vorlegen sollte, dessen Plan stillschweigend annimmt, ein hinreichend guter Agent werde am Ende auch den Prüfer absorbieren. Die beste verfügbare Schätzung sagt das Gegenteil — und sagt es mit einer Nachkommastelle.
Ihre Pipeline hat dieselbe Form
Software ist der Schauplatz, nicht der Geltungsbereich. Die Struktur, die dieses Ergebnis erzeugt hat — sequenzielle Stufen, maschinell beschleunigbare Arbeit vorn, menschliche Urteilstore hinten — ist die Struktur nahezu jedes operativen Prozesses in einem Unternehmen mit 50 bis 500 FTE.
Order-to-Cash: Angebotserstellung ist automatisierbar; Kreditfreigabe und Ausnahmebehandlung nicht. Hire-to-Onboard: Sourcing und Screening sind automatisierbar; die Angebotsentscheidung und die Übergaben der ersten Woche nicht. Ticket-to-Resolution: Triage und Entwurf sind automatisierbar; das Eskalationsurteil nicht.
In jedem Fall sitzt das KI-Budget auf der vorderen Stufe und die Kapazitätsgrenze auf der hinteren.
Wie Sie Ihr schwächstes Glied an einem Nachmittag finden
Die Diagnose braucht kein neues Tooling. Nehmen Sie einen Prozess und schreiben Sie seine Stufen von Anfang bis Ende auf — sechs oder sieben sind typisch. Markieren Sie für jede Stufe zwei Dinge: ob KI sie in den letzten zwölf Monaten berührt hat, und wie die Warteschlange davor heute aussieht.
Das schwächste Glied ist fast immer die erste Stufe, die auf die erste Frage mit nein und auf die zweite mit wachsend antwortet. Meist ist es eine Stufe, die von ein oder zwei erfahrenen Personen besetzt ist, die schon vor alldem der Eskalationspunkt waren — genau deshalb hat niemand ihre Automatisierung vorgeschlagen, und genau deshalb kann sie kein zusätzliches Volumen aufnehmen.
Stellen Sie dann die Frage, die das Budgetgespräch neu rahmt: Was wäre es wert, wenn diese Stufe pro Woche 20 % mehr Einheiten verarbeiten würde? Vergleichen Sie das mit den Kosten der nächsten Tranche vorgelagerter Lizenzen. In den meisten Mid-Market-Pipelines ist der Vergleich nicht einmal knapp.
Unabhängige Belege sagen, dass diese Fehlausrichtung nahezu universell ist. Verhaltenstelemetrie über 120.620 Beschäftigte fand nur 2 % auf der Reifestufe Workflow-Integration — KI-Nutzung innerhalb eines neu gestalteten Prozesses statt als Nachschlagehilfe am Rand, während 27 % noch bei einfacher Recherche-Unterstützung stehen (ActivTrak Productivity Lab, 2026). Wenn 98 % der Adoption um den Prozess herum statt in ihm stattfinden, waren die nachgelagerten Stufen von Anfang an nie im Geltungsbereich.
Produktionsdaten zeigen dasselbe vom anderen Ende her. Eine Studie zu Agenten- versus Such-Nutzung fand gematchte Aufgaben in 36 statt 269 Minuten abgeschlossen, eine Zeitreduktion von 87 % — während die Folgearbeit nach oben in Verifikation und Erweiterung wanderte, statt zu verschwinden (Perplexity & HBS, arXiv, 2026). Die menschliche Arbeit ist nicht verschwunden. Sie ist auf die Stufe gewandert, die Sie nicht gemessen haben.
Das Tor, das Sie nicht finanziert haben, ist auch das teure
Zwei weitere Befunde machen die nachgelagerte Stufe schwerer zu ignorieren als ein bloßes Warteschlangenproblem.
Erstens kostet sie mehr als das Werkzeug. McKinsey QuantumBlacks Analyse der Stückkostenökonomie von Agenten ergab, dass bei einem Kundenservice-Agenten im Bankwesen Token-Kosten lediglich 20–25 % der variablen Laufkosten ausmachen, während menschliche Aufsicht 70–75 % ausmacht (McKinsey QuantumBlack, 2026). Die Stufe, die Ihr Business Case als kostenlosen Overhead behandelt, ist der Großteil der Laufkosten.
Zweitens degradiert sie unter Last. Eine Befragung von 2.500 Wissensarbeitern ergab, dass 42 % mehr Zeit mit der Überprüfung von KI-Output verbringen, als sie durch dessen Nutzung sparen, und 52 % regelmäßig KI-generierte Arbeit von Kolleginnen und Kollegen korrigieren (Adaptavist, 2026). Drücken Sie mehr Volumen durch eine unveränderte Review-Stufe, und die Prüfenden nehmen es als Nacharbeit auf — genau so wird aus einem vorgelagerten Gewinn von 240 % ein nachgelagerter von 30 %.
Das schwächste Glied ist also nicht bloß langsam. Es ist die Kostenstelle, und es ist bereits gesättigt.
Der ehrliche Einwand
Drei Grenzen, genannt, bevor jemand anders sie nennt.
Die Autoren haben eine offengelegte Beziehung zu einem Anbieter. Demirer und Musolff hatten beide Postdoc-Forschungspositionen bei Microsoft inne und arbeiten heute als bezahlte Forschungsberater für das Unternehmen — offengelegt auf dem Working Paper selbst. Der Befund läuft dem kommerziellen Interesse entgegen (er deckelt den beanspruchbaren Output-Effekt von Coding-Werkzeugen), und das ist die Richtung, die einen Interessenkonflikt weniger bedenklich macht. Notieren Sie es trotzdem.
Die Schätzungen haben sich zwischen den Fassungen bewegt, und das zählt für die Zitierweise. Die Fassung vom Mai 2026 berichtete eine kleinere Stichprobe und andere Koeffizienten; die Revision vom September 2026 berichtet mehr als 500.000 Entwickler, die Generationseffekte von 30/180/240 % und die Elastizität 0,23. Das Abschwächungsmuster hielt in beiden. Wenn Sie eine Zahl aus diesem Papier in einem Board Deck zitieren, zitieren Sie die aktuelle Revision und datieren Sie sie — Working Papers sind keine abgeschlossenen Ergebnisse, und zitierenswert sind die, deren Form die Revision überlebt.
Eine Branche ist nicht jede Branche. Software hat ungewöhnlich saubere Stufengrenzen und ungewöhnlich gute Telemetrie. Ihr Finanzabschluss oder Ihre Fulfilment-Kette kann auf jeder Stufe tiefere menschliche Beteiligung haben, was sowohl den vorgelagerten Gewinn als auch die Abschwächung stauchen würde. Die Richtung überträgt sich. Die Größenordnungen gehören Ihnen erst, wenn Sie sie messen.
Was in diesem Quartal zu entscheiden ist
Vier Schritte. Drei kosten nichts außer Aufmerksamkeit.
- Benennen Sie das letzte menschliche Tor in einem Prozess. Nicht den Prozessverantwortlichen — den konkreten Freigabe-, Prüf- oder Unterschriftsschritt, den jede Arbeitseinheit passieren muss, bevor sie als geliefert zählt. Wenn Sie ihn nicht in einem Satz benennen können, ist genau das der Befund.
- Messen Sie die beiden Stufen getrennt. Ihre heutige Kennzahl zählt fast sicher Aktivität auf der beschleunigten Stufe: erstellte Entwürfe, triagierte Tickets, erzeugte Angebote. Fügen Sie einen Zähler auf der Lieferstufe hinzu. Das Verhältnis der beiden ist Ihre Abschwächung — und die einzige Zahl in diesem Artikel, die tatsächlich von Ihrem Unternehmen handelt.
- Verschieben Sie das nächste Inkrement des KI-Budgets nach hinten. Wenn der Weak-Link-Befund in Ihrer Pipeline gilt, liegt der Grenzertrag einer weiteren vorgelagerten Lizenz nahe null, und der Grenzertrag der Toröffnung ist alles, was dieses Tor derzeit zurückhält. Das ist eine Umschichtung, keine Neuausgabe.
- Gestalten Sie das Tor neu, bevor Sie den Trichter verbreitern. Vorgelagertes Volumen gegen eine unveränderte Review-Stufe zu erhöhen, erzeugt Warteschlange und Nacharbeit, nicht Output. Drehen Sie die Reihenfolge um: erst das Tor in Ordnung bringen, dann das Volumen durchlassen.
Ihre KI-Produktivitätsgewinne sind real. Die Studie sagt es, in einem Maßstab, den kein interner Pilot je erreichen wird.
Sie stehen auch in einer Warteschlange hinter einem Menschen, den niemand budgetiert hat. Die Frage dieses Quartals lautet nicht, wie viel schneller Ihr Team Arbeit produzieren kann. Sie lautet, wie viel dieser Arbeit Ihre Organisation noch fertigstellen kann.