Gli agenti di coding autonomi hanno aumentato l'attività di commit degli sviluppatori del 240% cumulato. I rilasci — la fase in cui il software arriva al cliente — sono cresciuti del 30% (Demirer, Musolff & Yang, NBER, 2026). Stessi sviluppatori, stessi strumenti, stesso studio, stessa finestra temporale. Otto decimi del guadagno misurato non hanno mai varcato la porta dell'azienda.
Quel divario è la forma della maggior parte dei business case sull'AI scritti quest'anno. Il pilota strumenta la fase che lo strumento accelera. Nessuno strumenta la fase che governa la consegna, perché a quella fase non è associato alcun canone di licenza.
Il paper si intitola Writing Code vs. Shipping Code, e la distinzione contenuta nel titolo è l'intero risultato. I guadagni di produttività dell'AI sono reali, ampi e misurati a livello di singolo task. Arrivano al cliente pesantemente scontati.
Cosa vede uno studio su 500.000 sviluppatori che un pilota non può vedere
Mert Demirer (MIT Sloan), Leon Musolff e Liyuan Yang hanno abbinato la telemetria d'uso dell'AI a più di 500.000 sviluppatori GitHub con un disegno di event study appaiato, tracciando poi l'effetto lungo generazioni successive di strumenti (NBER Working Paper 35275, 2026).
I risultati per generazione meritano di essere tenuti separati, perché sono la parte che la maggior parte dei lettori vorrà citare:
- Autocomplete: +30% di effetto cumulato sui commit
- Agenti di coding interattivi: +180%
- Agenti di coding autonomi: +240%
Ogni generazione è un autentico salto di livello. Chi sostiene che gli strumenti agentici non muovano la produttività a livello di task sta discutendo contro un campione molto grande.
Poi l'attenuazione. Quell'effetto del 240% sui commit scende all'80% per il numero di progetti e al 30% per i rilasci effettivi. E quando gli autori sono usciti da GitHub per guardare a quattro grandi marketplace software, hanno trovato un netto aumento del numero di nuove app e nessun aumento dell'utilizzo complessivo.
Più codice scritto. Qualche progetto in più avviato. Un po' di più rilasciato. Nulla di più utilizzato.
Il risultato sui marketplace merita un peso a sé, perché esclude una lettura comoda. Una spiegazione basata solo sul collo di bottiglia prevederebbe un arretrato — output in attesa dietro un cancello, recuperabile una volta allargato il cancello. Ma le nuove app sono cresciute mentre l'utilizzo totale no, il che indica qualcosa oltre la fase di rilascio: il mercato ha assorbito più offerta senza generare più domanda. Una parte del guadagno mancante è in coda dietro la revisione umana. Una parte non sarebbe comunque mai diventata valore, perché più output di una cosa che nessuno ha chiesto non è output. Entrambe le letture dovrebbero rendere un operatore cauto verso un business case che converte la velocità sul task direttamente in ricavi.
Perché i guadagni di produttività dell'AI muoiono prima dell'ultima fase
La spiegazione degli autori è l'ipotesi dell'anello debole, ed è più antica e meglio consolidata di qualsiasi cosa specifica all'AI: in una catena produttiva a più fasi, l'output totale è governato dalla fase meno migliorata, non dalla media.
Scrivere codice è una fase. Revisione, test di integrazione, approvazione sulla sicurezza, autorizzazione al rilascio e deployment sono le altre — e nessuna generazione di strumenti di coding le ha toccate. Così il vincolo si è spostato. Non è scomparso: si è trasferito al primo cancello umano a valle dell'accelerazione.
Il numero dell'elasticità è l'argomento
Il paper ci mette sopra un coefficiente: un'elasticità di sostituzione stimata di 0,23 tra AI e lavoro umano (Demirer et al., NBER, 2026).
Va letto in modo piano. Un'elasticità bassa significa forte complementarità. L'AI e le persone a valle non sono sostituti in competizione per lo stesso lavoro: sono input che si richiedono a vicenda in proporzione approssimativa. Triplica l'uno senza toccare l'altro e non ottieni il triplo dell'output. Ottieni una coda.
È il numero da mettere davanti a chiunque abbia un piano che assume silenziosamente che un agente sufficientemente buono finirà per assorbire anche il revisore. La miglior stima disponibile dice l'opposto, e lo dice con un decimale.
La tua pipeline ha la stessa forma
Il software è il contesto, non il perimetro. La struttura che ha prodotto questo risultato — fasi sequenziali, lavoro accelerabile dalla macchina all'inizio, cancelli di giudizio umano alla fine — è la struttura di quasi ogni processo operativo in un'azienda da 50 a 500 FTE.
Order-to-cash: la generazione del preventivo è automatizzabile; l'approvazione del credito e la gestione delle eccezioni no. Hire-to-onboard: sourcing e screening sono automatizzabili; la decisione sull'offerta e i passaggi della prima settimana no. Ticket-to-resolution: triage e stesura sono automatizzabili; il giudizio sull'escalation no.
In ogni caso il budget AI sta sulla fase iniziale e il tetto di capacità sta su quella finale.
Come trovare il tuo anello debole in un pomeriggio
La diagnosi non richiede nuovi strumenti. Prendi un processo e scrivi le sue fasi dall'inizio alla fine — sei o sette è tipico. Per ogni fase segna due cose: se l'AI l'ha toccata negli ultimi dodici mesi, e che aspetto ha oggi la coda davanti a essa.
L'anello debole è quasi sempre la prima fase che risponde no alla prima domanda e in crescita alla seconda. Di solito sarà una fase presidiata da una o due persone senior che erano già il punto di escalation prima che tutto questo cominciasse, il che è esattamente il motivo per cui nessuno ne ha proposto l'automazione ed esattamente il motivo per cui non può assorbire più volume.
Poi fai la domanda che riformula la conversazione sul budget: se questa fase processasse il 20% di unità in più a settimana, quanto varrebbe? Confrontalo con il costo della prossima tranche di licenze a monte. Nella maggior parte delle pipeline mid-market il confronto non è nemmeno vicino.
Evidenze indipendenti dicono che questo disallineamento è quasi universale. La telemetria comportamentale su 120.620 lavoratori ha trovato solo il 2% al livello di maturità di integrazione nel workflow — uso dell'AI dentro un processo ridisegnato anziché come consultazione laterale, con il 27% ancora alla semplice assistenza alla ricerca (ActivTrak Productivity Lab, 2026). Se il 98% dell'adozione avviene attorno al processo anziché dentro, le fasi a valle non sono mai state nel perimetro fin dall'inizio.
I dati di produzione indicano lo stesso dal lato opposto. Uno studio su uso di agenti contro ricerca ha trovato task appaiati completati in 36 minuti contro 269, una riduzione di tempo dell'87% — mentre il lavoro successivo si è spostato verso l'alto, su verifica ed estensione, anziché sparire (Perplexity & HBS, arXiv, 2026). Il lavoro umano non se n'è andato. Si è spostato sulla fase che non stavi misurando.
Il cancello che non hai finanziato è anche quello costoso
Due ulteriori risultati rendono la fase a valle più difficile da ignorare di un semplice problema di code.
Primo, costa più dello strumento. L'analisi di McKinsey QuantumBlack sull'economia unitaria degli agenti ha trovato che per un agente di customer service bancario i costi dei token rappresentano appena il 20–25% dei costi variabili di esecuzione, mentre la supervisione umana pesa per il 70–75% (McKinsey QuantumBlack, 2026). La fase che il tuo business case tratta come overhead gratuito è la maggioranza del costo operativo.
Secondo, degrada sotto carico. Un'indagine su 2.500 knowledge worker ha trovato che il 42% passa più tempo a verificare l'output dell'AI di quanto ne risparmi usandola, e il 52% corregge regolarmente lavoro generato dall'AI prodotto da colleghi (Adaptavist, 2026). Spingi più volume attraverso una fase di revisione invariata e i revisori lo assorbono come rilavorazione — che è esattamente il modo in cui un guadagno a monte del 240% si converte in uno a valle del 30%.
Quindi l'anello debole non è solo lento. È il centro di costo, ed è già saturo.
Il contro-argomento onesto
Tre limiti, dichiarati prima che li dichiari qualcun altro.
Gli autori hanno una relazione dichiarata con un vendor. Demirer e Musolff hanno entrambi ricoperto in passato posizioni post-dottorato di ricerca in Microsoft e oggi lavorano come consulenti di ricerca retribuiti per l'azienda — dichiarato sul working paper stesso. Il risultato va contro l'interesse commerciale (mette un tetto all'effetto di output rivendicabile per gli strumenti di coding), che è la direzione che rende un conflitto meno preoccupante. Va comunque annotato.
Le stime si sono mosse tra le bozze, e questo conta per come le citi. La versione di maggio 2026 riportava un campione più piccolo e coefficienti diversi; la revisione di settembre 2026 riporta più di 500.000 sviluppatori, gli effetti generazionali 30/180/240% e l'elasticità 0,23. Lo schema di attenuazione ha tenuto in entrambe. Se citi una cifra di questo paper in una board deck, cita la revisione corrente e datala — i working paper non sono risultati definitivi, e quelli che vale la pena citare sono quelli la cui forma sopravvive alla revisione.
Un settore non è tutti i settori. Il software ha confini di fase insolitamente netti e una telemetria insolitamente buona. La tua chiusura contabile o la tua catena di fulfilment possono avere un coinvolgimento umano più profondo in ogni fase, il che comprimerebbe sia il guadagno a monte sia l'attenuazione. La direzione si trasferisce. Le grandezze non sono tue finché non le misuri.
Cosa decidere questo trimestre
Quattro mosse. Tre non costano nulla se non attenzione.
- Dai un nome all'ultimo cancello umano di un processo. Non il process owner — lo specifico passaggio di approvazione, revisione o firma che ogni unità di lavoro deve attraversare prima di contare come consegnata. Se non riesci a nominarlo in una frase, quello è il risultato.
- Misura le due fasi separatamente. La tua metrica attuale conta quasi certamente l'attività sulla fase accelerata: bozze prodotte, ticket smistati, preventivi generati. Aggiungi un contatore sulla fase di consegna. Il rapporto tra i due è la tua attenuazione, ed è l'unico numero in questo articolo che riguardi davvero la tua azienda.
- Sposta a valle il prossimo incremento di budget AI. Se il risultato dell'anello debole regge nella tua pipeline, il rendimento marginale di un'altra licenza a monte è vicino a zero e il rendimento marginale dello sbloccare il cancello è tutto ciò che quel cancello sta trattenendo. È una riallocazione, non nuova spesa.
- Ridisegna il cancello prima di allargare l'imbuto. Alzare il volume a monte contro una fase di revisione invariata produce coda e rilavorazione, non output. Metti la sequenza al contrario: sistema il cancello, poi lascia passare il volume.
I tuoi guadagni di produttività dell'AI sono reali. Lo studio lo dice, a una scala che nessun pilota interno raggiungerà mai.
E sono anche fermi in coda dietro una persona che nessuno ha messo a budget. La domanda per questo trimestre non è quanto più in fretta il tuo team può produrre lavoro. È quanto di quel lavoro la tua organizzazione riesce ancora a finire.