Scovai Scovai
AI & Operations 2026-09-17 1 min read

I log delle chat non sono uno studio sulla forza lavoro: un nuovo paper Fed-Harvard dice che il benchmark di utilizzo dell'AI sotto il tuo business case conta lavoro che le tue mansioni non contengono

DSL

Dr. Sarah Liu

I log delle chat non sono uno studio sulla forza lavoro: un nuovo paper Fed-Harvard dice che il benchmark di utilizzo dell'AI sotto il tuo business case conta lavoro che le tue mansioni non contengono

Più del 15% delle chat OpenAI viene classificato come "Edit written materials or documents". Solo il 2,4% dei lavoratori ha un'occupazione che contiene quel task in O*NET (Bick, Blandin, Deming & Schumacher, NBER, 2026). Quel divario sta dentro il benchmark di utilizzo dell'AI su cui poggiano gran parte dei piani operativi 2027.

Ora nella direzione opposta. Il singolo task che raccoglie la quota più alta di utilizzo di genAI in un'indagine rappresentativa a livello nazionale è "Direct organizational operations, activities, or procedures" — il 4,1% di tutti gli utilizzi dichiarati, svolto dal 43% dei lavoratori. La sua quota nei dati OpenAI è 0,0%. In quelli Microsoft, 0,0%. In quelli Anthropic, 0,2%.

Il lavoro più caratteristico delle operations è esattamente il lavoro che i log delle chat non riescono a vedere. Se il tuo piano AI 2027 è stato dimensionato su uno di quegli studi di utilizzo dei vendor — e la maggior parte dei piani mid-market lo è stata, perché quegli studi sono gratuiti, aggiornati ed enormi — stai leggendo una mappa da cui il tuo territorio è stato omesso.

Cosa ha fatto questa indagine che gli studi sulle chat non possono fare

Alexander Bick (Federal Reserve Bank of St. Louis), Adam Blandin (Vanderbilt), David Deming (Harvard Kennedy School) e Tyler Schumacher (Vanderbilt) hanno costruito il primo indice di adozione della genAI a livello di task partendo da un'indagine rappresentativa a livello nazionale invece che dalla telemetria di piattaforma (NBER Working Paper 35677, 2026).

Il meccanismo conta. Hanno messo insieme quattro ondate della Real-Time Population Survey — 13.920 rispondenti occupati tra i 18 e i 64 anni — e hanno collegato l'uso dichiarato di genAI di ciascuno alla sua occupazione dettagliata e alle specifiche attività lavorative ONET che quell'occupazione contiene davvero. Poiché conoscono il mestiere del rispondente, possono attribuire un utilizzo a un task dentro un'architettura di ruoli nota*.

Un classificatore di chat non può farlo. Legge il testo di una conversazione e in genere non ha idea di che lavoro faccia l'utente. Quindi fa l'unica cosa disponibile: assegna la chat a un titolo di task che descrive l'azione visibile. Editare. Raccogliere informazioni. Progettare un sistema.

Non è un difetto del classificatore di qualcuno. È un limite strutturale dell'input, e il paper lo dice esplicitamente: i classificatori di chat "possono essere predisposti ad assegnare le chat a titoli di task che descrivono azioni di base, generiche".

Quanto deriva il benchmark di utilizzo dell'AI

La conseguenza è una concentrazione estrema. Dieci task su 332 rappresentano il 53,0% dell'utilizzo nei dati OpenAI, il 46,0% in quelli Anthropic e il 60,8% in quelli Microsoft — contro il 22,2% nell'indagine (Bick et al., NBER, 2026). Il singolo task più grande prende rispettivamente il 15,1%, il 16,7% e il 23,2% dei tre dataset di chat, contro il 4,1% nell'indagine.

Poi il numero che dovrebbe chiudere il dibattito sul fatto che siano due sguardi sulla stessa realtà. La correlazione tra le quote di task dell'indagine e quelle dei dataset di chat è 0,11 per OpenAI, 0,34 per Anthropic e 0,10 per Microsoft. Due su tre sono statisticamente quasi scorrelate da come i lavoratori dichiarano di usare gli strumenti sui loro task reali.

L'errore di secondo ordine è quello dentro il tuo piano

La quota di utilizzo diretta non è di solito ciò che finisce in un business case. La catena è più lunga, e il paper la segue: le classificazioni chat-task vengono aggregate in quote di genAI per occupazione, e quelle quote circolano poi come proxy dell'esposizione all'AI per ruolo — l'input dietro la sequenza di rollout, i budget di formazione e le previsioni di organico. Gli autori nominano quattro misure pubblicate costruite così e concludono che quei proxy "sono probabilmente inaccurati e offrono una visione distorta".

Quindi quando una presentazione ti dice quali delle tue funzioni sono più esposte all'AI, chiedi da dove viene la classifica. Se risale ai log delle chat, eredita un classificatore che non ha mai saputo che lavoro facesse nessuno — e il suo errore caratteristico è sovrastimare il lavoro che sembra generico in una trascrizione.

Anche l'altro tuo input è più debole di quanto sembri

La correzione ovvia è abbandonare i benchmark di utilizzo e usare invece un vero punteggio di esposizione occupazionale. Il paper ha testato anche quello, contro i due indici più citati in letteratura.

Regredita sull'adozione effettiva, la misura di Eloundou et al. (2024) produce un R² corretto di 0,081 e quella di Felten et al. (2021) 0,086 — circa metà della varianza a livello di occupazione che è spiegabile (Bick et al., NBER, 2026). I punteggi sono realmente predittivi. Non sono neanche vicini a essere sufficienti.

E sotto c'è un vincolo più duro. L'occupazione in sé spiega meno del 20% della varianza nell'adozione a livello di singolo lavoratore (Bick et al., NBER, 2026). Qualunque cosa determini chi adotta davvero sta perlopiù dentro il titolo di ruolo, non tra titoli diversi. Due analisti nello stesso team, stessi strumenti, stessi task — uno ha ricostruito la propria settimana attorno allo strumento, l'altro lo apre due volte al mese.

È un problema di pianificazione con una forma precisa. Ogni allocazione che fai per ruolo — licenze, ore di formazione, sequenza di enablement — poggia su una variabile che spiega meno di un quinto del risultato che ti interessa.

Spiega anche uno schema che quasi tutti i responsabili operations hanno già visto e archiviato sotto un'altra voce. Una funzione torna dalla stessa sessione di enablement con risultati enormemente diversi; la lettura riflessa è motivazione, o qualità del manager, o resistenza al cambiamento. I dati sull'adozione dicono che gran parte di quella dispersione ci sarebbe stata comunque, perché è a livello di persona mentre l'intervento era a livello di ruolo. Rifare la sessione, con più insistenza, non la affronta.

"Ampia ma superficiale" è un'affermazione precisa, non una cautela

Il quadro di adozione che l'indagine produce è facile da citare male in entrambe le direzioni. La versione precisa:

  • A maggio 2026, il 45% dei lavoratori usa genAI per lavoro; gli autori lo trattano come un limite inferiore, perché gli usi incorporati e passivi spesso non vengono dichiarati.
  • Più dell'80% delle occupazioni e il 40% dei task mostrano un'adozione superiore al 20%.
  • Ma solo il 2,8% dei task supera il 50% di adozione, e nessuno supera il 70%.

Leggili insieme. Non esiste un task nell'economia americana in cui l'uso di genAI sia quasi universale. Le occupazioni che mostrano un'adozione molto alta — circa il 15% supera il 70% — ci arrivano non attraverso un singolo task saturo ma attraverso un insieme di task moderatamente adottati.

Dati indipendenti concordano sulla forma. Lo studio ATLAS di Google, costruito su 14,65 milioni di interazioni deidentificate invece che su autodichiarazioni, ha trovato che l'occupazione mediana usa Gemini su circa il 21% dei propri task, con un intento di automazione end-to-end sotto il 10% nelle conversazioni cognitive non routinarie (Google ATLAS v1.0, 2026). La telemetria comportamentale su 120.620 lavoratori colloca solo il 2% alla maturità di integrazione nel workflow — usare l'AI dentro un processo ridisegnato invece che come consultazione laterale (ActivTrak Productivity Lab, 2026).

Tre metodi, tre dataset, una conclusione: copertura ampia, penetrazione sottile. Il che significa che un piano che modella un ruolo esposto all'AI come un ruolo trasformato dall'AI sbaglia di quasi tutta la distanza.

La controargomentazione onesta

Tre limiti da tenere presenti.

Il dato del 2,4% è in parte un artefatto di ONET, e lo dicono gli autori stessi. Parole loro: "la quota di lavoratori che svolge editing è chiaramente molto più grande del 2,4%". ONET incorpora l'editing dentro task di ordine superiore come preparare report o redigere documenti legali. Quindi il divario tra 15% e 2,4% non è puro errore del classificatore — in parte è la tassonomia di riferimento che rinuncia a nominare un'attività che è davvero ovunque. La direzione della distorsione è ben stabilita; la magnitudine di una singola coppia di numeri è più fragile di quanto sembri.

Anche l'autodichiarazione ha i suoi modi di fallire. L'indagine sa cosa le persone dicono di fare con gli strumenti. I log delle chat sanno cosa è effettivamente passato dalla finestra, a una scala che nessuna indagine raggiungerà mai. Nessuno dei due è la verità di riferimento; rispondono a domande diverse, e il contributo del paper è mostrare quanto siano distanti le risposte, non dichiarare falsa una delle due.

Un'indagine nazionale non è la tua azienda. L'RPS descrive la forza lavoro statunitense. Il tuo inventario di task, il tuo stack di strumenti e il tuo disegno organizzativo non sono la media nazionale, e niente qui ti dice quali dei tuoi ruoli adotteranno.

Quest'ultimo limite è quello che conta davvero — e punta in una sola direzione. Ogni benchmark esterno in questo campo, da log di chat o da indagine, è un prior. Nessuno di essi è una misurazione della tua organizzazione.

Cosa decidere questo trimestre

Quattro mosse. Nessuna richiede nuova spesa.

  1. Risali alla fonte di ogni benchmark di utilizzo dell'AI presente nel tuo piano. Se un dato nasce da log di chat di piattaforma, segnalalo come prior direzionale, non come input a un modello di organico o di budget. È un audit da trenta minuti su un documento che hai già scritto.
  2. Costruisci un inventario di task per una sola funzione. Venti o trenta attività reali di un singolo team, scritte nel tuo linguaggio e non in quello di O*NET. È l'unico artefatto che ti permette di chiedere "lo strumento tocca questo?" invece di "questo ruolo è esposto?" — e sopravvive a ogni revisione dei benchmark dei vendor, perché descrive il tuo lavoro e non il traffico di qualcun altro. Metti a budget un pomeriggio con il team lead, non un incarico di consulenza.
  3. Smetti di allocare l'enablement per ruolo. Se l'occupazione spiega meno del 20% dell'adozione a livello di persona, un rollout basato sul ruolo è quasi un lancio di moneta. Alloca invece sull'uso osservato, e lascia che la prima coorte sia chi è già avanti nella tua telemetria.
  4. Metti il target sul task, non sulla licenza. Scegli un task di quell'inventario e portalo oltre il 50% di adozione. Meno di tre task su cento a livello nazionale hanno superato quella soglia — ed è esattamente per questo che superarla deliberatamente è un risultato difendibile da riportare.

Il tuo benchmark di utilizzo dell'AI ha risposto a una domanda che non avevi fatto: che aspetto hanno le chat. La domanda sulla tua scrivania è cosa fanno le tue persone tutto il giorno, e se lo strumento ne abbia raggiunto anche solo una parte.

Una di quelle domande ha una risposta pubblicata. L'altra ha solo la tua.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.