Scovai Scovai
AI & Operations 2026-09-14 1 min read

Stai ottimizzando il quarto più economico della tua spesa per gli agenti: McKinsey stima la supervisione umana al 70–75% del costo variabile di un agente AI

DSL

Dr. Sarah Liu

Stai ottimizzando il quarto più economico della tua spesa per gli agenti: McKinsey stima la supervisione umana al 70–75% del costo variabile di un agente AI

Calcola il costo di un agente per il servizio clienti nel settore bancario e la spesa in token arriva al 20-25 percento del suo costo variabile di esecuzione. La supervisione umana — esperti funzionali e di rischio che verificano il lavoro dell'agente — arriva al 70-75 percento (McKinsey QuantumBlack, 2026).

Stesso workflow. Stessa fattura. E quasi tutti i business case sugli agenti che ho letto quest'anno ottimizzano il numero più piccolo.

Selezione del modello, prompt caching, un livello di inferenza più economico per le chiamate a basso impatto: è lì che va l'attenzione tecnica, perché è lì che il costo è leggibile. Arriva ogni mese, voce per voce, attribuibile. La supervisione arriva come ore stipendiate dentro il centro di costo di qualcun altro, quindi non viene mai contabilizzata come costo dell'agente AI. Viene contabilizzata come il motivo per cui il pilota, silenziosamente, non è mai scalato.

Che cosa ha effettivamente quantificato McKinsey

La guida di QuantumBlack del 24 agosto 2026 all'economia dei workflow agentici fa una cosa che quasi tutte le analisi sugli agenti saltano: valuta il lavoro completato, non il software. Agenti, sistemi deterministici e le persone che revisionano l'output, tutto in un unico numero pienamente caricato.

Il caso di riferimento è l'apertura di un conto bancario. Il workflow impiega da cinque a sette agenti insieme a più sistemi deterministici, con due-quattro team di persone che forniscono supervisione. Il costo pienamente caricato per ogni onboarding completato scende da circa 50-150 dollari a circa 10-30 dollari (McKinsey QuantumBlack, 2026).

È un miglioramento di tre-cinque volte. Questa non è una tesi contro la redditività degli agenti. È una tesi sul fatto che stai monitorando la voce di costo sbagliata per capire se i tuoi rendono.

Per dare la scala: McKinsey colloca i workflow a singolo agente rivolti al cliente, in alcune banche, tra i 20.000 e i 30.000 dollari all'anno di esercizio, e un team multiagente tra i 100.000 e i 200.000 dollari. Queste cifre derivano dall'analisi McKinsey di ricerche pubbliche e prezzi pubblici, non da bilanci certificati dei clienti: tieni stretti i rapporti e larghi i valori assoluti.

Che cosa determina davvero il costo di un agente AI: il tasso di eccezione, non il modello

Nell'onboarding dei clienti bancari, McKinsey prevede che dal 10 al 20 percento delle esecuzioni agentiche venga revisionato da esperti di rischio e funzionali.

Quel tasso di revisione è tutta la partita, e vale la pena percorrere l'aritmetica con calma: l'esempio che segue è mio, non di McKinsey, ma gli input sono i loro.

Prendi un workflow con un tasso di revisione del 15% e 20 minuti di tempo esperto per revisione. Su 1.000 esecuzioni sono 50 ore di tempo funzionale senior. Porta il tasso di revisione al 5% e le stesse 1.000 esecuzioni costano circa 17 ore. Hai rimosso due terzi della voce costosa senza toccare un modello, un prompt o un contratto con un fornitore.

E nota chi sta facendo quella revisione. McKinsey specifica esperti funzionali e di rischio: le persone il cui giudizio il workflow esiste per proteggere, non un livello junior di QA che puoi coprire a basso costo. Il costo della supervisione è alto proprio perché una supervisione a basso costo non è supervisione; il revisore deve essere abbastanza senior da poter ribaltare la decisione dell'agente. Qualsiasi piano che presupponga di delegare verso il basso il livello di revisione è in realtà un piano per smettere di revisionare.

Ora confronta tutto questo con la leva che tutti tirano davvero. McKinsey identifica solo tre driver del costo dei token: qualità del modello, requisito di latenza e frequenza del compito. I prezzi di frontiera a inizio luglio 2026 erano circa 5 dollari per milione di token in input e 30 dollari per milione in output per un modello di fascia alta, contro 0,20 e 1,25 dollari per un modello leggero precedente. Uno scarto di venticinque volte, applicato a un quarto della fattura.

Ed ecco la trappola dentro l'ottimizzazione ovvia. Abbassi il modello per tagliare i token e alzi il tasso di errore. Un tasso di errore più alto alza il tasso di eccezione. Un tasso di eccezione più alto alza le ore di revisione, cioè i tre quarti. I risparmi sui token finanziano regolarmente un aumento di supervisione che nessuno misura, e il workflow diventa più costoso mentre la dashboard lo mostra più economico.

Perché le ore di revisione non spariscono

Esistono evidenze indipendenti che la voce supervisione sia strutturale e non un problema di maturità che si supera crescendo.

MIT Technology Review Insights e Microsoft hanno intervistato 300 dirigenti e professionisti tecnologici classificando 101 compiti agentici su una scala di fiducia 0-100. La fiducia seguiva la verificabilità del compito e la completezza del contesto di business, non la capacità del modello: la generazione automatica di report ha totalizzato 83,5 e il codice boilerplate 82,5, entrambi con un'unica metrica di valutazione oggettiva, mentre la configurazione di service mesh ha totalizzato 37,5 e i test di disaster recovery 43 — gli stessi modelli sottostanti, meno un modo pulito per capire se l'output fosse corretto. L'accountability preoccupava il 48% degli intervistati e le allucinazioni il 47%, e il 59% prevede già una supervisione umana permanente (MIT Technology Review Insights, 2026).

I dati di produzione puntano nella stessa direzione. Uno studio sul prodotto agentico di Perplexity confrontato con il suo prodotto di ricerca ha rilevato che il completamento di compiti equivalenti scendeva da 269 minuti a 36 — una riduzione dell'87% del tempo e del 94% del costo — mentre il lavoro di follow-up svolto dagli utenti si spostava verso l'alto, nella verifica e nell'estensione (arXiv 2606.07489, 2026).

Il lavoro umano si ricolloca nella fase di revisione. McKinsey è semplicemente la prima a mettere un prezzo su dove atterra.

Volume e riuso decidono se i conti tornano

L'altra metà dell'economia di McKinsey è il costo fisso, ed è la metà che determina se i programmi agentici del mid-market superano la soglia.

Un agente conversazionale che gestisce l'onboarding di 2.500 nuovi clienti l'anno costa 10.000-15.000 dollari. Raddoppia il volume e il costo sale solo a 15.000-20.000 dollari, perché l'infrastruttura AI e l'orchestrazione degli agenti sono in gran parte fisse, e i costi fissi si ammortizzano. Nota cosa c'è dentro quella voce di orchestrazione: capacità stabile di data science per mantenere l'agente in produzione, che secondo McKinsey "spesso ha bisogno di essere ritoccato ogni due giorni".

I workflow a basso volume perdono quindi due volte. Non ottengono ammortamento sul costo fisso, e il loro rapporto di supervisione resta alto perché non accumulano mai abbastanza esecuzioni perché qualcuno individui i pattern di eccezione e li progetti via.

La via d'uscita per il mid-market è il riuso, non la scala. Se nessun singolo workflow porta volume sufficiente ad ammortizzare la voce infrastruttura e orchestrazione, la domanda diventa quanti workflow possono girare su un'unica build di agente: l'impostazione di McKinsey è costruire una volta, distribuire su più workflow. Tre processi adiacenti che condividono un agente, un layer di contesto e un protocollo di revisione superano la soglia di costo fisso che nessuno di loro supera da solo. È una decisione di architettura che si prende prima del primo pilota, ed è molto difficile da applicare a posteriori una volta che tre team hanno comprato ciascuno la propria soluzione puntuale.

Questa asimmetria è visibile nei dati di adozione. Lo State of AI 2026 di McKinsey ha rilevato che le organizzazioni con oltre 1 miliardo di dollari di ricavi che scalano gli agenti sono passate dal 27% al 40%, mentre quelle sotto il miliardo sono rimaste ferme al 22%. Circa il 20% ha riferito che i costi operativi dell'AI hanno limitato il loro utilizzo, e la quota che attribuisce all'AI almeno un qualche impatto sull'EBIT si è fermata al 37%, invariata anno su anno (McKinsey, 2026).

L'adozione si accumula. L'impatto finanziario dichiarato no. È la firma di una voce di costo che nessuno sta governando.

L'obiezione onesta: qui si parla di banche, ed è una stima

Due avvertenze che è meglio tu senta da me e non dal tuo CFO.

Primo, il dato 70-75% deriva da servizi finanziari regolamentati e rivolti al cliente. L'intensità della supervisione è funzione dell'esposizione normativa e della conseguenza dell'errore. Lo smistamento interno dei ticket in un'azienda logistica da 200 persone sta su una curva diversa, e lì la ripartizione potrebbe essere più vicina alla parità.

Secondo, si tratta di costi modellati su prezzi pubblici e ricerche pubbliche, non di bilanci misurati in un incarico presso un cliente. Trattali come una stima ben specificata, non come una misurazione.

Ma osserva in quale direzione va l'errore. I prezzi dei token sono calati costantemente e continueranno a calare. Gli stipendi dei revisori no, e non lo faranno. Ogni mese che passa sposta il rapporto ancora più a sfavore dei token, non verso di essi. Se 70-75% è sbagliato per il tuo contesto oggi, la correzione onesta è chiedersi quanto diventerà tra diciotto mesi, non presumere che ricada su qualcosa che la dashboard dei token riesce a vedere.

Quantifica le ore di revisione prima di approvare il pilota

Cinque cose da cambiare nel modo in cui valuti la prossima proposta agentica.

  1. Metti il tasso di eccezione nel business case come numero esplicito. Percentuale di esecuzioni che richiedono revisione umana, minuti attesi per revisione, costo orario caricato del revisore. Se nessuno si impegna su queste tre cifre, non hai un business case: hai una demo con un budget attaccato.
  2. Ingegnerizza la verificabilità prima di allargare il perimetro. La classifica MIT–Microsoft mostra che la fiducia segue i compiti con un'unica metrica di successo leggibile. Quella proprietà è costruibile: strumenta la metrica, codifica il contesto di business, restringi il perimetro. Ordina i rilasci per verificabilità, non per quale compito sembri più semplice.
  3. Classifica i workflow candidati prima di tutto per numero di esecuzioni annue. Riuso e volume sono ciò che ammortizza il costo fisso. Un caso d'uso brillante a basso volume è un investimento peggiore di uno noioso ad alto volume, sempre.
  4. Metti a budget esplicitamente la voce manutenzione. Agenti ritoccati ogni due giorni richiedono capacità ingegneristica stabile. È un costo fisso permanente, non una spesa di progetto.
  5. Rendiconta il ROI del lavoro completato. Costo pienamente caricato per portare a termine il lavoro — persone, agenti e sistemi deterministici insieme — misurato contro il valore del lavoro. Non il costo per token, e non le ore teoricamente risparmiate.

La prescrizione di McKinsey è l'inverso dell'istinto: invece di ottimizzare la selezione del modello, riprogetta il workflow per tagliare i tassi di eccezione e semplificare i processi di revisione che innescano un intervento umano costoso. È un mandato di ingegneria di processo che siede dentro quella che tutti hanno trattato come una decisione di acquisto.

Che cosa decidere questo trimestre

Trova il pilota agentico che aspetta la tua firma e chiedi un numero che non è nella presentazione: ore di revisione attese ogni cento esecuzioni.

Se la risposta è un'alzata di spalle, non ti stanno chiedendo di approvare un software. Ti stanno chiedendo di mettere in organico un team di revisione che nessuno ha messo a budget — e di farlo sui tre quarti del costo di un agente AI che la tua dashboard non è mai stata costruita per mostrarti.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.