Scovai Scovai
AI & Operations 2026-09-16 1 min read

I tuoi estroversi sono l'abbinamento peggiore per un'AI coscienziosa: il nuovo esperimento PNAS del MIT dice che la persona assistente distribuita a tutti è una variabile di performance

DSL

Dr. Sarah Liu

I tuoi estroversi sono l'abbinamento peggiore per un'AI coscienziosa: il nuovo esperimento PNAS del MIT dice che la persona assistente distribuita a tutti è una variabile di performance

Abbina 1.258 persone ad agenti AI, falle produrre 7.266 annunci display, poi fai valutare i risultati da 1.168 valutatori indipendenti. La combinazione peggiore dell'intero disegno sperimentale non è stata un modello debole o un utente non formato. Sono stati gli esseri umani estroversi al lavoro con un'AI coscienziosa (Ju & Aral, PNAS, 2026).

Coscienziosa. Il tratto verso cui ogni fornitore tara i propri modelli per impostazione predefinita — attenta, scrupolosa, focalizzata sul compito. Assegnata alla persona sbagliata, ha prodotto il lavoro di qualità più bassa dell'esperimento.

È questo il risultato su cui i team operativi del mid-market dovrebbero fermarsi a riflettere, perché quasi tutti hanno fatto la scommessa opposta: una sola persona assistente, configurata una volta, distribuita a chiunque. Questo studio è la prima evidenza causale su larga scala che la persona stessa è una variabile di performance — e che lasciarla sull'impostazione predefinita del fornitore è una decisione, non uno stato neutro.

Che cosa ha misurato davvero l'esperimento

Harang Ju (Johns Hopkins Carey Business School) e Sinan Aral (MIT Sloan, direttore della MIT Initiative on the Digital Economy) hanno condotto un esperimento randomizzato preregistrato: 1.258 partecipanti sono stati misurati sui tratti Big Five, poi abbinati casualmente ad agenti AI istruiti a esibire livelli alti o bassi, in modo indipendente, di ciascuno di quegli stessi cinque tratti (Ju & Aral, PNAS, 2026).

I team avevano 40 minuti, chat in tempo reale e strumenti sincronizzati di editing di testo e immagini per costruire annunci display per il rapporto annuale di un think tank reale. Output: 7.266 annunci. Quegli annunci sono stati poi valutati su qualità del testo e dell'immagine da 1.168 valutatori indipendenti (MIT Sloan / EurekAlert, 2026).

Poi la parte che rende tutto questo più di un risultato di laboratorio. I ricercatori hanno pubblicato gli annunci su X per due settimane — quasi cinque milioni di impression — misurando click-through rate e costo per clic. La qualità rilevata ha predetto la performance di mercato: una qualità del testo più alta ha aumentato il click-through di circa il 7 percento e ridotto il costo per clic di circa 30 centesimi (MIT Sloan / EurekAlert, 2026).

Due scelte di disegno meritano enfasi, perché sono ciò che separa questo lavoro dai commenti sulle persone AI già in circolazione. I livelli dei tratti sono stati assegnati casualmente e fatti variare in modo indipendente, quindi il confronto non è tra utenti auto-selezionati di strumenti diversi: è causale. E lo studio ha misurato gli esseri umani con lo stesso strumento Big Five usato per istruire gli agenti, ed è questo a rendere stimabile l'interazione. La maggior parte della ricerca dei fornitori riporta come gli utenti si sentono rispetto a una persona. Questa riporta che cosa l'abbinamento ha fatto al lavoro.

Quindi la catena causale è completa dall'inizio alla fine. L'abbinamento delle persone ha mosso la qualità. La qualità ha mosso il denaro.

La tabella degli abbinamenti: quali combinazioni hanno aiutato, quali hanno danneggiato

I risultati non si riducono a "abbina il simile con il simile", che è ciò che quasi tutti danno per scontato prima di leggerli.

Gli abbinamenti più forti sono stati esseri umani estroversi con AI estroversa, esseri umani coscienziosi con AI coscienziosa ed esseri umani aperti con AI coscienziosa — quest'ultimo un complemento, non uno specchio (MIT Sloan / EurekAlert, 2026).

Gli abbinamenti che hanno degradato significativamente la qualità, nell'ordine in cui il paper li riporta:

  1. Esseri umani estroversi + AI coscienziosa — la qualità più bassa dello studio
  2. Esseri umani coscienziosi + AI accomodante (agreeable)
  3. Esseri umani nevrotici + AI coscienziosa

(Ju & Aral, PNAS, 2026)

Rileggi due volte la seconda riga

L'AI coscienziosa compare in due dei tre abbinamenti peggiori e in due dei tre migliori. In questi dati non esiste una persona buona in assoluto. Un agente coscienzioso affidato a una persona coscienziosa era tra le combinazioni migliori disponibili; lo stesso agente affidato a un estroverso era la peggiore. Configurazione identica, risultato opposto, determinato interamente da chi l'ha ricevuta.

E nota che cosa fa la seconda riga alla risposta standard dei fornitori. L'AI accomodante — disponibile, compiacente, che non contraddice mai — ha degradato l'output delle persone coscienziose. La persona più tarata sulla soddisfazione dell'utente è risultata attivamente inutile proprio per la popolazione che con maggiore probabilità svolge il tuo lavoro più accurato.

Perché un'unica persona valida per tutta l'organizzazione è una tassa silenziosa sulla performance

Ecco la traduzione operativa, ed è scomoda proprio perché correggerla non costa nulla e nessuno la sta misurando.

Quando distribuisci un'unica configurazione dell'assistente a 300 persone, non stai conducendo un rollout neutro. Stai conducendo un esperimento non randomizzato in cui a una parte della tua forza lavoro è stato consegnato l'abbinamento che questo studio ha individuato come produttore dei risultati peggiori — e né loro né tu avete uno strumento capace di rilevarlo. Il fallimento si manifesta come bozze leggermente più deboli, un po' più di rilavorazione, una vaga sensazione in certi team che lo strumento "non sia così utile". Non compare mai come voce di costo.

Quella rilavorazione atterra nel punto più costoso. L'analisi dei costi di McKinsey QuantumBlack sui flussi di lavoro agentici bancari colloca la spesa in token al 20-25 percento del costo variabile di esecuzione di un agente, e la supervisione umana da parte di esperti funzionali e di rischio al 70-75 percento (McKinsey QuantumBlack, 2026). In quella struttura la qualità dell'output non è una metrica soft. Ogni punto di qualità perso in generazione viene ripagato a tariffa di revisione, dalla persona senior che fa il controllo.

E il controllo non sparirà. Nello studio di MIT Technology Review Insights e Microsoft su 300 dirigenti tecnologici che hanno classificato 101 compiti agentici, il 59 percento prevede già una supervisione umana permanente, con la fiducia che segue la verificabilità del compito più che la capacità grezza del modello (MIT Technology Review Insights, 2026).

Un disallineamento della persona non è quindi un reclamo sull'esperienza d'uso. È un moltiplicatore silenzioso sulla voce di costo più grande del tuo stack AI.

La varianza è già dentro il ruolo

Se vuoi prove che questo sia misurabile nella tua azienda e non solo in laboratorio, esistono già nei dati di adozione. Bick, Blandin, Deming e Schumacher, collegando un'indagine rappresentativa a livello nazionale a compiti O*NET dettagliati, hanno rilevato che le misure di esposizione alla AI generativa spiegano solo circa metà della variazione nell'adozione tra i lavoratori — persone che fanno lo stesso lavoro, con gli stessi strumenti, adottano in modo sistematicamente diverso (NBER Working Paper 35677, 2026).

Metà della varianza sta dentro il ruolo, non tra ruoli diversi. La maggior parte dei team operativi la archivia sotto motivazione o formazione. Il risultato PNAS offre una spiegazione meno lusinghiera e più azionabile per una parte di essa: lo strumento è configurato per una persona che non è quella che lo sta usando.

Questo riposizionamento cambia ciò che fai con un gruppo a bassa adozione. Mandare l'ennesima sessione di abilitazione a un team che sta silenziosamente ottenendo output peggiori dall'agente predefinito non affronta la causa — aggiunge ore a persone le cui bozze torneranno comunque a richiedere più rilavorazione di quelle dei colleghi.

L'obiezione onesta

Tre limiti, e contano.

Il compito era creazione di annunci, non operations. Sessioni creative da quaranta minuti che producono annunci display non sono la tua chiusura trimestrale, il tuo onboarding fornitori o il tuo triage dei ticket. Che l'abbinamento della personalità abbia mosso la qualità in un compito creativo è un risultato; che la muova nei tuoi flussi di lavoro è un'inferenza. Trattalo come un forte indizio da testare, non come un fatto acquisito.

Gli autori hanno una posizione commerciale. Ju e Aral hanno cofondato Pairium, che costruisce e distribuisce la piattaforma di sperimentazione Pairit usata nello studio (Ju & Aral, PNAS, 2026). Il lavoro è preregistrato e sottoposto a revisione paritaria su PNAS, il che limita i fallimenti più ovvi — ma i ricercatori che hanno il risultato vendono anche il rimedio, e questo va incluso nella tua lettura.

Abbinare tutti alla perfezione ha un costo suo. Lavori nella stessa letteratura rilevano che persone AI diversificate mitigano l'effetto di omogeneizzazione nell'ideazione collaborativa uomo-AI (Wan & Kalman, 2026). Ottimizza ogni abbinamento per la qualità individuale dell'output e potresti comprimere la varianza nel pensiero dei tuoi team — bozze migliori, bozze più simili. Se la tua funzione ha bisogno di ampiezza più che di rifinitura, quel compromesso è reale.

Nulla di tutto ciò salva lo status quo. La configurazione predefinita non è una copertura contro questi limiti; è l'unica opzione garantita per essere sbagliata per una parte della tua forza lavoro, senza alcun dato che ti dica quale parte.

Che cosa decidere questo trimestre

Quattro mosse, nessuna che richieda nuova spesa verso i fornitori.

  1. Smetti di trattare la persona come configurazione IT. Il system prompt dell'assistente è un parametro di performance con effetti misurati sulla qualità dell'output. Chi possiede l'abilitazione AI lo possiede — e deve giustificare l'impostazione attuale.
  2. Esegui un test di abbinamento su una funzione che già produce output valutabile. Contenuti, risposte di supporto, analisi di primo livello. Due persone, assegnate casualmente, un trimestre, valutazioni di qualità in cieco. Stai replicando un disegno pubblicato su piccola scala, ed è la ricerca più economica che commissionerai mai.
  3. Guarda con più attenzione ai tuoi estroversi e al personale ad alto nevroticismo nei ruoli ad alto output. Sono i due profili umani che lo studio ha segnalato come critici con l'agente coscienzioso predefinito. Se una persona visibilmente capace sta silenziosamente ottenendo poco dallo strumento, il disallineamento è ora un'ipotesi viva, non un problema di formazione.
  4. Offri la scelta della persona prima di costruire l'assegnazione della persona. Un'allocazione completa basata sui tratti richiede dati di personalità che la maggior parte delle aziende mid-market non possiede e potrebbe non voler possedere. Due o tre profili di assistente selezionabili catturano parte dell'effetto senza alcuna esposizione di governance.

L'abbinamento di personalità con l'AI è ora una variabile misurata con un prezzo attaccato. La stai già impostando — una volta, globalmente, accettando ciò che il fornitore ha consegnato.

La domanda per questo trimestre non è se la persona conti. PNAS ha risposto. È se continuerai a prendere quella decisione per impostazione predefinita, per tutti, chiamando poi il risultato colpa del modello.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.