Scovai Scovai
AI & Operations 2026-09-16 1 min read

Tus extravertidos son el peor emparejamiento para una IA concienzuda: el nuevo experimento del MIT en PNAS dice que la persona de asistente que desplegaste para todos es una variable de rendimiento

DSL

Dr. Sarah Liu

Tus extravertidos son el peor emparejamiento para una IA concienzuda: el nuevo experimento del MIT en PNAS dice que la persona de asistente que desplegaste para todos es una variable de rendimiento

Empareja a 1.258 personas con agentes de IA, haz que produzcan 7.266 anuncios display y después haz que 1.168 evaluadores independientes puntúen el resultado. La peor combinación de todo el diseño no fue un modelo débil ni un usuario sin formación. Fueron los humanos extravertidos trabajando con una IA concienzuda (Ju & Aral, PNAS, 2026).

Concienzuda. El rasgo hacia el que cada proveedor calibra sus modelos por defecto: cuidadoso, minucioso, centrado en la tarea. Entregado a la persona equivocada, produjo el trabajo de menor calidad del experimento.

Ese es el hallazgo ante el que los equipos de operaciones del mid-market deberían detenerse, porque casi todos han hecho la apuesta contraria: una sola persona de asistente, configurada una vez, desplegada para todo el mundo. Este estudio es la primera evidencia causal a gran escala de que la persona en sí misma es una variable de rendimiento, y de que dejarla en el valor por defecto del proveedor es una decisión, no un estado neutral.

Qué midió realmente el experimento

Harang Ju (Johns Hopkins Carey Business School) y Sinan Aral (MIT Sloan, director de la MIT Initiative on the Digital Economy) realizaron un experimento aleatorizado preinscrito: se midió a 1.258 participantes en los rasgos Big Five y después se les emparejó aleatoriamente con agentes de IA instruidos para exhibir niveles altos o bajos, de forma independiente, de cada uno de esos mismos cinco rasgos (Ju & Aral, PNAS, 2026).

Los equipos disponían de 40 minutos, chat en tiempo real y herramientas sincronizadas de edición de texto e imagen para construir anuncios display destinados al informe anual de un think tank real. Producción: 7.266 anuncios. Esos anuncios fueron después puntuados en calidad de texto e imagen por 1.168 evaluadores independientes (MIT Sloan / EurekAlert, 2026).

Y llega la parte que convierte esto en algo más que un resultado de laboratorio. Los investigadores publicaron los anuncios en X durante dos semanas —casi cinco millones de impresiones— y midieron la tasa de clics y el coste por clic. La calidad puntuada predijo el rendimiento real: una mayor calidad de texto elevó la tasa de clics en torno a un 7 por ciento y redujo el coste por clic en unos 30 céntimos (MIT Sloan / EurekAlert, 2026).

Dos decisiones de diseño merecen énfasis, porque son las que separan este trabajo de los comentarios sobre personas de IA que ya circulan. Los niveles de los rasgos se asignaron aleatoriamente y se variaron de forma independiente, así que la comparación no es entre usuarios autoseleccionados de herramientas distintas: es causal. Y el estudio midió a los humanos con el mismo instrumento Big Five usado para instruir a los agentes, que es precisamente lo que hace estimable la interacción. La mayoría de la investigación de los proveedores informa de cómo se sienten los usuarios ante una persona. Esta informa de qué le hizo el emparejamiento al trabajo.

La cadena causal está, por tanto, completa de extremo a extremo. El emparejamiento de personas movió la calidad. La calidad movió el dinero.

La tabla de emparejamientos: qué combinaciones ayudaron y cuáles perjudicaron

Los resultados no se reducen a «empareja lo semejante con lo semejante», que es lo que casi todo el mundo asume antes de leerlos.

Los emparejamientos más fuertes fueron humanos extravertidos con IA extravertida, humanos concienzudos con IA concienzuda y humanos abiertos con IA concienzuda, este último un complemento, no un espejo (MIT Sloan / EurekAlert, 2026).

Los emparejamientos que degradaron significativamente la calidad, en el orden que da el artículo:

  1. Humanos extravertidos + IA concienzuda: la calidad más baja del estudio
  2. Humanos concienzudos + IA amable (agreeable)
  3. Humanos neuróticos + IA concienzuda

(Ju & Aral, PNAS, 2026)

Lee dos veces la segunda fila

La IA concienzuda aparece en dos de los tres peores emparejamientos y en dos de los tres mejores. En estos datos no existe una persona buena en términos absolutos. Un agente concienzudo entregado a una persona concienzuda estaba entre las mejores combinaciones disponibles; el mismo agente entregado a un extravertido era la peor. Configuración idéntica, resultado opuesto, determinado por completo por quién lo recibió.

Y fíjate en lo que la segunda fila le hace a la respuesta estándar del proveedor. La IA amable —servicial, complaciente, que nunca lleva la contraria— degradó la producción de las personas concienzudas. La persona más calibrada para la satisfacción del usuario resultó activamente perjudicial justo para la población que con más probabilidad hace tu trabajo más cuidadoso.

Por qué una única persona para toda la organización es un impuesto silencioso sobre el rendimiento

Aquí está la traducción operativa, y resulta incómoda precisamente porque corregirla no cuesta nada y nadie la está midiendo.

Cuando despliegas una única configuración de asistente entre 300 personas, no estás ejecutando un despliegue neutral. Estás ejecutando un experimento no aleatorizado en el que a una parte de tu plantilla se le ha entregado el emparejamiento que este estudio identificó como productor de los peores resultados, y ni ellos ni tú tenéis un instrumento capaz de detectarlo. El fallo aparece como borradores algo más flojos, algo más de retrabajo, una sensación difusa en ciertos equipos de que la herramienta «no es tan útil». Nunca aparece como una partida de coste.

Ese retrabajo aterriza en el lugar más caro. El desglose de costes de McKinsey QuantumBlack sobre flujos de trabajo agénticos en banca sitúa el gasto en tokens en el 20-25 por ciento del coste variable de ejecución de un agente, y la supervisión humana por parte de expertos funcionales y de riesgo en el 70-75 por ciento (McKinsey QuantumBlack, 2026). En esa estructura, la calidad de salida no es una métrica blanda. Cada punto de calidad que pierdes en la generación se paga a tarifa de revisión, por la persona sénior que hace la comprobación.

Y la comprobación no va a desaparecer. En el estudio de MIT Technology Review Insights y Microsoft con 300 directivos tecnológicos que clasificaron 101 tareas agénticas, el 59 por ciento ya prevé supervisión humana permanente, y la confianza sigue a la verificabilidad de la tarea más que a la capacidad bruta del modelo (MIT Technology Review Insights, 2026).

Un desajuste de persona no es, por tanto, una queja sobre la experiencia de usuario. Es un multiplicador silencioso sobre la mayor partida de coste de tu stack de IA.

La varianza ya está dentro del puesto

Si quieres evidencia de que esto es medible en tu propia empresa y no solo en un laboratorio, ya existe en los datos de adopción. Bick, Blandin, Deming y Schumacher, enlazando una encuesta representativa a nivel nacional con tareas detalladas de O*NET, hallaron que las medidas de exposición a la IA generativa explican solo alrededor de la mitad de la variación en la adopción entre trabajadores: personas que hacen el mismo trabajo, con las mismas herramientas, adoptan de forma sistemáticamente distinta (NBER Working Paper 35677, 2026).

La mitad de la varianza está dentro del puesto, no entre puestos. La mayoría de los equipos de operaciones lo archiva bajo motivación o formación. El resultado de PNAS ofrece una explicación menos halagadora y más accionable para parte de ello: la herramienta está configurada para una persona que no es quien la usa.

Ese replanteamiento cambia qué haces con un grupo de baja adopción. Enviar otra sesión de capacitación a un equipo que en silencio obtiene peores resultados del agente por defecto no ataca la causa: añade horas a personas cuyos borradores seguirán volviendo con más retrabajo que los de sus colegas.

La objeción honesta

Tres límites, y son importantes.

La tarea era creación publicitaria, no operaciones. Sesiones creativas de cuarenta minutos produciendo anuncios display no son tu cierre trimestral, tu onboarding de proveedores o tu triaje de tickets. Que el emparejamiento de personalidad moviera la calidad en una tarea creativa es un hallazgo; que la mueva en tus flujos de trabajo es una inferencia. Trátalo como una hipótesis sólida que conviene probar, no como un resultado cerrado.

Los autores tienen una posición comercial. Ju y Aral cofundaron Pairium, que construye y distribuye la plataforma de experimentación Pairit utilizada en el estudio (Ju & Aral, PNAS, 2026). El trabajo está preinscrito y revisado por pares en PNAS, lo que limita los fallos más evidentes, pero los investigadores que tienen el hallazgo también venden el remedio, y eso pertenece a tu lectura.

Emparejar a todo el mundo a la perfección tiene su propio coste. Trabajos de la misma literatura encuentran que unas personas de IA diversas mitigan el efecto de homogeneización en la ideación colaborativa humano-IA (Wan & Kalman, 2026). Optimiza cada emparejamiento para la calidad individual de la salida y puede que comprimas la varianza en el pensamiento de tus equipos: mejores borradores, borradores más parecidos. Si tu función necesita amplitud más que pulido, ese intercambio es real.

Nada de esto rescata al statu quo. La configuración por defecto no es una cobertura frente a estos límites; es la única opción que está garantizado que será errónea para una parte de tu plantilla, sin ningún dato que te diga qué parte.

Qué decidir este trimestre

Cuatro movimientos, ninguno exige nuevo gasto con proveedores.

  1. Deja de tratar la persona como configuración de IT. El system prompt del asistente es un parámetro de rendimiento con efectos medidos sobre la calidad de salida. Quien sea dueño de la habilitación de IA es su dueño, y debe justificar el ajuste actual.
  2. Ejecuta una prueba de emparejamiento en una función que ya produzca resultados evaluables. Contenido, respuestas de soporte, análisis de primer borrador. Dos personas, asignadas aleatoriamente, un trimestre, puntuaciones de calidad a ciegas. Estás replicando un diseño publicado a pequeña escala, y es la investigación más barata que encargarás nunca.
  3. Mira con más atención a tus extravertidos y a tu personal con alto neuroticismo en puestos de alto volumen. Son los dos perfiles humanos que el estudio señala frente al agente concienzudo por defecto. Si una persona visiblemente capaz obtiene poco de la herramienta en silencio, el desajuste pasa a ser una hipótesis viva y no un problema de formación.
  4. Ofrece elección de persona antes de construir la asignación de persona. Una asignación completa basada en rasgos requiere datos de personalidad que la mayoría de las empresas del mid-market no tiene y quizá no quiera tener. Dos o tres perfiles de asistente seleccionables capturan parte del efecto sin ninguna exposición en materia de gobernanza.

El emparejamiento de personalidad con la IA es ya una variable medida y con un precio asociado. Tú ya la estás fijando: una vez, globalmente, aceptando lo que el proveedor entregó.

La pregunta de este trimestre no es si la persona importa. PNAS ya ha respondido. Es si vas a seguir tomando esa decisión por defecto, para todos, y llamando al resultado culpa del modelo.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.