Scovai Scovai
AI & Operations 2026-09-17 1 min read

Los registros de chat no son un estudio laboral: un nuevo paper Fed-Harvard dice que el benchmark de uso de IA bajo tu business case contabiliza trabajo que tus puestos no contienen

DSL

Dr. Sarah Liu

Los registros de chat no son un estudio laboral: un nuevo paper Fed-Harvard dice que el benchmark de uso de IA bajo tu business case contabiliza trabajo que tus puestos no contienen

Más del 15% de los chats de OpenAI se clasifican como "Edit written materials or documents". Solo el 2,4% de los trabajadores tiene una ocupación que contiene esa tarea en O*NET (Bick, Blandin, Deming & Schumacher, NBER, 2026). Esa brecha está dentro del benchmark de uso de IA sobre el que se apoyan la mayoría de los planes operativos de 2027.

Ahora en la dirección contraria. La tarea individual que concentra la mayor proporción de uso de genAI en una encuesta representativa a nivel nacional es "Direct organizational operations, activities, or procedures" — el 4,1% de todos los usos declarados, desempeñada por el 43% de los trabajadores. Su participación en los datos de OpenAI es del 0,0%. En los de Microsoft, 0,0%. En los de Anthropic, 0,2%.

El trabajo más característico de operaciones es exactamente el trabajo que los registros de chat no pueden ver. Si tu plan de IA para 2027 se dimensionó con uno de esos estudios de uso de proveedores — y la mayoría de los planes del mid-market lo hicieron, porque esos estudios son gratuitos, actuales y enormes — estás leyendo un mapa al que le falta tu propio territorio.

Lo que esta encuesta hizo y los estudios de chats no pueden hacer

Alexander Bick (Federal Reserve Bank of St. Louis), Adam Blandin (Vanderbilt), David Deming (Harvard Kennedy School) y Tyler Schumacher (Vanderbilt) construyeron el primer índice de adopción de genAI a nivel de tarea a partir de una encuesta representativa a nivel nacional, y no de telemetría de plataforma (NBER Working Paper 35677, 2026).

El mecanismo importa. Agruparon cuatro oleadas de la Real-Time Population Survey — 13.920 encuestados ocupados de entre 18 y 64 años — y vincularon el uso declarado de genAI de cada persona con su ocupación detallada y con las actividades laborales ONET que esa ocupación realmente contiene. Como conocen el oficio del encuestado, pueden atribuir un uso a una tarea dentro de una arquitectura de puestos conocida*.

Un clasificador de chats no puede hacer eso. Lee el texto de una conversación y normalmente no tiene idea de a qué se dedica el usuario. Así que hace lo único disponible: asigna el chat a un título de tarea que describe la acción visible. Editar. Reunir información. Diseñar un sistema.

No es un fallo del clasificador de nadie. Es un límite estructural del insumo, y el paper lo dice sin rodeos: los clasificadores de chats "pueden estar predispuestos a asignar los chats a títulos de tareas que describen acciones básicas y genéricas".

Cuánto se desvía el benchmark de uso de IA

La consecuencia es una concentración extrema. Diez tareas de 332 concentran el 53,0% del uso en los datos de OpenAI, el 46,0% en los de Anthropic y el 60,8% en los de Microsoft — frente al 22,2% en la encuesta (Bick et al., NBER, 2026). La tarea individual más grande se lleva el 15,1%, el 16,7% y el 23,2% de los tres conjuntos de datos de chat respectivamente, frente al 4,1% en la encuesta.

Luego el número que debería cerrar el debate sobre si estas son dos miradas a una misma realidad. La correlación entre las participaciones de tareas de la encuesta y las de los conjuntos de datos de chat es de 0,11 para OpenAI, 0,34 para Anthropic y 0,10 para Microsoft. Dos de las tres son estadísticamente casi independientes de cómo los trabajadores dicen usar las herramientas en sus tareas reales.

El error de segundo orden es el que está en tu plan

La cuota de uso directa no suele ser lo que aterriza en un business case. La cadena es más larga, y el paper la sigue: las clasificaciones chat-tarea se agregan en cuotas de genAI por ocupación, y esas cuotas circulan después como aproximaciones de la exposición a la IA por rol — el insumo detrás de la secuencia de despliegue, los presupuestos de formación y las previsiones de plantilla. Los autores nombran cuatro medidas publicadas construidas así y concluyen que esas aproximaciones "probablemente sean inexactas y ofrezcan una visión distorsionada".

Así que cuando una presentación te diga qué funciones están más expuestas a la IA, pregunta de dónde sale el ranking. Si se remonta a registros de chat, hereda un clasificador que nunca supo a qué se dedicaba nadie — y su error característico es sobrevalorar el trabajo que parece genérico en una transcripción.

Tu otro insumo también es más débil de lo que aparenta

La corrección obvia es abandonar los benchmarks de uso y usar en su lugar un índice serio de exposición ocupacional. El paper también probó eso, contra los dos índices más citados de la literatura.

Regresada sobre la adopción real, la medida de Eloundou et al. (2024) arroja un R² ajustado de 0,081 y la de Felten et al. (2021) de 0,086 — aproximadamente la mitad de la varianza a nivel de ocupación que es explicable (Bick et al., NBER, 2026). Los índices son genuinamente predictivos. No están cerca de ser suficientes.

Y debajo hay una restricción más dura. La ocupación en sí explica menos del 20% de la varianza en la adopción a nivel de trabajador (Bick et al., NBER, 2026). Lo que determina quién adopta realmente está sobre todo dentro del título del puesto, no entre títulos. Dos analistas del mismo equipo, mismas herramientas, mismas tareas — uno ha reconstruido su semana alrededor de la herramienta y el otro la abre dos veces al mes.

Es un problema de planificación con una forma concreta. Cualquier asignación que hagas por rol — licencias, horas de formación, secuencia de habilitación — se apoya en una variable que explica menos de una quinta parte del resultado que te importa.

También explica un patrón que la mayoría de los responsables de operaciones ya ha visto y archivado bajo otra cosa. Una función vuelve de la misma sesión de habilitación con resultados enormemente dispares; la lectura refleja es motivación, calidad del manager o resistencia al cambio. Los datos de adopción dicen que buena parte de esa dispersión iba a estar ahí de todos modos, porque es de nivel persona y la intervención fue de nivel rol. Repetir la sesión, con más insistencia, no ataca la causa.

"Amplia pero superficial" es una afirmación precisa, no una cautela

El panorama de adopción que produce la encuesta es fácil de citar mal en cualquiera de las dos direcciones. La versión precisa:

  • A mayo de 2026, el 45% de los trabajadores usa genAI para trabajar; los autores lo tratan como una cota inferior, porque los usos integrados y pasivos a menudo no se declaran.
  • Más del 80% de las ocupaciones y el 40% de las tareas muestran una adopción superior al 20%.
  • Pero solo el 2,8% de las tareas supera el 50% de adopción, y ninguna supera el 70%.

Léelos juntos. No hay ninguna tarea en la economía estadounidense donde el uso de genAI sea casi universal. Las ocupaciones que sí muestran una adopción muy alta — alrededor del 15% supera el 70% — llegan ahí no por una tarea saturada sino por un conjunto de tareas moderadamente adoptadas.

Datos independientes coinciden en la forma. El estudio ATLAS de Google, construido sobre 14,65 millones de interacciones desidentificadas en lugar de autodeclaraciones, encontró que la ocupación mediana usa Gemini en alrededor del 21% de sus tareas, con una intención de automatización de extremo a extremo por debajo del 10% de las conversaciones cognitivas no rutinarias (Google ATLAS v1.0, 2026). La telemetría conductual sobre 120.620 trabajadores sitúa solo al 2% en madurez de integración en el flujo de trabajo — usar IA dentro de un proceso rediseñado y no como una consulta lateral (ActivTrak Productivity Lab, 2026).

Tres métodos, tres conjuntos de datos, una conclusión: cobertura amplia, penetración delgada. Lo que significa que un plan que modela un rol expuesto a la IA como un rol transformado por la IA se equivoca en casi toda la distancia.

La objeción honesta

Tres límites que conviene sostener.

La cifra del 2,4% es en parte un artefacto de ONET, y los autores lo dicen. Sus palabras exactas: "la proporción de trabajadores que realiza edición es claramente mucho mayor que el 2,4%". ONET incrusta la edición dentro de tareas de orden superior como preparar informes o redactar documentos legales. Así que la brecha entre el 15% y el 2,4% no es puro error del clasificador — parte de ella es una taxonomía de referencia que renuncia a nombrar una actividad que está genuinamente en todas partes. La dirección de la distorsión está bien establecida; la magnitud de cualquier par concreto de números es más frágil de lo que parece.

La autodeclaración también tiene sus modos de fallo. La encuesta sabe lo que la gente dice que hace con las herramientas. Los registros de chat saben lo que realmente pasó por la ventana, a una escala que ninguna encuesta alcanzará jamás. Ninguno es la verdad de base; responden a preguntas distintas, y la aportación del paper es mostrar cuán lejos están las respuestas, no declarar falsa a una de ellas.

Una encuesta nacional no es tu empresa. La RPS describe a la población activa estadounidense. Tu inventario de tareas, tu stack de herramientas y tu diseño organizativo no son la media nacional, y nada de esto te dice cuáles de tus roles van a adoptar.

Ese último límite es el que de verdad importa — y apunta en una sola dirección. Todo benchmark externo en este campo, de registros de chat o de encuesta, es un prior. Ninguno es una medición de tu organización.

Qué decidir este trimestre

Cuatro movimientos. Ninguno exige gasto nuevo.

  1. Rastrea hasta su fuente cada benchmark de uso de IA que haya en tu plan. Si una cifra nace de registros de chat de plataforma, márcala como prior direccional, no como insumo de un modelo de plantilla o presupuesto. Es una auditoría de treinta minutos sobre un documento que ya has escrito.
  2. Construye un inventario de tareas para una sola función. Veinte o treinta actividades reales de un único equipo, escritas en tu lenguaje y no en el de O*NET. Es el único artefacto que te permite preguntar "¿la herramienta toca esto?" en lugar de "¿este rol está expuesto?" — y sobrevive a cada revisión de los benchmarks de proveedores, porque describe tu trabajo y no el tráfico de otro. Presupuesta una tarde con el responsable del equipo, no un encargo de consultoría.
  3. Deja de asignar habilitación por rol. Si la ocupación explica menos del 20% de la adopción a nivel de persona, un despliegue basado en el rol se acerca a lanzar una moneda. Asigna en función del uso observado, y deja que la primera cohorte sea quien ya va por delante en tu propia telemetría.
  4. Pon el objetivo en la tarea, no en la licencia. Elige una tarea de ese inventario y llévala más allá del 50% de adopción. Menos de tres de cada cien tareas a nivel nacional han cruzado esa línea — y por eso exactamente cruzarla deliberadamente es un resultado defendible que reportar.

Tu benchmark de uso de IA respondió a una pregunta que nunca hiciste: qué aspecto tienen los chats. La pregunta que está sobre tu mesa es qué hace tu gente todo el día, y si la herramienta ha llegado a alguna parte de ello.

Una de esas preguntas tiene respuesta publicada. La otra solo tiene la tuya.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.