Scovai Scovai
AI & Operations 2026-09-17 1 min read

Registros de chat não são um estudo sobre a força de trabalho: um novo paper Fed-Harvard diz que o benchmark de uso de IA sob o seu business case contabiliza trabalho que os seus cargos não contêm

DSL

Dr. Sarah Liu

Registros de chat não são um estudo sobre a força de trabalho: um novo paper Fed-Harvard diz que o benchmark de uso de IA sob o seu business case contabiliza trabalho que os seus cargos não contêm

Mais de 15% dos chats da OpenAI são classificados como "Edit written materials or documents". Apenas 2,4% dos trabalhadores ocupam um cargo que contém essa tarefa no O*NET (Bick, Blandin, Deming & Schumacher, NBER, 2026). Essa lacuna está dentro do benchmark de uso de IA sobre o qual se apoiam a maior parte dos planos operacionais de 2027.

Agora na direção oposta. A tarefa isolada que concentra a maior fatia do uso de genAI numa pesquisa representativa a nível nacional é "Direct organizational operations, activities, or procedures" — 4,1% de todos os usos declarados, desempenhada por 43% dos trabalhadores. A sua fatia nos dados da OpenAI é 0,0%. Nos da Microsoft, 0,0%. Nos da Anthropic, 0,2%.

O trabalho mais característico de operações é exatamente o trabalho que os registros de chat não conseguem ver. Se o seu plano de IA para 2027 foi dimensionado a partir de um desses estudos de uso de fornecedores — e a maioria dos planos do mid-market foi, porque esses estudos são gratuitos, atuais e enormes — você está lendo um mapa do qual o seu próprio território foi retirado.

O que esta pesquisa fez e os estudos de chat não conseguem fazer

Alexander Bick (Federal Reserve Bank of St. Louis), Adam Blandin (Vanderbilt), David Deming (Harvard Kennedy School) e Tyler Schumacher (Vanderbilt) construíram o primeiro índice de adoção de genAI ao nível da tarefa a partir de uma pesquisa representativa a nível nacional, e não de telemetria de plataforma (NBER Working Paper 35677, 2026).

O mecanismo importa. Eles agruparam quatro ondas da Real-Time Population Survey — 13.920 respondentes ocupados entre 18 e 64 anos — e ligaram o uso declarado de genAI de cada pessoa à sua ocupação detalhada e às atividades de trabalho ONET que essa ocupação de facto contém. Como conhecem a profissão do respondente, conseguem atribuir um uso a uma tarefa dentro de uma arquitetura de cargos conhecida*.

Um classificador de chats não consegue fazer isso. Ele lê o texto de uma conversa e normalmente não faz ideia do que a pessoa faz profissionalmente. Então faz a única coisa disponível: atribui o chat a um título de tarefa que descreve a ação visível. Editar. Recolher informação. Desenhar um sistema.

Não é um defeito no classificador de ninguém. É um limite estrutural do insumo, e o paper nomeia isso sem rodeios: os classificadores de chat "podem estar predispostos a atribuir chats a títulos de tarefas que descrevem ações básicas e genéricas".

Quanto o benchmark de uso de IA se desvia

A consequência é uma concentração extrema. Dez tarefas em 332 respondem por 53,0% do uso nos dados da OpenAI, 46,0% nos da Anthropic e 60,8% nos da Microsoft — contra 22,2% na pesquisa (Bick et al., NBER, 2026). A maior tarefa isolada leva 15,1%, 16,7% e 23,2% dos três conjuntos de dados de chat respetivamente, contra 4,1% na pesquisa.

Depois o número que deveria encerrar o debate sobre se estes são dois olhares sobre a mesma realidade. A correlação entre as fatias de tarefas da pesquisa e as dos conjuntos de dados de chat é de 0,11 para a OpenAI, 0,34 para a Anthropic e 0,10 para a Microsoft. Duas das três são estatisticamente quase independentes do modo como os trabalhadores dizem usar as ferramentas nas suas tarefas reais.

O erro de segunda ordem é o que está no seu plano

A fatia de uso direta normalmente não é o que aterra num business case. A cadeia é mais longa, e o paper acompanha-a: as classificações chat-tarefa são agregadas em fatias de genAI por ocupação, e essas fatias circulam depois como aproximações da exposição à IA por função — o insumo por trás da sequência de rollout, dos orçamentos de formação e das previsões de headcount. Os autores nomeiam quatro medidas publicadas construídas assim e concluem que essas aproximações "são provavelmente imprecisas e oferecem uma visão distorcida".

Portanto, quando uma apresentação lhe disser quais das suas funções estão mais expostas à IA, pergunte de onde veio o ranking. Se ele remonta a registros de chat, herda um classificador que nunca soube qual era a profissão de ninguém — e o seu erro característico é sobrevalorizar o trabalho que parece genérico numa transcrição.

O seu outro insumo também é mais fraco do que aparenta

A correção óbvia é abandonar os benchmarks de uso e usar antes um índice sério de exposição ocupacional. O paper testou isso também, contra os dois índices mais citados da literatura.

Regredida sobre a adoção real, a medida de Eloundou et al. (2024) produz um R² ajustado de 0,081 e a de Felten et al. (2021) 0,086 — cerca de metade da variância ao nível da ocupação que é explicável (Bick et al., NBER, 2026). Os índices são genuinamente preditivos. Não estão perto de ser suficientes.

E por baixo há uma restrição mais dura. A ocupação em si explica menos de 20% da variância na adoção ao nível do trabalhador (Bick et al., NBER, 2026). O que determina quem realmente adota está sobretudo dentro do título do cargo, não entre títulos. Dois analistas na mesma equipa, mesmas ferramentas, mesmas tarefas — um reconstruiu a sua semana em torno da ferramenta e o outro abre-a duas vezes por mês.

É um problema de planeamento com uma forma concreta. Qualquer alocação que faça por função — licenças, horas de formação, sequência de capacitação — assenta numa variável que explica menos de um quinto do resultado que lhe interessa.

Também explica um padrão que a maioria dos responsáveis de operações já viu e arquivou sob outro rótulo. Uma função volta da mesma sessão de capacitação com resultados muito díspares; a leitura reflexa é motivação, qualidade do gestor ou resistência à mudança. Os dados de adoção dizem que grande parte dessa dispersão ia existir de qualquer maneira, porque é ao nível da pessoa enquanto a intervenção foi ao nível da função. Repetir a sessão, com mais insistência, não trata a causa.

"Ampla mas superficial" é uma afirmação precisa, não uma cautela

O retrato de adoção que a pesquisa produz é fácil de citar mal em qualquer das direções. A versão precisa:

  • Em maio de 2026, 45% dos trabalhadores usam genAI para trabalhar; os autores tratam isso como um limite inferior, porque usos embutidos e passivos frequentemente não são declarados.
  • Mais de 80% das ocupações e 40% das tarefas mostram adoção acima de 20%.
  • Mas apenas 2,8% das tarefas ultrapassam 50% de adoção, e nenhuma ultrapassa 70%.

Leia os três em conjunto. Não existe nenhuma tarefa na economia americana em que o uso de genAI seja quase universal. As ocupações que mostram adoção muito elevada — cerca de 15% passam dos 70% — chegam lá não por uma tarefa saturada mas por um conjunto de tarefas moderadamente adotadas.

Dados independentes concordam quanto à forma. O estudo ATLAS da Google, construído sobre 14,65 milhões de interações desidentificadas em vez de autodeclaração, encontrou a ocupação mediana a usar o Gemini em cerca de 21% das suas tarefas, com intenção de automação ponta a ponta abaixo de 10% das conversas cognitivas não rotineiras (Google ATLAS v1.0, 2026). Telemetria comportamental sobre 120.620 trabalhadores coloca apenas 2% na maturidade de integração no fluxo de trabalho — usar IA dentro de um processo redesenhado e não como consulta lateral (ActivTrak Productivity Lab, 2026).

Três métodos, três conjuntos de dados, uma conclusão: cobertura ampla, penetração fina. O que significa que um plano que modela um cargo exposto à IA como um cargo transformado pela IA erra quase toda a distância.

A objeção honesta

Três limites que vale a pena sustentar.

O número de 2,4% é em parte um artefacto do ONET, e os autores dizem-no. Palavras exatas: "a fatia de trabalhadores que faz edição é claramente muito maior do que 2,4%". O ONET embute a edição dentro de tarefas de ordem superior, como preparar relatórios ou redigir documentos jurídicos. Portanto a lacuna entre 15% e 2,4% não é puro erro de classificador — parte dela é uma taxonomia de referência que se recusa a nomear uma atividade que está genuinamente em toda a parte. A direção da distorção está bem estabelecida; a magnitude de qualquer par isolado de números é mais frágil do que parece.

A autodeclaração também tem os seus modos de falha. A pesquisa sabe o que as pessoas dizem que fazem com as ferramentas. Os registros de chat sabem o que efetivamente passou pela janela, a uma escala que nenhuma pesquisa alcançará. Nenhum dos dois é a verdade de base; respondem a perguntas diferentes, e o contributo do paper é mostrar quão distantes estão as respostas, não declarar uma delas falsa.

Uma pesquisa nacional não é a sua empresa. A RPS descreve a força de trabalho dos EUA. O seu inventário de tarefas, o seu stack de ferramentas e o seu desenho de cargos não são a média nacional, e nada aqui lhe diz quais dos seus cargos vão adotar.

Esse último limite é o que realmente importa — e aponta numa só direção. Todo benchmark externo neste campo, de registros de chat ou de pesquisa, é um prior. Nenhum deles é uma medição da sua organização.

O que decidir neste trimestre

Quatro movimentos. Nenhum exige gasto novo.

  1. Rastreie até à fonte cada benchmark de uso de IA presente no seu plano. Se um número nasce de registros de chat de plataforma, marque-o como prior direcional, não como insumo de um modelo de headcount ou de orçamento. É uma auditoria de trinta minutos sobre um documento que já escreveu.
  2. Construa um inventário de tarefas para uma única função. Vinte a trinta atividades reais de uma equipa, escritas na sua linguagem e não na do O*NET. É o único artefacto que lhe permite perguntar "a ferramenta toca isto?" em vez de "este cargo está exposto?" — e sobrevive a cada revisão dos benchmarks dos fornecedores, porque descreve o seu trabalho e não o tráfego de outra pessoa. Orçamente uma tarde com o líder da equipa, não um projeto de consultoria.
  3. Pare de alocar capacitação por função. Se a ocupação explica menos de 20% da adoção ao nível da pessoa, um rollout baseado na função aproxima-se de atirar uma moeda ao ar. Aloque em função do uso observado, e deixe que a primeira coorte seja quem já está à frente na sua própria telemetria.
  4. Ponha a meta na tarefa, não na licença. Escolha uma tarefa desse inventário e leve-a para além dos 50% de adoção. Menos de três em cada cem tarefas a nível nacional cruzaram essa linha — e é exatamente por isso que cruzá-la deliberadamente é um resultado defensável para reportar.

O seu benchmark de uso de IA respondeu a uma pergunta que nunca fez: qual o aspeto dos chats. A pergunta em cima da sua mesa é o que as suas pessoas fazem o dia inteiro, e se a ferramenta chegou a alguma parte disso.

Uma dessas perguntas tem resposta publicada. A outra só tem a sua.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.