Scovai Scovai
AI & Operations 2026-09-17 1 min read

Les journaux de conversation ne sont pas une étude sur le travail : un nouveau papier Fed-Harvard affirme que le benchmark d'usage de l'IA sous votre business case compte du travail que vos postes ne contiennent pas

DSL

Dr. Sarah Liu

Les journaux de conversation ne sont pas une étude sur le travail : un nouveau papier Fed-Harvard affirme que le benchmark d'usage de l'IA sous votre business case compte du travail que vos postes ne contiennent pas

Plus de 15 % des conversations OpenAI sont classées comme « Edit written materials or documents ». Seuls 2,4 % des travailleurs occupent un métier qui contient cette tâche dans O*NET (Bick, Blandin, Deming & Schumacher, NBER, 2026). Cet écart se loge au cœur du benchmark d'usage de l'IA sur lequel reposent la plupart des plans opérationnels 2027.

Maintenant dans l'autre sens. La tâche qui capte la plus grande part d'usage de la genAI dans une enquête représentative à l'échelle nationale est « Direct organizational operations, activities, or procedures » — 4,1 % de tous les usages déclarés, exercée par 43 % des travailleurs. Sa part dans les données OpenAI est de 0,0 %. Chez Microsoft, 0,0 %. Chez Anthropic, 0,2 %.

Le travail le plus caractéristique des opérations est précisément celui que les journaux de conversation ne voient pas du tout. Si votre plan IA 2027 a été dimensionné à partir de l'une de ces études d'usage éditeur — et c'est le cas de la plupart des plans mid-market, parce que ces études sont gratuites, récentes et massives — vous lisez une carte dont votre propre territoire a été retiré.

Ce que cette enquête fait et que les études de conversations ne peuvent pas faire

Alexander Bick (Federal Reserve Bank of St. Louis), Adam Blandin (Vanderbilt), David Deming (Harvard Kennedy School) et Tyler Schumacher (Vanderbilt) ont construit le premier indice d'adoption de la genAI au niveau des tâches à partir d'une enquête représentative à l'échelle nationale, et non de la télémétrie d'une plateforme (NBER Working Paper 35677, 2026).

Le mécanisme compte. Ils ont regroupé quatre vagues de la Real-Time Population Survey — 13 920 répondants en emploi, âgés de 18 à 64 ans — et relié l'usage déclaré de genAI de chacun à son métier détaillé et aux activités de travail ONET que ce métier contient réellement. Parce qu'ils connaissent le métier du répondant, ils peuvent rattacher un usage à une tâche à l'intérieur d'une architecture de postes connue*.

Un classifieur de conversations ne peut pas faire cela. Il lit le texte d'un échange et ignore généralement ce que fait l'utilisateur dans la vie. Il fait donc la seule chose possible : il assigne la conversation à un intitulé de tâche décrivant l'action visible. Éditer. Rechercher de l'information. Concevoir un système.

Ce n'est pas un défaut du classifieur de qui que ce soit. C'est une limite structurelle de l'entrée, et le papier le dit sans détour : les classifieurs de conversations « peuvent être prédisposés à assigner les conversations à des intitulés de tâches décrivant des actions élémentaires et génériques ».

L'ampleur de la dérive du benchmark d'usage de l'IA

La conséquence est une concentration extrême. Dix tâches sur 332 représentent 53,0 % de l'usage dans les données OpenAI, 46,0 % chez Anthropic et 60,8 % chez Microsoft — contre 22,2 % dans l'enquête (Bick et al., NBER, 2026). La plus grande tâche isolée capte respectivement 15,1 %, 16,7 % et 23,2 % des trois jeux de données de conversations, contre 4,1 % dans l'enquête.

Puis le chiffre qui devrait clore le débat sur l'idée qu'il s'agirait de deux regards sur une même réalité. La corrélation entre les parts de tâches de l'enquête et celles des jeux de données de conversations est de 0,11 pour OpenAI, 0,34 pour Anthropic et 0,10 pour Microsoft. Deux sur trois sont statistiquement presque sans lien avec la façon dont les travailleurs déclarent utiliser ces outils sur leurs tâches réelles.

L'erreur de second ordre est celle qui se trouve dans votre plan

La part d'usage brute n'est généralement pas ce qui atterrit dans un business case. La chaîne est plus longue, et le papier la suit : les classifications conversation-tâche sont agrégées en parts de genAI par métier, et ces parts circulent ensuite comme approximations de l'exposition à l'IA par rôle — l'entrée derrière le séquencement du déploiement, les budgets de formation et les prévisions d'effectifs. Les auteurs citent quatre mesures publiées construites ainsi et concluent que ces approximations « sont probablement inexactes et offrent une vision faussée ».

Alors quand une présentation vous dit quelles fonctions sont les plus exposées à l'IA, demandez d'où vient le classement. S'il remonte à des journaux de conversation, il hérite d'un classifieur qui n'a jamais su quel métier exerçait qui que ce soit — et son erreur caractéristique est de surclasser le travail qui paraît générique dans une transcription.

Votre autre source d'entrée est également plus faible qu'elle n'en a l'air

La correction évidente consiste à abandonner les benchmarks d'usage et à utiliser plutôt un véritable score d'exposition professionnelle. Le papier a testé cela aussi, face aux deux indices les plus cités de la littérature.

Régressée sur l'adoption réelle, la mesure d'Eloundou et al. (2024) donne un R² ajusté de 0,081 et celle de Felten et al. (2021) 0,086 — environ la moitié de la variance au niveau des métiers qu'il est possible d'expliquer (Bick et al., NBER, 2026). Ces scores sont réellement prédictifs. Ils sont loin d'être suffisants.

Et il y a en dessous une contrainte plus dure. Le métier lui-même explique moins de 20 % de la variance de l'adoption au niveau individuel (Bick et al., NBER, 2026). Ce qui détermine qui adopte réellement se situe surtout à l'intérieur de l'intitulé de poste, et non entre les intitulés. Deux analystes de la même équipe, mêmes outils, mêmes tâches — l'un a reconstruit sa semaine autour de l'outil, l'autre l'ouvre deux fois par mois.

C'est un problème de planification à la forme bien précise. Toute allocation faite par rôle — licences, heures de formation, séquencement de l'accompagnement — repose sur une variable qui explique moins d'un cinquième du résultat qui vous intéresse.

Cela explique aussi un schéma que la plupart des responsables des opérations ont déjà vu et rangé sous une autre étiquette. Une fonction ressort de la même session d'accompagnement avec des résultats extrêmement dispersés ; la lecture réflexe est la motivation, la qualité du manager ou la résistance au changement. Les données d'adoption disent qu'une grande partie de cette dispersion allait de toute façon exister, parce qu'elle est au niveau de la personne alors que l'intervention était au niveau du rôle. Refaire la session, en insistant davantage, ne traite pas la cause.

« Large mais superficielle » est une affirmation précise, pas une précaution

Le tableau d'adoption produit par l'enquête est facile à mal citer dans les deux sens. La version exacte :

  • En mai 2026, 45 % des travailleurs utilisent la genAI pour leur travail ; les auteurs traitent ce chiffre comme une borne inférieure, car les usages intégrés et passifs sont souvent non déclarés.
  • Plus de 80 % des métiers et 40 % des tâches affichent une adoption supérieure à 20 %.
  • Mais seules 2,8 % des tâches dépassent 50 % d'adoption, et aucune ne dépasse 70 %.

Lisez ces chiffres ensemble. Il n'existe aucune tâche dans l'économie américaine où l'usage de la genAI soit quasi universel. Les métiers qui affichent une adoption très élevée — environ 15 % dépassent 70 % — y parviennent non par une tâche saturée mais par un ensemble de tâches moyennement adoptées.

Des données indépendantes confirment la forme. L'étude ATLAS de Google, construite sur 14,65 millions d'interactions dépersonnalisées plutôt que sur du déclaratif, a trouvé que le métier médian utilise Gemini sur environ 21 % de ses tâches, avec une intention d'automatisation de bout en bout inférieure à 10 % des conversations cognitives non routinières (Google ATLAS v1.0, 2026). La télémétrie comportementale portant sur 120 620 travailleurs ne place que 2 % au stade d'intégration dans le flux de travail — utiliser l'IA à l'intérieur d'un processus redessiné plutôt que comme une consultation annexe (ActivTrak Productivity Lab, 2026).

Trois méthodes, trois jeux de données, une conclusion : couverture large, pénétration mince. Ce qui signifie qu'un plan qui modélise un rôle exposé à l'IA comme un rôle transformé par l'IA se trompe sur l'essentiel de la distance.

L'objection honnête

Trois limites à garder en tête.

Le chiffre de 2,4 % est en partie un artefact d'ONET, et les auteurs le disent. Leurs mots exacts : « la part de travailleurs qui pratiquent l'édition est clairement bien supérieure à 2,4 % ». ONET intègre l'édition dans des tâches d'ordre supérieur comme préparer des rapports ou rédiger des documents juridiques. L'écart entre 15 % et 2,4 % n'est donc pas une pure erreur de classifieur — il vient en partie d'une taxonomie de référence qui renonce à nommer une activité pourtant omniprésente. La direction de la distorsion est solidement établie ; l'ampleur d'un couple de chiffres isolé est plus fragile qu'il n'y paraît.

Le déclaratif a aussi ses modes de défaillance. L'enquête sait ce que les gens disent faire avec les outils. Les journaux de conversation savent ce qui est réellement passé par la fenêtre, à une échelle qu'aucune enquête n'atteindra jamais. Aucun des deux n'est la vérité terrain ; ils répondent à des questions différentes, et l'apport du papier est de montrer à quel point les réponses divergent, non de déclarer l'une des deux mensongère.

Une enquête nationale n'est pas votre entreprise. Le RPS décrit la population active américaine. Votre inventaire de tâches, votre pile d'outils et votre design organisationnel ne sont pas la moyenne nationale, et rien ici ne vous dit lesquels de vos rôles adopteront.

Cette dernière limite est celle qui compte vraiment — et elle pointe dans une seule direction. Tout benchmark externe dans ce domaine, issu de conversations ou d'enquête, est un a priori. Aucun n'est une mesure de votre organisation.

Ce qu'il faut décider ce trimestre

Quatre mouvements. Aucun n'exige de dépense nouvelle.

  1. Remontez à la source de chaque benchmark d'usage de l'IA présent dans votre plan. Si un chiffre provient de journaux de conversation d'une plateforme, marquez-le comme a priori directionnel, et non comme entrée d'un modèle d'effectifs ou de budget. C'est un audit de trente minutes sur un document que vous avez déjà écrit.
  2. Construisez un inventaire de tâches pour une seule fonction. Vingt à trente activités réelles d'une équipe, formulées dans votre langage plutôt que dans celui d'O*NET. C'est le seul artefact qui permet de demander « l'outil touche-t-il ceci ? » au lieu de « ce rôle est-il exposé ? » — et il survit à chaque révision des benchmarks éditeurs, parce qu'il décrit votre travail et non le trafic d'autrui. Prévoyez un après-midi avec le responsable d'équipe, pas une mission de conseil.
  3. Cessez d'allouer l'accompagnement par rôle. Si le métier explique moins de 20 % de l'adoption individuelle, un déploiement fondé sur le rôle relève presque du pile ou face. Allouez plutôt selon l'usage observé, et laissez la première cohorte être ceux qui sont déjà en avance dans votre propre télémétrie.
  4. Fixez votre cible sur la tâche, pas sur la licence. Choisissez une tâche de cet inventaire et poussez-la au-delà de 50 % d'adoption. Moins de trois tâches sur cent ont franchi ce seuil à l'échelle nationale — et c'est précisément pourquoi le franchir délibérément est un résultat défendable à rapporter.

Votre benchmark d'usage de l'IA a répondu à une question que vous n'aviez pas posée : à quoi ressemblent les conversations. La question posée sur votre bureau est ce que vos collaborateurs font de leurs journées, et si l'outil en a atteint ne serait-ce qu'une partie.

L'une de ces questions a une réponse publiée. L'autre n'a que la vôtre.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.