Scovai Scovai
AI & Operations 2026-09-17 1 min read

Nhật ký trò chuyện không phải là một nghiên cứu lực lượng lao động: Một bài báo mới của Fed và Harvard cho thấy chuẩn tham chiếu sử dụng AI nằm dưới business case của bạn đang đếm phần việc mà các vị trí của bạn không hề có

DSL

Dr. Sarah Liu

Nhật ký trò chuyện không phải là một nghiên cứu lực lượng lao động: Một bài báo mới của Fed và Harvard cho thấy chuẩn tham chiếu sử dụng AI nằm dưới business case của bạn đang đếm phần việc mà các vị trí của bạn không hề có

Hơn 15% các cuộc trò chuyện của OpenAI được phân loại là "Edit written materials or documents". Chỉ 2,4% người lao động làm một nghề có chứa nhiệm vụ đó trong O*NET (Bick, Blandin, Deming & Schumacher, NBER, 2026). Khoảng cách ấy nằm ngay bên trong chuẩn tham chiếu sử dụng AI mà phần lớn kế hoạch vận hành 2027 đang dựa vào.

Giờ nhìn theo chiều ngược lại. Nhiệm vụ đơn lẻ chiếm tỷ trọng sử dụng genAI lớn nhất trong một khảo sát đại diện toàn quốc là "Direct organizational operations, activities, or procedures" — 4,1% toàn bộ lượt sử dụng được báo cáo, do 43% người lao động đảm nhiệm. Tỷ trọng của nó trong dữ liệu OpenAI là 0,0%. Ở Microsoft, 0,0%. Ở Anthropic, 0,2%.

Phần việc đặc trưng nhất của vận hành lại chính là phần việc mà nhật ký trò chuyện hoàn toàn không nhìn thấy. Nếu kế hoạch AI 2027 của bạn được định cỡ dựa trên một trong những nghiên cứu sử dụng do nhà cung cấp phát hành — và phần lớn kế hoạch của doanh nghiệp tầm trung đều vậy, vì các nghiên cứu ấy miễn phí, mới và đồ sộ — thì bạn đang đọc một tấm bản đồ đã bị cắt mất chính lãnh thổ của mình.

Điều khảo sát này làm được mà các nghiên cứu trò chuyện không làm nổi

Alexander Bick (Federal Reserve Bank of St. Louis), Adam Blandin (Vanderbilt), David Deming (Harvard Kennedy School) và Tyler Schumacher (Vanderbilt) đã xây chỉ số áp dụng genAI ở cấp độ nhiệm vụ đầu tiên từ một khảo sát đại diện toàn quốc chứ không phải từ dữ liệu đo đạc nền tảng (NBER Working Paper 35677, 2026).

Cơ chế mới là điều quan trọng. Họ gộp bốn đợt của Real-Time Population Survey — 13.920 người trả lời đang có việc làm, tuổi 18 đến 64 — và nối việc sử dụng genAI mà mỗi người khai báo với nghề chi tiết của họ và với các hoạt động công việc ONET cụ thể mà nghề đó thực sự chứa. Vì biết nghề của người trả lời, họ có thể quy một lượt sử dụng về một nhiệm vụ bên trong một kiến trúc vị trí đã biết*.

Một bộ phân loại trò chuyện không làm được như vậy. Nó đọc văn bản của cuộc hội thoại và thường không hề biết người dùng làm nghề gì. Nên nó làm điều duy nhất khả dĩ: gán cuộc trò chuyện cho một tên nhiệm vụ mô tả hành động nhìn thấy được. Biên tập. Thu thập thông tin. Thiết kế một hệ thống.

Đây không phải lỗi trong bộ phân loại của bất kỳ ai. Đó là giới hạn cấu trúc của dữ liệu đầu vào, và bài báo gọi tên nó thẳng thắn: các bộ phân loại trò chuyện "có thể có thiên hướng gán các cuộc trò chuyện vào những tên nhiệm vụ mô tả hành động cơ bản, chung chung".

Chuẩn tham chiếu sử dụng AI lệch xa đến đâu

Hệ quả là mức tập trung cực đoan. Mười nhiệm vụ trong số 332 chiếm 53,0% lượng sử dụng trong dữ liệu OpenAI, 46,0% ở Anthropic và 60,8% ở Microsoft — so với 22,2% trong khảo sát (Bick et al., NBER, 2026). Nhiệm vụ đơn lẻ lớn nhất lấy lần lượt 15,1%, 16,7% và 23,2% của ba tập dữ liệu trò chuyện, so với 4,1% trong khảo sát.

Rồi đến con số lẽ ra phải khép lại cuộc tranh luận về chuyện đây có phải hai góc nhìn về cùng một thực tại hay không. Tương quan giữa tỷ trọng nhiệm vụ của khảo sát và của các tập dữ liệu trò chuyện là 0,11 với OpenAI, 0,34 với Anthropic và 0,10 với Microsoft. Hai trong ba gần như không có liên hệ thống kê với cách người lao động nói rằng họ dùng công cụ trên các nhiệm vụ thực tế của mình.

Sai số bậc hai mới là sai số nằm trong kế hoạch của bạn

Tỷ trọng sử dụng trực tiếp thường không phải thứ đi vào business case. Chuỗi dài hơn, và bài báo lần theo nó: các phân loại trò chuyện–nhiệm vụ được gộp thành tỷ trọng genAI theo nghề, rồi những tỷ trọng nghề ấy lưu hành như đại lượng thay thế cho mức độ phơi nhiễm AI theo vai trò — đầu vào nằm sau thứ tự triển khai, ngân sách đào tạo và dự báo nhân sự. Các tác giả nêu đích danh bốn thước đo đã công bố được dựng theo cách này và kết luận rằng các đại lượng thay thế đó "nhiều khả năng thiếu chính xác và đưa ra một góc nhìn bị bóp méo".

Vậy nên khi một bản trình bày nói cho bạn biết bộ phận nào của bạn phơi nhiễm AI nhiều nhất, hãy hỏi bảng xếp hạng ấy đến từ đâu. Nếu nó truy ngược về nhật ký trò chuyện, nó thừa hưởng một bộ phân loại chưa từng biết ai làm nghề gì — và sai số đặc trưng của nó là xếp quá cao phần việc trông có vẻ chung chung trong một bản ghi.

Nguồn đầu vào còn lại của bạn cũng yếu hơn vẻ ngoài

Cách sửa hiển nhiên là bỏ các chuẩn tham chiếu sử dụng và dùng một điểm phơi nhiễm nghề nghiệp đàng hoàng. Bài báo cũng kiểm tra điều đó, đối chiếu với hai chỉ số được trích dẫn nhiều nhất trong tài liệu.

Hồi quy trên mức áp dụng thực tế, thước đo của Eloundou và cộng sự (2024) cho R² hiệu chỉnh 0,081 và của Felten và cộng sự (2021) là 0,086 — khoảng một nửa phần phương sai ở cấp nghề có thể giải thích được (Bick et al., NBER, 2026). Các điểm số này thực sự có giá trị dự báo. Nhưng còn xa mới đủ.

Bên dưới là một ràng buộc cứng hơn. Bản thân nghề nghiệp chỉ giải thích chưa tới 20% phương sai của mức áp dụng ở cấp người lao động (Bick et al., NBER, 2026). Thứ quyết định ai thực sự áp dụng nằm chủ yếu bên trong chức danh, không phải giữa các chức danh. Hai chuyên viên phân tích cùng một nhóm, cùng công cụ, cùng nhiệm vụ — một người đã dựng lại cả tuần làm việc quanh công cụ, người kia mở nó hai lần mỗi tháng.

Đó là một bài toán hoạch định có hình dạng rất rõ. Mọi phân bổ bạn thực hiện theo vai trò — số giấy phép, giờ đào tạo, thứ tự bật năng lực — đều dựa trên một biến giải thích chưa tới một phần năm kết quả mà bạn quan tâm.

Nó cũng giải thích một mô thức mà phần lớn lãnh đạo vận hành đã từng thấy và xếp nhầm chỗ. Một bộ phận trở về từ cùng một buổi đào tạo với kết quả chênh lệch rất lớn; cách đọc theo phản xạ là động lực, chất lượng quản lý, hoặc sự kháng cự thay đổi. Dữ liệu áp dụng nói rằng phần lớn độ phân tán đó dù sao cũng sẽ xuất hiện, vì nó ở cấp cá nhân trong khi can thiệp lại ở cấp vai trò. Tổ chức lại buổi đào tạo với cường độ cao hơn không chạm tới nguyên nhân.

"Rộng nhưng nông" là một khẳng định chính xác, không phải lời rào đón

Bức tranh áp dụng mà khảo sát tạo ra rất dễ bị trích dẫn sai theo cả hai hướng. Bản chính xác:

  • Tính đến tháng 5/2026, 45% người lao động dùng genAI cho công việc; các tác giả xem đây là cận dưới, vì các cách dùng nhúng sẵn và thụ động thường không được khai báo.
  • Hơn 80% số nghề và 40% số nhiệm vụ có mức áp dụng trên 20%.
  • Nhưng chỉ 2,8% số nhiệm vụ vượt mức áp dụng 50%, và không nhiệm vụ nào vượt 70%.

Hãy đọc chúng cùng nhau. Không có nhiệm vụ nào trong nền kinh tế Mỹ mà việc dùng genAI gần như phổ quát. Những nghề có mức áp dụng rất cao — khoảng 15% vượt 70% — đạt tới đó không nhờ một nhiệm vụ bão hòa mà nhờ một tập hợp các nhiệm vụ được áp dụng ở mức vừa phải.

Dữ liệu độc lập đồng thuận về hình dạng này. Nghiên cứu ATLAS của Google, dựng trên 14,65 triệu tương tác đã khử định danh thay vì tự khai báo, thấy nghề trung vị dùng Gemini cho khoảng 21% số nhiệm vụ của nghề đó, với ý định tự động hóa đầu-cuối dưới 10% các cuộc hội thoại nhận thức phi thường quy (Google ATLAS v1.0, 2026). Dữ liệu đo hành vi trên 120.620 người lao động chỉ xếp 2% đạt mức trưởng thành tích hợp quy trình — dùng AI bên trong một quy trình đã được thiết kế lại chứ không phải như một lượt tra cứu bên lề (ActivTrak Productivity Lab, 2026).

Ba phương pháp, ba tập dữ liệu, một kết luận: phủ rộng, thấm mỏng. Nghĩa là một kế hoạch mô hình hóa một vai trò phơi nhiễm AI như thể đó là một vai trò đã được AI biến đổi thì sai gần trọn khoảng cách.

Phản biện trung thực

Ba giới hạn đáng giữ trong đầu.

Con số 2,4% một phần là sản phẩm của cách phân loại ONET, và chính các tác giả nói vậy. Nguyên văn: "tỷ lệ người lao động thực hiện việc biên tập rõ ràng lớn hơn 2,4% rất nhiều". ONET nhúng việc biên tập vào các nhiệm vụ bậc cao hơn như soạn báo cáo hay soạn thảo văn bản pháp lý. Vậy nên khoảng cách giữa 15% và 2,4% không phải lỗi phân loại thuần túy — một phần của nó là hệ phân loại tham chiếu từ chối gọi tên một hoạt động vốn có mặt khắp nơi. Chiều của sự méo mó thì đã vững; độ lớn của bất kỳ cặp số riêng lẻ nào thì mềm hơn vẻ ngoài.

Tự khai báo cũng có những kiểu hỏng riêng. Khảo sát biết người ta nói mình làm gì với công cụ. Nhật ký trò chuyện biết thứ gì thực sự đã đi qua cửa sổ đó, ở quy mô mà không khảo sát nào chạm tới được. Không bên nào là chân lý nền; chúng trả lời hai câu hỏi khác nhau, và đóng góp của bài báo là cho thấy hai câu trả lời cách nhau bao xa, chứ không phải tuyên bố một bên là giả.

Một khảo sát toàn quốc không phải công ty bạn. RPS mô tả lực lượng lao động Mỹ. Danh mục nhiệm vụ, bộ công cụ và thiết kế vị trí của bạn không phải mức trung bình quốc gia, và không có gì ở đây nói cho bạn biết vai trò nào của bạn sẽ áp dụng.

Giới hạn cuối cùng ấy mới là điều thực sự quan trọng — và nó chỉ về một hướng duy nhất. Mọi chuẩn tham chiếu bên ngoài trong lĩnh vực này, dù từ nhật ký trò chuyện hay từ khảo sát, đều là một tiên nghiệm. Không cái nào là phép đo tổ chức của bạn.

Cần quyết gì trong quý này

Bốn động tác. Không động tác nào đòi chi thêm tiền.

  1. Truy ngược mọi chuẩn tham chiếu sử dụng AI trong kế hoạch về tận nguồn. Nếu một con số bắt nguồn từ nhật ký trò chuyện của nền tảng, hãy đánh dấu nó là tiên nghiệm chỉ hướng, không phải đầu vào cho mô hình nhân sự hay ngân sách. Đây là một cuộc rà soát ba mươi phút trên tài liệu bạn đã viết xong.
  2. Dựng một danh mục nhiệm vụ cho đúng một bộ phận. Hai đến ba mươi hoạt động thực tế của một nhóm, viết bằng ngôn ngữ của bạn chứ không phải của O*NET. Đó là hiện vật duy nhất cho phép bạn hỏi "công cụ có chạm vào việc này không?" thay vì "vai trò này có phơi nhiễm không?" — và nó sống sót qua mọi lần chỉnh sửa chuẩn tham chiếu của nhà cung cấp, vì nó mô tả công việc của bạn chứ không phải lưu lượng của người khác. Hãy dành một buổi chiều với trưởng nhóm, không phải một hợp đồng tư vấn.
  3. Ngừng phân bổ việc bật năng lực theo vai trò. Khi nghề nghiệp giải thích chưa tới 20% mức áp dụng ở cấp cá nhân, triển khai theo vai trò gần với tung đồng xu. Hãy phân bổ theo mức sử dụng quan sát được, và để nhóm đầu tiên là những người đã dẫn trước trong chính dữ liệu đo của bạn.
  4. Đặt mục tiêu ở nhiệm vụ, không phải ở giấy phép. Chọn một nhiệm vụ trong danh mục đó và đẩy nó vượt mức áp dụng 50%. Trên toàn quốc, chưa tới ba trên một trăm nhiệm vụ vượt qua vạch này — và chính vì thế, vượt qua nó một cách có chủ đích là một kết quả có thể bảo vệ được khi báo cáo.

Chuẩn tham chiếu sử dụng AI của bạn đã trả lời một câu hỏi bạn chưa từng đặt ra: các cuộc trò chuyện trông ra sao. Câu hỏi đang nằm trên bàn bạn là người của bạn làm gì suốt cả ngày, và công cụ đã chạm tới được phần nào trong đó chưa.

Một trong hai câu hỏi ấy đã có câu trả lời được công bố. Câu còn lại chỉ có câu trả lời của bạn.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.