Ghép 1.258 người với các tác nhân AI, để họ tạo ra 7.266 mẫu quảng cáo hiển thị, rồi giao cho 1.168 người chấm điểm độc lập đánh giá kết quả. Tổ hợp tệ nhất trong toàn bộ thiết kế không phải là một mô hình yếu hay một người dùng chưa được đào tạo. Đó là những người hướng ngoại làm việc với một AI tận tâm (Ju & Aral, PNAS, 2026).
Tận tâm. Chính là đặc điểm mà mọi nhà cung cấp đều tinh chỉnh mô hình hướng tới theo mặc định — cẩn thận, kỹ lưỡng, bám sát nhiệm vụ. Giao cho sai người, nó tạo ra sản phẩm chất lượng thấp nhất trong thí nghiệm.
Đây là phát hiện mà các đội vận hành ở doanh nghiệp tầm trung nên dừng lại suy nghĩ, vì gần như tất cả đều đặt cược ngược lại: một persona trợ lý duy nhất, cấu hình một lần, triển khai cho tất cả mọi người. Nghiên cứu này là bằng chứng nhân quả quy mô lớn đầu tiên cho thấy bản thân persona là một biến hiệu suất — và để nó ở mặc định của nhà cung cấp là một quyết định, không phải một trạng thái trung lập.
Thí nghiệm thực sự đo điều gì
Harang Ju (Johns Hopkins Carey Business School) và Sinan Aral (MIT Sloan, giám đốc MIT Initiative on the Digital Economy) đã tiến hành một thí nghiệm ngẫu nhiên có đăng ký trước: 1.258 người tham gia được đo trên các đặc điểm Big Five, sau đó được ghép ngẫu nhiên với các tác nhân AI được hướng dẫn thể hiện mức cao hoặc thấp một cách độc lập của chính năm đặc điểm đó (Ju & Aral, PNAS, 2026).
Mỗi nhóm có 40 phút, trò chuyện thời gian thực và công cụ chỉnh sửa văn bản, hình ảnh đồng bộ để xây dựng quảng cáo hiển thị cho báo cáo thường niên của một think tank có thật. Sản lượng: 7.266 mẫu quảng cáo. Sau đó chúng được 1.168 người chấm điểm độc lập đánh giá về chất lượng văn bản và hình ảnh (MIT Sloan / EurekAlert, 2026).
Và đây là phần khiến nghiên cứu này vượt khỏi một kết quả phòng thí nghiệm. Nhóm nghiên cứu chạy các quảng cáo trên X trong hai tuần — gần năm triệu lượt hiển thị — rồi đo tỷ lệ nhấp và chi phí mỗi lần nhấp. Chất lượng được chấm đã dự báo hiệu quả thực tế trên thị trường: chất lượng văn bản cao hơn làm tăng tỷ lệ nhấp khoảng 7 phần trăm và giảm chi phí mỗi lần nhấp khoảng 30 xu (MIT Sloan / EurekAlert, 2026).
Hai lựa chọn thiết kế đáng được nhấn mạnh, vì chúng là thứ tách nghiên cứu này khỏi những bình luận về persona AI vốn đã lan truyền. Mức độ các đặc điểm được phân ngẫu nhiên và thay đổi độc lập, nên phép so sánh không nằm giữa những người dùng tự chọn công cụ khác nhau — nó mang tính nhân quả. Và nghiên cứu đo con người bằng chính công cụ Big Five dùng để hướng dẫn tác nhân, đó chính là điều khiến tương tác trở nên ước lượng được. Phần lớn nghiên cứu của nhà cung cấp báo cáo cảm nhận của người dùng về một persona. Nghiên cứu này báo cáo cặp ghép đã làm gì với chính công việc.
Vậy là chuỗi nhân quả hoàn chỉnh từ đầu đến cuối. Cặp ghép persona dịch chuyển chất lượng. Chất lượng dịch chuyển tiền.
Bảng cặp ghép: tổ hợp nào có lợi, tổ hợp nào gây hại
Kết quả không rút gọn thành "ghép tương đồng với tương đồng", điều mà gần như ai cũng giả định trước khi đọc.
Những cặp ghép mạnh nhất là: người hướng ngoại với AI hướng ngoại, người tận tâm với AI tận tâm, và người cởi mở với AI tận tâm — cặp cuối là bổ sung, không phải tấm gương (MIT Sloan / EurekAlert, 2026).
Những cặp ghép làm giảm chất lượng một cách có ý nghĩa, theo thứ tự bài báo đưa ra:
- Người hướng ngoại + AI tận tâm — chất lượng thấp nhất trong nghiên cứu
- Người tận tâm + AI dễ chịu (agreeable)
- Người nhiễu tâm + AI tận tâm
Hãy đọc dòng thứ hai hai lần
AI tận tâm xuất hiện trong hai trong ba cặp ghép tệ nhất và hai trong ba cặp ghép tốt nhất. Trong dữ liệu này không tồn tại một persona tốt phổ quát. Một tác nhân tận tâm giao cho người tận tâm nằm trong số tổ hợp tốt nhất hiện có; cùng tác nhân đó giao cho người hướng ngoại lại là tệ nhất. Cấu hình y hệt, kết quả trái ngược, hoàn toàn do ai nhận nó quyết định.
Và hãy để ý dòng thứ hai làm gì với câu trả lời tiêu chuẩn của nhà cung cấp. AI dễ chịu — sẵn lòng, chiều ý, không bao giờ phản bác — lại làm giảm sản phẩm của những người tận tâm. Persona được tinh chỉnh nhiều nhất cho sự hài lòng của người dùng hóa ra gây hại thực sự đúng với nhóm có khả năng cao nhất đang làm phần việc cẩn trọng nhất của bạn.
Vì sao một persona duy nhất cho toàn tổ chức là thuế hiệu suất âm thầm
Đây là bản dịch sang ngôn ngữ vận hành, và nó khó chịu chính vì sửa nó không tốn gì mà không ai đang đo.
Khi bạn triển khai một cấu hình trợ lý duy nhất cho 300 người, bạn không thực hiện một đợt triển khai trung lập. Bạn đang chạy một thí nghiệm không ngẫu nhiên, trong đó một phần lực lượng lao động đã được trao đúng cặp ghép mà nghiên cứu này xác định là tạo ra kết quả tệ nhất — và cả họ lẫn bạn đều không có công cụ nào phát hiện được. Thất bại hiện ra dưới dạng bản nháp hơi yếu hơn, sửa lại nhiều hơn một chút, một cảm giác mơ hồ ở vài đội rằng công cụ "không hữu ích đến thế". Nó không bao giờ xuất hiện như một mục chi phí.
Phần sửa lại đó rơi đúng vào chỗ đắt nhất. Phân tích chi phí của McKinsey QuantumBlack cho các quy trình tác nhân trong ngân hàng đặt chi phí token ở mức 20 đến 25 phần trăm chi phí vận hành biến đổi của một tác nhân, còn giám sát của con người bởi chuyên gia nghiệp vụ và rủi ro chiếm 70 đến 75 phần trăm (McKinsey QuantumBlack, 2026). Trong cấu trúc đó, chất lượng đầu ra không phải chỉ số mềm. Mỗi điểm chất lượng mất ở khâu tạo sinh đều được trả lại theo đơn giá rà soát, bởi người cấp cao đang kiểm tra.
Và việc kiểm tra sẽ không biến mất. Trong nghiên cứu của MIT Technology Review Insights và Microsoft với 300 lãnh đạo công nghệ xếp hạng 101 nhiệm vụ tác nhân, 59 phần trăm đã lên kế hoạch giám sát thường trực của con người, với mức độ tin cậy bám theo khả năng kiểm chứng của nhiệm vụ hơn là năng lực thô của mô hình (MIT Technology Review Insights, 2026).
Vì vậy, persona không khớp không phải là lời phàn nàn về trải nghiệm người dùng. Đó là một hệ số nhân âm thầm đặt lên khoản chi lớn nhất trong hệ thống AI của bạn.
Phương sai vốn đã nằm bên trong chức danh
Nếu bạn muốn bằng chứng rằng điều này đo được trong chính công ty mình chứ không chỉ trong phòng thí nghiệm, nó đã nằm sẵn trong dữ liệu sử dụng. Bick, Blandin, Deming và Schumacher, khi nối một khảo sát đại diện toàn quốc với các nhiệm vụ O*NET chi tiết, phát hiện rằng các thước đo mức độ tiếp xúc với AI tạo sinh chỉ giải thích khoảng một nửa mức biến thiên trong việc sử dụng giữa những người lao động — người làm cùng công việc, với cùng công cụ, lại sử dụng khác nhau một cách hệ thống (NBER Working Paper 35677, 2026).
Một nửa phương sai nằm bên trong chức danh, không phải giữa các chức danh. Phần lớn đội vận hành xếp điều đó vào mục động lực hoặc đào tạo. Kết quả PNAS đưa ra một lời giải thích ít dễ chịu hơn nhưng khả thi hơn cho một phần trong đó: công cụ được cấu hình cho một người không phải người đang dùng nó.
Cách nhìn lại này thay đổi việc bạn làm với một nhóm sử dụng thấp. Gửi thêm một buổi đào tạo nữa cho đội đang lặng lẽ nhận đầu ra kém hơn từ tác nhân mặc định không chạm tới nguyên nhân — nó chỉ thêm giờ cho những người mà bản nháp vẫn sẽ quay lại cần sửa nhiều hơn đồng nghiệp.
Phản biện trung thực
Ba giới hạn, và chúng quan trọng.
Nhiệm vụ là sáng tạo quảng cáo, không phải vận hành. Những phiên sáng tạo bốn mươi phút tạo quảng cáo hiển thị không phải là kỳ chốt sổ quý, quy trình tiếp nhận nhà cung cấp hay phân loại ticket của bạn. Việc cặp ghép tính cách dịch chuyển chất lượng trong một nhiệm vụ sáng tạo là một phát hiện; việc nó dịch chuyển chất lượng trong quy trình của bạn là một suy luận. Hãy xem đó là giả thuyết mạnh đáng kiểm chứng, không phải kết luận đã an bài.
Các tác giả có vị thế thương mại. Ju và Aral đồng sáng lập Pairium, công ty xây dựng và phân phối nền tảng thí nghiệm Pairit được dùng trong nghiên cứu (Ju & Aral, PNAS, 2026). Nghiên cứu được đăng ký trước và bình duyệt tại PNAS, điều này hạn chế các lỗi hiển nhiên — nhưng chính những nhà nghiên cứu có phát hiện cũng đang bán giải pháp, và điều đó thuộc về cách bạn đọc nó.
Ghép hoàn hảo cho tất cả mọi người cũng có cái giá riêng. Các công trình trong cùng dòng tài liệu cho thấy persona AI đa dạng giúp giảm hiệu ứng đồng nhất hóa trong hoạt động sáng tạo ý tưởng giữa người và AI (Wan & Kalman, 2026). Tối ưu từng cặp ghép cho chất lượng đầu ra cá nhân và bạn có thể nén phương sai trong tư duy của các đội — bản nháp tốt hơn, nhưng giống nhau hơn. Nếu bộ phận của bạn cần độ rộng thay vì độ tinh, đánh đổi đó là có thật.
Không điều nào trong số đó cứu được hiện trạng. Cấu hình mặc định không phải là tấm đệm chống lại những giới hạn này; nó là lựa chọn duy nhất chắc chắn sai với một phần lực lượng lao động, mà không có dữ liệu nào nói cho bạn biết phần nào.
Cần quyết định gì trong quý này
Bốn động thái, không cái nào đòi thêm chi phí nhà cung cấp.
- Ngừng coi persona là cấu hình CNTT. System prompt của trợ lý là một tham số hiệu suất với tác động đã được đo lên chất lượng đầu ra. Ai phụ trách triển khai AI thì sở hữu nó — và phải giải trình cho thiết lập hiện tại.
- Chạy một thử nghiệm cặp ghép ở bộ phận vốn đã tạo ra sản phẩm chấm điểm được. Nội dung, phản hồi hỗ trợ, phân tích bản thảo đầu. Hai persona, phân ngẫu nhiên, một quý, chấm chất lượng ẩn danh. Bạn đang lặp lại một thiết kế đã công bố ở quy mô nhỏ — nghiên cứu rẻ nhất bạn từng đặt hàng.
- Soi kỹ nhất vào nhóm hướng ngoại và nhân sự có mức nhiễu tâm cao ở các vai trò sản lượng lớn. Đó là hai hồ sơ con người mà nghiên cứu đánh dấu khi đối diện tác nhân tận tâm mặc định. Nếu một người rõ ràng có năng lực lại lặng lẽ thu được rất ít từ công cụ, sai cặp ghép giờ là giả thuyết sống, không phải vấn đề đào tạo.
- Hãy cho phép chọn persona trước khi xây dựng cơ chế gán persona. Phân bổ đầy đủ theo đặc điểm cần dữ liệu tính cách mà phần lớn doanh nghiệp tầm trung không có và có thể không muốn có. Hai hoặc ba hồ sơ trợ lý cho phép chọn đã nắm được một phần hiệu ứng mà không phơi bày rủi ro quản trị nào.
Cặp ghép tính cách với AI giờ là một biến đã đo được và có giá đi kèm. Bạn vốn đã và đang thiết lập nó — một lần, cho toàn cục, bằng cách chấp nhận thứ nhà cung cấp giao tới.
Câu hỏi của quý này không phải persona có quan trọng hay không. PNAS đã trả lời rồi. Câu hỏi là bạn có tiếp tục ra quyết định đó theo mặc định, cho tất cả mọi người, rồi gọi kết quả là lỗi của mô hình hay không.