Sáu mươi ba phần trăm người đang tích cực tìm việc giờ đây đã trải qua một buổi phỏng vấn AI — tăng 13 điểm phần trăm trong sáu tháng. Bảy mươi phần trăm chưa từng được nói rõ rằng AI sẽ đánh giá họ, và 21 phần trăm chỉ phát hiện ra khi buổi phỏng vấn đã bắt đầu (Greenhouse, 2026).
Hai con số đó mô tả phần lớn phễu tuyển dụng của các doanh nghiệp tầm trung. Một nghiên cứu mới trên Information Systems Research giải thích con số thứ hai đang khiến bạn trả giá thế nào.
Những ứng viên không thấy được mình đang bị đánh giá ra sao sẽ thổi phồng. Điểm số của AI không thể phát hiện điều đó. Và người duyệt là con người mà bạn thêm vào như một lớp bảo vệ sẽ nhìn vào điểm số rồi ngừng dùng phán đoán của chính mình.
Đây không phải ba vấn đề. Đây là một kiểu hỏng hóc duy nhất gồm ba giai đoạn, và giai đoạn giữa thì không thể thấy từ bảng điều khiển của bạn.
Nghịch lý minh bạch, được kiểm chứng qua tám nghiên cứu
Akshat Lakhiwal (University of Georgia), Che-Wei Liu (Arizona State), Hillol Bala (Indiana) và Hung-Yue Suen (National Taiwan Normal University) đã công bố "From Opacity to Transparency: User Behavior and Downstream Effects in Algorithmic Evaluation" trên Information Systems Research ngày 30 tháng 7 năm 2026. Tám nghiên cứu, gồm hai thí nghiệm chính và một lần tái lặp bán thực địa, tất cả đặt trong bối cảnh phỏng vấn video một chiều, không đồng bộ (Lakhiwal và cộng sự, Information Systems Research, 2026).
Mâu thuẫn ban đầu là thật, và đó chính là lý do phần lớn nhà tuyển dụng đã im lặng về công cụ của mình. Công bố thuật toán đo lường điều gì thì bạn có thể giảm được lo lắng của ứng viên — hoặc bạn chỉ đang trao cho họ đáp án của bài kiểm tra. Các tác giả gọi đây là nghịch lý minh bạch, rồi đi đo xem bên nào thắng.
Thí nghiệm I: so với đánh giá bởi con người, đánh giá bằng thuật toán làm tăng mức căng thẳng và hành vi quản trị ấn tượng mang tính lừa dối (impression management) của người được phỏng vấn. Sự minh bạch đã triệt tiêu cả hai tác động, "đưa chúng về sát với đánh giá bởi con người".
Phần công bố tạo ra kết quả này không phải một bản thuyết trình kỹ thuật. Ứng viên được cho biết hệ thống sẽ quan sát biểu cảm khuôn mặt, sắc thái lời nói và các từ khóa cụ thể, và sẽ cho điểm họ về làm việc nhóm, năng lực liên quan đến công việc, phong cách làm việc và tính cách. Nhóm đó sau đó thể hiện mức hành vi chân thực tương đương những ứng viên tin rằng một con người đang duyệt mình (UGA Today, 2026).
Cách Lakhiwal giải thích vì sao sự mù mờ lại phản tác dụng rất đáng ghi nhớ:
"Nếu bạn ứng tuyển vào công ty trong mơ và công ty trong mơ đó muốn phỏng vấn bạn bằng AI, thực sự bạn không có nhiều lựa chọn. Bạn không muốn nói không, nhưng bạn cũng không biết nó hoạt động thế nào."
Ứng viên lấp khoảng trống đó bằng phỏng đoán. "Có rất nhiều sự thổi phồng," Lakhiwal nói. "Họ dường như tung ra mọi thứ có thể để đưa cho 'người đánh giá' cái mà họ hình dung nó đang tìm."
Lập luận phản đối rằng ứng viên sẽ lách hệ thống hóa ra bị đảo ngược. Giữ kín tiêu chí không ngăn được việc lách. Nó tạo ra việc lách, bởi một ứng viên tối ưu hóa theo một bộ tiêu chí tưởng tượng sẽ làm quá lên theo mọi hướng cùng lúc.
Điểm phỏng vấn AI của bạn không phân biệt được trung thực với thổi phồng
Đây là phần nên thay đổi cách bạn đọc các báo cáo sàng lọc.
Tác nhân AI phổ biến nhất trong ngành, được dùng trong nghiên cứu, đã không trừ điểm những ứng viên nói quá sự thật. Nó cho họ điểm tốt ngang với những ứng viên trình bày trung thực cùng những bằng cấp đó (UGA Today, 2026).
Khi những người đánh giá là con người xem cùng các video đó, họ nhận ra được. Họ thường trừ điểm những người thổi phồng và cho điểm cao nhất cho những ứng viên có hành vi chân thực nhất.
Vậy phán đoán của con người là có hiệu lực. Đó là nửa đáng khích lệ của phát hiện này, và nó chỉ tồn tại đến đúng thời điểm bạn nói cho con người biết máy đã nghĩ gì.
Rồi con người ngừng nhìn
Thí nghiệm II chuyển xuống phía sau của quy trình, so sánh ba cấu hình ra quyết định: chỉ con người, có AI hỗ trợ — người ra quyết định được trợ giúp bởi điểm AI — và tự động hóa hoàn toàn.
Ở phía ứng viên, sự minh bạch tiếp tục phát huy tác dụng trong cả ba. Ở phía người đánh giá, nó hết đường. Theo lời các tác giả, tác dụng điều chỉnh của nó lên kết quả phỏng vấn "bị giới hạn ở phía đánh giá". Khi có điểm AI, những người đánh giá neo vào các điểm đó và hạ thấp phán đoán của chính mình, dù rằng điểm AI không phân biệt được hành vi trung thực với hành vi lừa dối (Lakhiwal và cộng sự, Information Systems Research, 2026).
Hãy đọc các cấu hình này theo thứ tự mức độ phổ biến của chúng ở doanh nghiệp tầm trung. Sàng lọc tự động hoàn toàn thì hiếm và được thừa nhận rộng rãi là rủi ro. Sàng lọc chỉ bằng con người là điều bạn đang cố rời xa vì chi phí. Còn cấu hình có AI hỗ trợ — một điểm số, rồi một người duyệt ký xác nhận — lại chính là thứ gần như ai cũng đã thực sự mua, và đó là cấu hình mà một con người vốn có thể phát hiện sự thổi phồng lại đều đặn ngừng làm việc đó.
Lớp bảo vệ ấy không trung tính. Nó tẩy trắng cho điểm số.
Cùng một thất bại đã xuất hiện trong một thí nghiệm thực địa
Đây không phải kết quả của một bài báo đơn lẻ. Lane, Boussioux, Ayoubi và các đồng nghiệp đã tiến hành một thí nghiệm thực địa với 228 người đánh giá xem xét 48 hồ sơ thật, so sánh đánh giá chỉ bởi con người, một đề xuất của mô hình dạng hộp đen, và cũng đề xuất đó nhưng kèm một lời giải thích tường thuật (Lane và cộng sự, HBS Working Paper 25-001).
Các đề xuất dạng hộp đen đã cải thiện chất lượng quyết định. Cũng những đề xuất đó nhưng kèm lời giải thích thì không — dù tạo ra mức tuân theo cao hơn. Người đánh giá đã làm theo các đề xuất từ chối một cách mất cân đối, làm tăng đáng kể số âm tính giả, và tác động mạnh nhất ở các trường hợp sát ngưỡng.
Hai nhóm nghiên cứu khác nhau, hai lĩnh vực khác nhau, một cơ chế: một đầu ra trôi chảy của máy thay thế bước xác minh của con người thay vì cung cấp thông tin cho nó. Và âm tính giả là loại lỗi duy nhất mà một cái phễu về mặt cấu trúc không thể thấy. Một lần tuyển sai sẽ lộ ra trong sáu tháng. Một ứng viên tốt bị từ chối thì không bao giờ lộ ra.
Điều ứng viên đòi hỏi không phải điều bảo vệ bạn
Giờ hãy đặt dữ liệu khảo sát phía ứng viên cạnh các thí nghiệm, bởi phần trùng lắp khá khó chịu.
Ba mươi tám phần trăm ứng viên nói họ muốn biết rằng có một con người duyệt lại đánh giá của AI trước khi bất kỳ quyết định nào được đưa ra. Ba mươi chín phần trăm muốn một lời giải thích rõ ràng về điều AI đang đo lường (Greenhouse, 2026).
Đòi hỏi thứ hai mới là cái có bằng chứng phía sau. Sự minh bạch đã phục hồi hành vi chân thực một cách đo lường được.
Đòi hỏi thứ nhất — con người duyệt lại đánh giá của AI — gần như mô tả chính xác cấu hình có AI hỗ trợ, nơi con người nhượng bộ cho máy. Đó là lớp bảo vệ ứng viên muốn, lớp bảo vệ nhà cung cấp sẽ vui vẻ bán cho bạn, và cũng là lớp bảo vệ mà thí nghiệm thấy là thiếu sót. Không phải vì việc con người duyệt là vô giá trị, mà vì thứ tự có ý nghĩa: duyệt một bản đánh giá là một nhiệm vụ nhận thức khác với việc đánh giá một đoạn ghi hình.
Trong khi đó, 38 phần trăm ứng viên đã từ bỏ một quy trình tuyển dụng vì nó có phỏng vấn AI, và yếu tố đơn lẻ lớn nhất là video ghi trước được AI cho điểm mà không có con người nào hiện diện (33 phần trăm). Bạn đang mất những ứng viên thật vì một cấu hình mà ngoài ra còn không hiệu quả.
Phản biện trung thực
Bốn giới hạn, nói thẳng.
Ở đây không có độ lớn tác động, một cách có chủ ý. Toàn văn nằm sau tường phí, còn phần tóm tắt đã công bố và thông cáo báo chí chỉ nêu chiều hướng, không nêu độ lớn — "một mức tăng đáng kể", "hàng trăm người tìm việc trực tuyến". Ai dẫn cho bạn một con số phần trăm từ nghiên cứu này thì người đó đang bịa ra. Điều đã được xác lập là chiều hướng và thứ tự của các tác động; hãy coi độ lớn là chưa biết.
Một tác nhân, một nhà cung cấp, một thời điểm. Thất bại trong việc cho điểm được quan sát ở đúng tác nhân phổ biến nhất trong ngành mà các nhà nghiên cứu đã dùng. Một công cụ khác có thể phân biệt sự lừa dối tốt hơn. Hiện không công cụ nào quảng bá rằng mình làm được điều đó, và bản thân điều ấy đã có ý nghĩa, nhưng đừng khái quát hóa một năng lực từ một hệ thống đơn lẻ.
Nghiên cứu trước đó ủng hộ lập luận về việc lách hệ thống. Lakhiwal thừa nhận trực tiếp: có những công trình cho thấy nói cho ứng viên biết họ được đánh giá thế nào sẽ giúp họ can thiệp vào kết quả đánh giá. Nghiên cứu này tìm ra tác động thuần ngược lại trong bối cảnh đang xét. Một nghiên cứu được thiết kế tốt không cho cả một dòng tài liệu về nghỉ.
Lane và cộng sự là một working paper trên địa hạt liền kề. Nó đánh giá hồ sơ đổi mới, không phải ứng viên xin việc, và bản thảo có trước thời điểm lưu hành năm 2026. Nó củng cố cơ chế neo; nó không phải một lần tái lặp trong lĩnh vực tuyển dụng.
Cần thay đổi gì trước vòng sàng lọc tới
Bốn động thái. Không động thái nào cần một khoản ngân sách mới, và hai trong số đó là thay đổi thứ tự mà bạn có thể làm ngay tuần này.
- Công bố bằng ngôn ngữ dễ hiểu điều hệ thống đo lường. Không phải tên mô hình, không phải kiến trúc của nhà cung cấp — Lakhiwal nói rõ rằng ứng viên không cần những thứ đó. Hãy cho họ biết những hành vi nào được quan sát và những thuộc tính nào được cho điểm. Bản công bố dùng trong điều kiện thí nghiệm chỉ dài bốn dòng và đã phục hồi hành vi chân thực. Bạn cũng đồng thời xử lý được vấn đề 70 phần trăm không được thông báo đang đẩy ứng viên ra khỏi phễu của bạn.
- Để đánh giá của con người đi trước. Hãy để người duyệt cho điểm đoạn ghi hình trước khi điểm AI hiện ra, và lưu cả hai. Đây là thay đổi duy nhất xử lý trực tiếp phát hiện về neo, và nó không tốn gì ngoài thứ tự trên giao diện. Lưu ý rằng đây là suy luận của Scovai từ phát hiện này, không phải một điều kiện mà các nhà nghiên cứu đã kiểm chứng — bài báo cho thấy hiện tượng neo, chứ không phải cách chữa.
- Đừng coi "đã có người ký" là một dấu vết kiểm toán. Nếu người đó thấy điểm trước, thì phần phê duyệt của họ mang theo các lỗi của điểm số, kèm tên một con người. Điều làm một quyết định sàng lọc có thể bảo vệ được là một phán đoán của con người được ghi nhận độc lập, có lưu vết theo từng lần tuyển — định vị cấp doanh nghiệp của Scovai, bao gồm bản ghi quyết định của con người theo Điều 14 của EU AI Act, có mô tả một cách cấu trúc điều đó.
- Hãy kiểm toán âm tính giả, không phải độ chính xác. Lấy một mẫu các ứng viên mà bộ sàng lọc AI của bạn đã từ chối ở vùng sát ngưỡng và để ai đó cho điểm các đoạn ghi hình theo cách mù. Kết quả của Lane nói rằng lỗi ở phía từ chối chính là nơi sự tuân theo tập trung, và các chỉ số của bạn về mặt cấu trúc thì mù với chúng.
Hệ thống phỏng vấn AI của bạn có lẽ đã có một con người trong đó. Câu hỏi nghiên cứu không phải là người đó có ở đó hay không — mà là người đó có hình thành một phán đoán trước khi máy nói cho họ biết phải nghĩ gì hay không.
Hãy đi xem màn hình của người duyệt. Nếu điểm số tải lên phía trên đoạn ghi hình, bạn không có một con người trong vòng lặp. Bạn có một người làm chứng.