Scovai Scovai
AI & Operations 2026-09-14 1 min read

Bạn đang tối ưu phần tư rẻ nhất trong hóa đơn tác tử: McKinsey tính giám sát con người chiếm 70–75% chi phí biến đổi của một tác tử AI

DSL

Dr. Sarah Liu

Bạn đang tối ưu phần tư rẻ nhất trong hóa đơn tác tử: McKinsey tính giám sát con người chiếm 70–75% chi phí biến đổi của một tác tử AI

Hãy tính chi phí một tác tử chăm sóc khách hàng trong ngành ngân hàng: hóa đơn token chiếm 20 đến 25 phần trăm chi phí vận hành biến đổi của nó. Còn giám sát con người — các chuyên gia nghiệp vụ và rủi ro rà soát công việc của tác tử — chiếm 70 đến 75 phần trăm (McKinsey QuantumBlack, 2026).

Cùng một quy trình. Cùng một hóa đơn. Vậy mà gần như mọi luận chứng kinh doanh về tác tử mà tôi đọc trong năm nay đều đi tối ưu con số nhỏ hơn.

Chọn mô hình, cache prompt, một tầng suy luận rẻ hơn cho các lệnh gọi ít rủi ro — đó là nơi sự chú ý kỹ thuật đổ về, bởi đó là nơi chi phí đọc được. Nó đến hàng tháng, có chi tiết từng khoản, quy được trách nhiệm. Giám sát thì đến dưới dạng giờ công ăn lương nằm trong trung tâm chi phí của người khác, nên nó không bao giờ được ghi nhận là chi phí tác tử AI. Nó được ghi nhận như lý do khiến dự án thí điểm lặng lẽ không thể mở rộng.

McKinsey thực sự đã định giá điều gì

Hướng dẫn ngày 24 tháng 8 năm 2026 của QuantumBlack về kinh tế học quy trình tác tử làm một việc mà hầu hết các phân tích về tác tử đều bỏ qua: nó định giá công việc đã hoàn tất, chứ không phải phần mềm. Tác tử, hệ thống tất định, và những con người rà soát đầu ra — tất cả gộp vào một con số chi phí đầy đủ.

Trường hợp tiêu biểu là mở tài khoản ngân hàng. Quy trình vận hành năm đến bảy tác tử cùng nhiều hệ thống tất định, với hai đến bốn đội ngũ đảm nhiệm giám sát. Chi phí đầy đủ cho mỗi lượt onboarding hoàn tất giảm từ khoảng 50-150 đô la xuống còn khoảng 10-30 đô la (McKinsey QuantumBlack, 2026).

Đó là mức cải thiện gấp ba đến năm lần. Vậy nên đây không phải lập luận rằng tác tử không sinh lời. Đây là lập luận rằng bạn đang theo dõi sai khoản mục để biết tác tử của mình có sinh lời hay không.

Để hình dung quy mô: McKinsey ước tính các quy trình một tác tử hướng khách hàng tại một số ngân hàng tốn 20.000-30.000 đô la mỗi năm để vận hành, còn một đội đa tác tử tốn 100.000-200.000 đô la. Những con số này đến từ phân tích của McKinsey dựa trên nghiên cứu công khai và bảng giá công khai, chứ không phải sổ sách khách hàng đã kiểm toán — vậy nên hãy giữ chắc các tỷ lệ và nới lỏng các con số tuyệt đối.

Điều thực sự quyết định chi phí tác tử AI: tỷ lệ ngoại lệ, không phải mô hình

Trong onboarding khách hàng ngân hàng, McKinsey dự kiến 10 đến 20 phần trăm số lượt chạy tác tử sẽ được chuyên gia rủi ro và nghiệp vụ rà soát.

Tỷ lệ rà soát đó chính là toàn bộ cuộc chơi, và đáng để đi qua phép tính một cách chậm rãi — minh họa dưới đây là của tôi, không phải của McKinsey, nhưng dữ liệu đầu vào là của họ.

Lấy một quy trình có tỷ lệ rà soát 15% và 20 phút thời gian chuyên gia cho mỗi lần rà soát. Trên 1.000 lượt chạy, đó là 50 giờ thời gian nghiệp vụ cấp cao. Hạ tỷ lệ rà soát xuống 5% và cũng 1.000 lượt chạy đó chỉ tốn khoảng 17 giờ. Bạn đã cắt bỏ hai phần ba khoản mục đắt đỏ mà không hề đụng tới một mô hình, một prompt hay một hợp đồng nhà cung cấp nào.

Và hãy để ý ai là người thực hiện việc rà soát ấy. McKinsey nói rõ: chuyên gia nghiệp vụ và rủi ro — chính những người mà quy trình tồn tại để bảo vệ phán đoán của họ, chứ không phải một tầng QA cấp thấp có thể bố trí với giá rẻ. Chi phí giám sát đắt chính bởi giám sát rẻ thì không phải là giám sát; người rà soát phải đủ thâm niên để có thể bác bỏ tác tử. Bất kỳ kế hoạch nào giả định rằng tầng rà soát có thể ủy quyền xuống dưới, thực chất là kế hoạch ngừng rà soát.

Giờ hãy so sánh điều đó với cái đòn bẩy mà ai cũng thực sự kéo. McKinsey chỉ ra vỏn vẹn ba yếu tố chi phối chi phí token: chất lượng mô hình, yêu cầu độ trễ, và tần suất tác vụ. Giá của lớp mô hình tiên tiến đầu tháng 7 năm 2026 vào khoảng 5 đô la mỗi triệu token đầu vào và 30 đô la mỗi triệu token đầu ra cho một mô hình hàng đầu, so với 0,20 và 1,25 đô la cho một mô hình nhẹ đời trước. Một biên độ gấp hai mươi lăm lần — áp lên một phần tư hóa đơn.

Và đây là cái bẫy nằm bên trong sự tối ưu hiển nhiên ấy. Hạ cấp mô hình để cắt token thì bạn làm tăng tỷ lệ lỗi. Tỷ lệ lỗi cao hơn làm tăng tỷ lệ ngoại lệ. Tỷ lệ ngoại lệ cao hơn làm tăng số giờ rà soát, tức là ba phần tư kia. Khoản tiết kiệm token thường xuyên tài trợ cho một mức tăng giám sát mà không ai đo đếm, và quy trình trở nên đắt hơn trong khi bảng điều khiển lại cho thấy nó rẻ đi.

Vì sao số giờ rà soát không biến mất

Có bằng chứng độc lập cho thấy khoản mục giám sát mang tính cấu trúc, chứ không phải một vấn đề trưởng thành rồi sẽ tự vượt qua.

MIT Technology Review Insights và Microsoft đã khảo sát 300 lãnh đạo và người thực hành công nghệ, xếp hạng 101 tác vụ tác tử trên thang tin cậy 0-100. Mức tin cậy bám theo khả năng kiểm chứng của tác vụ và độ đầy đủ của bối cảnh kinh doanh, chứ không phải năng lực mô hình: tạo báo cáo tự động đạt 83,5 và mã khuôn mẫu đạt 82,5, cả hai đều có một thước đo chấm điểm khách quan duy nhất; trong khi cấu hình service mesh chỉ đạt 37,5 và kiểm thử khôi phục thảm họa đạt 43 — vẫn là những mô hình nền tảng đó, chỉ thiếu một cách sạch sẽ để biết đầu ra có đúng hay không. Trách nhiệm giải trình khiến 48% người trả lời lo ngại và ảo giác khiến 47% lo ngại, và 59% đã lên kế hoạch giám sát con người vĩnh viễn (MIT Technology Review Insights, 2026).

Dữ liệu vận hành thực tế cũng chỉ về cùng một hướng. Một nghiên cứu so sánh sản phẩm tác tử của Perplexity với sản phẩm tìm kiếm của chính hãng cho thấy thời gian hoàn tất các tác vụ tương đương giảm từ 269 phút xuống 36 phút — giảm 87% thời gian và 94% chi phí — trong khi phần việc tiếp nối mà người dùng thực hiện lại dịch chuyển lên trên, sang kiểm chứng và mở rộng (arXiv 2606.07489, 2026).

Công việc của con người dịch chuyển sang bước rà soát. McKinsey đơn giản là bên đầu tiên đặt giá cho nơi nó rơi xuống.

Khối lượng và tái sử dụng quyết định phép tính có khớp hay không

Nửa còn lại trong kinh tế học của McKinsey là chi phí cố định, và đó chính là nửa quyết định liệu các chương trình tác tử ở thị trường tầm trung có vượt được ngưỡng hay không.

Một tác tử hội thoại đảm nhiệm onboarding 2.500 khách hàng mới mỗi năm tốn 10.000-15.000 đô la. Nhân đôi khối lượng thì chi phí chỉ tăng lên 15.000-20.000 đô la — bởi hạ tầng AI và điều phối tác tử phần lớn là cố định, và chi phí cố định thì được phân bổ dần. Hãy để ý bên trong khoản mục điều phối đó có gì: năng lực khoa học dữ liệu thường trực để duy trì tác tử trong môi trường vận hành, thứ mà theo quan sát của McKinsey "thường cần được tinh chỉnh vài ngày một lần".

Vì vậy các quy trình khối lượng thấp thua hai lần. Chúng không được phân bổ chi phí cố định, và tỷ lệ giám sát của chúng vẫn cao vì chúng không bao giờ tích lũy đủ số lượt chạy để ai đó tìm ra các mẫu ngoại lệ và thiết kế loại bỏ chúng.

Lối thoát cho thị trường tầm trung là tái sử dụng, không phải quy mô. Nếu không quy trình đơn lẻ nào mang đủ khối lượng để phân bổ khoản hạ tầng và điều phối, câu hỏi trở thành: bao nhiêu quy trình có thể chạy trên cùng một bản dựng tác tử? Cách đóng khung của McKinsey là xây một lần, triển khai trên nhiều quy trình. Ba quy trình liền kề dùng chung một tác tử, một tầng bối cảnh và một quy chế rà soát sẽ vượt được ngưỡng chi phí cố định mà không quy trình nào trong số đó tự vượt nổi. Đó là một quyết định kiến trúc phải đưa ra trước dự án thí điểm đầu tiên, và rất khó lắp ghép về sau khi ba đội đã mỗi đội mua một giải pháp điểm riêng.

Sự bất đối xứng này hiện rõ trong dữ liệu áp dụng. Báo cáo State of AI 2026 của McKinsey cho thấy tỷ lệ tổ chức có doanh thu trên 1 tỷ đô la đang mở rộng quy mô tác tử tăng từ 27% lên 40%, trong khi các tổ chức dưới 1 tỷ đô la đứng yên ở 22%. Khoảng 20% cho biết chi phí vận hành AI đã hạn chế việc sử dụng, và tỷ lệ ghi nhận AI mang lại ít nhiều tác động tới EBIT giữ nguyên ở mức 37%, không đổi so với năm trước (McKinsey, 2026).

Mức độ áp dụng thì tích lũy. Tác động tài chính được báo cáo thì không. Đó là dấu hiệu đặc trưng của một khoản mục chi phí không ai quản trị.

Phản biện trung thực: đây là ngành ngân hàng, và đây là con số ước tính

Hai điểm dè dặt mà bạn nên nghe từ tôi hơn là từ giám đốc tài chính của mình.

Thứ nhất, con số 70-75% được rút ra từ dịch vụ tài chính có quản lý chặt và hướng tới khách hàng. Cường độ giám sát là hàm số của mức độ chịu quản lý và hậu quả của sai sót. Việc phân loại phiếu yêu cầu nội bộ tại một công ty logistics 200 người nằm trên một đường cong khác, và ở đó tỷ lệ phân chia có thể gần với năm mươi-năm mươi hơn.

Thứ hai, đây là chi phí được mô hình hóa dựa trên bảng giá công khai và nghiên cứu công khai, chứ không phải sổ sách đo đếm từ một dự án khách hàng. Hãy coi chúng là một ước tính được xác định rõ, không phải một phép đo.

Nhưng hãy để ý sai số nghiêng về phía nào. Giá token đã giảm đều và sẽ còn giảm tiếp. Lương người rà soát thì chưa và sẽ không giảm. Mỗi tháng trôi qua đều đẩy tỷ lệ này xa hơn nữa về phía bất lợi cho token, chứ không quay ngược lại. Nếu 70-75% là sai với bối cảnh của bạn hôm nay, cách hiệu chỉnh trung thực là hỏi con số đó sẽ thành bao nhiêu sau mười tám tháng — chứ không phải giả định nó sẽ rơi ngược về mức mà bảng điều khiển token nhìn thấy được.

Hãy định giá số giờ rà soát trước khi phê duyệt dự án thí điểm

Năm điều cần thay đổi trong cách bạn đánh giá đề xuất tác tử tiếp theo.

  1. Đưa tỷ lệ ngoại lệ vào luận chứng kinh doanh như một con số được nêu đích danh. Tỷ lệ phần trăm số lượt chạy cần rà soát thủ công, số phút dự kiến cho mỗi lần rà soát, chi phí giờ công đầy đủ của người rà soát. Nếu không ai chịu cam kết ba con số đó, bạn không có luận chứng kinh doanh — bạn có một bản demo được ghim kèm ngân sách.
  2. Hãy kiến tạo khả năng kiểm chứng trước khi mở rộng phạm vi. Bảng xếp hạng MIT–Microsoft cho thấy niềm tin đi theo những tác vụ có một thước đo thành công duy nhất và đọc được. Thuộc tính đó có thể xây dựng được: đo đạc thước đo, mã hóa bối cảnh kinh doanh, thu hẹp phạm vi. Hãy sắp xếp thứ tự triển khai theo khả năng kiểm chứng, chứ không theo tác vụ nào trông đơn giản nhất.
  3. Xếp hạng các quy trình ứng viên trước hết theo số lượt chạy hằng năm. Tái sử dụng và khối lượng mới là thứ phân bổ chi phí cố định. Một trường hợp sử dụng khéo léo nhưng khối lượng thấp luôn là khoản đầu tư tệ hơn một trường hợp nhàm chán nhưng khối lượng cao.
  4. Lập ngân sách rõ ràng cho khoản mục bảo trì. Tác tử phải tinh chỉnh vài ngày một lần đòi hỏi năng lực kỹ thuật thường trực. Đó là chi phí cố định lâu dài, không phải chi phí dự án.
  5. Báo cáo ROI của công việc đã hoàn tất. Chi phí đầy đủ để làm xong công việc — con người, tác tử và hệ thống tất định cộng lại — đo trên giá trị của chính công việc đó. Không phải chi phí mỗi token, cũng không phải số giờ tiết kiệm trên lý thuyết.

Khuyến nghị của chính McKinsey đi ngược lại bản năng: thay vì tối ưu việc chọn mô hình, hãy thiết kế lại quy trình để cắt giảm tỷ lệ ngoại lệ và đơn giản hóa những khâu rà soát kích hoạt sự can thiệp tốn kém của con người. Đó là một nhiệm vụ kỹ thuật quy trình nằm bên trong thứ mà ai cũng vẫn coi là một quyết định mua sắm.

Cần quyết điều gì trong quý này

Hãy tìm dự án thí điểm tác tử đang chờ chữ ký của bạn và yêu cầu một con số không có trong bộ slide: số giờ rà soát dự kiến trên mỗi trăm lượt chạy.

Nếu câu trả lời chỉ là một cái nhún vai, thì người ta không yêu cầu bạn phê duyệt một phần mềm. Người ta đang yêu cầu bạn bố trí nhân sự cho một đội rà soát mà không ai lập ngân sách — và làm điều đó trên đúng ba phần tư chi phí tác tử AI mà bảng điều khiển của bạn chưa bao giờ được thiết kế để cho bạn thấy.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.