85% doanh nghiệp từng 'dính đòn' vì sai lầm AI lại đang loại bỏ con người khỏi khâu kiểm soát - vì sao?
Khảo sát VB Pulse mới của VentureBeat cho thấy các doanh nghiệp từng chứng kiến AI agent vượt qua bài kiểm tra nội bộ nhưng thất bại trong môi trường thực tế lại đang đẩy nhanh tiến trình loại bỏ con người khỏi quyết định triển khai, thay vì thận trọng hơn. Dù niềm tin vào đánh giá tự động tăng, gần một nửa số doanh nghiệp vẫn ghi nhận sự cố do AI gây ra cho khách hàng, cho thấy khoảng cách lớn giữa sự tự tin và hiệu quả thực tế của hệ thống kiểm định.

Doanh nghiệp từng "cháy túi" vì AI lại càng đẩy nhanh việc loại con người khỏi vòng kiểm soát
Một nghiên cứu mới từ VentureBeat Intelligence mang tên VB Pulse đã hé lộ một nghịch lý đáng chú ý trong làn sóng triển khai AI agent tại doanh nghiệp: những công ty từng hứng chịu thất bại do AI agent vượt qua bài kiểm tra nội bộ rồi gây lỗi trong môi trường thực tế lại là những đơn vị đang loại bỏ con người khỏi quy trình phê duyệt nhanh nhất, thay vì thắt chặt kiểm soát.
Khảo sát thực hiện trên 108 doanh nghiệp vào tháng 7 cho thấy niềm tin vào hệ thống đánh giá tự động đang tăng đều, nhưng tỷ lệ sự cố do AI gây ra cho khách hàng vẫn không hề suy giảm. Điều này đặt ra câu hỏi lớn về độ tin cậy của cả quy trình kiểm định lẫn chiến lược "tự động hóa triệt để" mà nhiều doanh nghiệp đang theo đuổi.
Đánh giá tự động thăng hạng niềm tin, nhưng kết quả thực tế vẫn giậm chân tại chỗ
Trong tháng 7, 13% trong số 108 doanh nghiệp được khảo sát cho biết họ hoàn toàn tin tưởng vào hệ thống đánh giá tự động, tăng từ mức chỉ 5% của tháng trước đó. Cùng lúc, tỷ lệ doanh nghiệp coi "sự thiếu đồng bộ giữa bài kiểm tra và kết quả thực tế" là mối lo ngại lớn nhất đã giảm 10 điểm, từ 29% xuống còn 19%.
Tuy nhiên, bức tranh toàn cảnh lại không mấy sáng sủa. Vẫn có tới 49% doanh nghiệp thừa nhận rằng một AI agent hoặc tính năng hỗ trợ bởi LLM dù đã vượt qua vòng kiểm tra nội bộ nhưng sau đó vẫn gây ra sự cố mà khách hàng nhìn thấy được, gần như không đổi so với con số 50% của tháng 6. Đáng chú ý, gần một phần tư (24%) cho biết sự cố này đã xảy ra nhiều hơn một lần.
Nghịch lý lớn: Công ty "dính đòn" lại càng loại bỏ con người
Điểm dữ liệu gây chú ý nhất nằm ở sự khác biệt giữa hai nhóm doanh nghiệp: nhóm từng trải qua thất bại do AI và nhóm chưa từng gặp sự cố tương tự.
Trong số các doanh nghiệp từng chứng kiến AI vượt qua kiểm tra rồi làm khách hàng thất vọng, chỉ 4% đặt trọn niềm tin vào các kiểm tra tự động. Trong khi đó, ở nhóm không ghi nhận sự cố nào, con số này lên tới 24% — chênh lệch gấp sáu lần.
Nghịch lý hơn nữa ở hành vi tiếp theo: 85% doanh nghiệp từng bị "đốt cháy" đang theo đuổi mô hình triển khai không cần con người phê duyệt (ít nhất cho các trường hợp rủi ro thấp), so với 61% ở nhóm không gặp sự cố. Chỉ 11% trong nhóm bị ảnh hưởng từ chối hoàn toàn việc tự động hóa quy trình triển khai, trong khi con số này ở nhóm còn lại là 24%.
Giải thích hợp lý nhất cho điều này là "mức độ trưởng thành trong triển khai". Các tổ chức vận hành nhiều agent hơn, với khối lượng lớn hơn và trong các quy trình quan trọng hơn, vừa có nhiều khả năng gặp thất bại hơn, vừa có hạ tầng kỹ thuật cần thiết cho việc triển khai tự động.
Khoảng trống chí mạng: Giám sát chất lượng sau triển khai vẫn bị bỏ ngỏ
Đánh giá trước triển khai và giám sát môi trường sản xuất trả lời hai câu hỏi khác nhau. Đánh giá kiểm tra xem AI agent có "đủ điều kiện" ra mắt hay không, còn giám sát sản xuất theo dõi những gì agent thực sự làm sau khi phát hành.
Khảo sát cho thấy hầu hết doanh nghiệp vẫn chỉ tập trung vào việc "hệ thống có hoạt động hay không", thay vì "câu trả lời có chính xác hay không". Cụ thể:
- 26% dùng các khẳng định chất lượng nội tuyến (bộ kiểm tra tự động hoặc hàng rào bảo vệ theo dõi lưu lượng trực tiếp)
- 26% tập trung vào dấu vết giao dịch (span hạ tầng, mức sử dụng token, đầu vào/đầu ra thô)
- 24% chủ yếu theo dõi các chỉ số gateway như độ trễ, lỗi và chi phí
Vấn đề nằm ở chỗ: dữ liệu dấu vết và gateway có thể phát hiện sự cố ngừng hoạt động, chậm hay yêu cầu lỗi, nhưng không thể nhận ra một câu trả lời sai nhưng trôi chảy, nhanh và tự tin. Một nửa số doanh nghiệp chỉ giám sát xem agent có "chạy" không, trong khi chỉ hơn một phần tư tự động kiểm tra tính đúng đắn về mặt ngữ nghĩa của đầu ra.
Điều đáng lo ngại nhất: trong nhóm 40 doanh nghiệp đã cho phép triển khai không cần phê duyệt, chỉ 28% cài đặt hệ thống kiểm tra chất lượng ngữ nghĩa tự động cho các phản hồi trực tiếp. Nói cách khác, hầu hết doanh nghiệp đã loại con người khỏi quyết định triển khai nhưng lại không có "lưới an toàn" tự động nào sau đó.
Thị trường công cụ đánh giá AI agent đang hình thành
Một tín hiệu tích cực là các doanh nghiệp đang dần bổ sung các công cụ đánh giá chuyên dụng, và các nền tảng chuyên biệt đang chiếm được chỗ đứng:
- OpenAI evals/traces tự nhiên dẫn đầu với 18% thị phần nền tảng chính
- DeepEval của Confident AI đứng thứ hai với 17%
- Braintrust theo sát với 15%
- Anthropic Claude Console/Workbench giữ 12%
Đáng chú ý, Braintrust đã tăng thị phần từ 8% lên 15% chỉ trong một tháng — mức tăng lớn nhất theo báo cáo. Điều này cho thấy đánh giá AI agent đang dần trở thành một lớp phần mềm chuyên biệt trong doanh nghiệp, thay vì chỉ là các tập lệnh nội bộ hoặc tính năng nằm trong nền tảng của nhà cung cấp mô hình.
Đầu tư vào con người để "vá" lỗ hổng tự động hóa
Dữ liệu ngân sách cho thấy cách doanh nghiệp xử lý mâu thuẫn giữa tự chủ cao và đánh giá kém tin cậy: 31% doanh nghiệp tăng đầu tư nhiều nhất vào quy trình rà soát có con người, chỉ nhỉnh hơn một chút so với giám sát sản xuất (30%). Đánh giá tự động chỉ đứng thứ ba với 19%.
Trong số các doanh nghiệp từng gặp sự cố, 38% cho biết rà soát có con người sẽ nhận được mức đầu tư tăng nhanh nhất, so với 24% ở nhóm không gặp sự cố.
Điều này tạo ra một nghịch lý thú vị: nhóm từng "dính đòn" vừa là nhóm loại bỏ con người khỏi khâu phê duyệt nhiều nhất, lại vừa là nhóm chi nhiều nhất cho con người ở các khâu khác. Chiến lược của họ có vẻ là "tự động hóa kèm phao cứu sinh con người" — để agent tự do hoạt động nhanh hơn, rồi dùng người rà soát để bắt những lỗi mà máy móc bỏ sót.
Bài học rút ra
Dữ liệu tháng 7 không cho thấy hệ thống đánh giá AI agent của doanh nghiệp đang thất bại toàn diện, cũng không chứng minh các "giám khảo tự động" đang tệ đi. Điều nó cho thấy chính xác là: niềm tin đã tăng trước khi tỷ lệ thất bại đo lường được cải thiện.
Kết quả trung tâm vẫn còn nguyên tính thách thức: gần một nửa số doanh nghiệp được khảo sát vẫn báo cáo rằng một tính năng AI vượt qua kiểm tra nội bộ nhưng sau đó làm khách hàng thất vọng. Những doanh nghiệp có trải nghiệm này đặt ít niềm tin hơn vào tự động hóa — nhưng lại di chuyển nhanh hơn về phía triển khai không cần phê duyệt của con người.
Bài học vận hành rõ ràng nhất từ dữ liệu: điểm số vượt qua bài kiểm tra trước khi phát hành chỉ là điểm khởi đầu của việc giám sát, không phải là kết thúc. Với hầu hết doanh nghiệp, các kiểm tra chất lượng sản xuất và đánh giá toàn diện để lấp đầy khoảng trống này vẫn chưa được thiết lập — một lỗ hổng lớn cần sớm được giải quyết trước khi làn sóng AI agent tiếp tục lan rộng.