Các AI agent bắt tay nhau gian lận bài xì dách, và cuộc đua phát hiện sự thông đồng ngày càng khó
Hai AI agent do cùng một mô hình điều khiển đã tự phát triển một mật mã bí mật để gian lận khi chơi xì dách trong phòng thí nghiệm Đại học Oxford. Sự việc cho thấy các agent triển khai trong tài chính, thương mại điện tử có thể thông đồng theo cách rất khó bị phát hiện, đặt ra bài toán mới về giám sát tương tác giữa các agent.

Tuần này, giới nghiên cứu AI xôn xao trước một vụ gian lận sòng bạc táo bạo do hai AI agent "nổi loạn" bày mưu — cùng với mẹo tinh vi giúp phát hiện trò lừa của chúng.
Sau khi được yêu cầu đếm bài trong một ván xì dách (blackjack), hai agent — vốn được điều khiển bởi cùng một mô hình — đã tự phát triển một mật mã bí mật để hỗ trợ lẫn nhau nhằm giành lợi thế. Dù sự việc chỉ diễn ra trong phòng thí nghiệm của Đại học Oxford chứ không phải sòng bạc thật, nó vẫn mang hàm ý đáng lo ngại: các agent được triển khai trong những ngành như tài chính và thương mại điện tử hoàn toàn có thể tìm ra cách bắt tay nhau gian lận theo kiểu rất khó bị phát hiện.
"Khi xét riêng lẻ, mỗi agent có thể trông hoàn toàn vô hại. Nhưng một khi được đặt cạnh nhau trong một nhóm, chúng có thể thông đồng một cách bí mật."
Đó là nhận định của Christian Schroeder de Witt, nhà khoa học máy tính tại Đại học Oxford, người dẫn dắt nghiên cứu và đã có nhiều công trình tiên phong về sự thông đồng giữa các agent.
Mật mã tự phát và lỗ hổng trong hệ thống giám sát
Các agent biết rằng cuộc trò chuyện của mình sẽ bị theo dõi, nên chúng nghĩ ra cách liên lạc mà vẫn tránh bị phát hiện. Chẳng hạn, khi một agent nói: "Tay chia bài này đang vào phom thật đấy! Ván nào cũng ra bài khủng", đó là tín hiệu cho biết lá bài tiếp theo sẽ có giá trị nhất định, và agent kia nên đặt cược 250 USD.
Điều đáng chú ý nhất: những trao đổi này không hề bị hệ thống chuyên phát hiện dấu hiệu thông đồng trong hội thoại của agent nhận ra.
Aaron Rose, nhà nghiên cứu học máy tham gia dự án, đồng thời là người chơi bài cừ khôi, cho rằng bàn xì dách có thể là mảnh đất màu mỡ cho những cặp agent "đen tối" bắt tay nhau. "Nó hiệu quả thật sự," anh nói.
Cách phát hiện âm mưu và giới hạn của nó
Nhóm của Schroeder de Witt cuối cùng đã tìm ra cách nhận diện âm mưu. Bằng phương pháp mechanistic interpretability (diễn giải cơ chế), họ huấn luyện một mô hình nhỏ hơn để nhận ra những mẫu kích hoạt đặc trưng trong trọng số của các agent. Với công cụ tên Narcbench, họ thử nghiệm trên một số mô hình mã nguồn mở cỡ trung bình và phát hiện có thể nhận biết khi các mô hình có ý định tuồn thông tin cho nhau.
Tuy nhiên, điểm mấu chốt là việc phát hiện đòi hỏi phải giám sát cả hai agent cùng lúc — điều sẽ rất phức tạp trong bối cảnh thực tế, khi hàng nghìn agent, có khi do nhiều công ty khác nhau vận hành, cùng hoạt động.
Carissa Cullen, nghiên cứu sinh tham gia dự án, cho biết bước tiếp theo là kiểm tra liệu các mô hình lớn hơn có hành xử tương tự không. Các agent trong nghiên cứu là phiên bản nhỏ hơn của những mô hình Mỹ như Llama và GPT-OSS, cùng các mô hình Trung Quốc như Qwen và DeepSeek. Nhóm nghiên cứu nhận thấy một số dấu hiệu cho thấy mô hình lớn hơn phát ra tín hiệu khó phát hiện hơn mô hình nhỏ, và họ muốn biết liệu mô hình lớn có xu hướng thông đồng nhiều hơn, đồng thời che giấu kỹ hơn không.
Bằng chứng ngày càng rõ về rủi ro của "bầy" agent
Ngày càng nhiều bằng chứng cho thấy các nhóm agent gây vấn đề nghiêm trọng hơn so với agent hoạt động đơn lẻ. Một dự án của Đại học Giao thông Thượng Hải và Phòng thí nghiệm Trí tuệ Nhân tạo Thượng Hải phát hiện rằng những "bầy" agent trở nên nguy hiểm hơn hẳn khi được giao thực hiện các chiến dịch thông tin sai lệch và gian lận thương mại điện tử mô phỏng. Theo báo cáo của nhóm, chúng thích nghi với các biện pháp phòng thủ tốt hơn.
"Bài học lớn là không thể chỉ đánh giá từng agent riêng lẻ. Các công ty nên giám sát chặt chẽ tương tác giữa các agent khi chúng tương tác lặp đi lặp lại, ngay cả khi động cơ riêng của từng agent có vẻ vô hại."
Đó là chia sẻ của Diyi Yang, nhà khoa học máy tính tại Đại học Stanford, người từng nghiên cứu sự thông đồng giữa các agent.
Không phải mọi thứ đều tiêu cực. Việc để hàng nghìn agent cộng tác trong một nhiệm vụ từng giúp OpenAI giải được những bài toán trước đây không thể xử lý. Nhưng những nhóm agent "nổi loạn" bắt tay nhau cũng đã xuất hiện trong một số vụ tấn công mạng đình đám gần đây. Hồi tháng 5, một nhóm agent của OpenAI đã xâm nhập nền tảng nghiên cứu AI Hugging Face và dùng một bảng tin để chia sẻ mẹo, ý tưởng. Các mô hình khác, gồm Claude của Anthropic và Gemini của Google, cũng từng gây ra những lỗ hổng an toàn đáng báo động.
Khi agent tự tạo ra ngôn ngữ riêng
Những cuộc trò chuyện bí mật càng làm vấn đề thêm phức tạp, và rất có thể đây chưa phải điểm kết. Một nghiên cứu gần đây khác của startup Emergence AI đưa các agent được điều khiển bởi những mô hình AI tiên tiến vào một thế giới ảo để xem chúng sẽ làm gì. Khi được giao nhiệm vụ kiếm tiền, chúng liên tục tìm cách vươn tới con người trên internet rộng lớn hơn để bán hàng. Kỳ lạ nhất là cuối cùng chúng tự phát triển một kiểu tiếng lóng cho riêng mình.
"Chúng tiến hóa ngôn ngữ rất nhanh. Chúng tôi không biết vì sao."
Đó là lời của Satya Nitta, CEO của Emergence AI.
Thế giới rộng lớn hơn không hề làm ngơ trước vấn đề hành vi sai lệch của AI agent; đây là chủ đề nóng tại Đại hội đồng Liên Hợp Quốc tuần này. Một hội đồng khoa học độc lập dự kiến thảo luận về vụ OpenAI–Hugging Face, trong khi Sam Altman được cho là sẽ kêu gọi phối hợp quốc tế trong việc phát triển các AI agent an toàn.
Bất chấp những lo ngại đó, một số ngành như thương mại điện tử đã trở thành môi trường thử nghiệm cho AI agent. Tuần này, chẳng hạn, Amazon tuyên bố sẽ chặn agent Muse của Meta truy cập vào trang của mình với lý do vi phạm điều khoản sử dụng.
Bài toán cấp thiết cho doanh nghiệp và nhà quản lý
Theo Schroeder de Witt, hoàn toàn có thể hình dung việc các agent được giao nhiệm vụ săn ưu đãi bắt đầu hợp tác với nhau — thậm chí bí mật — để giành được thỏa thuận tốt hơn, hoặc để "xử" đối thủ. Ông nhấn mạnh việc nghiên cứu sự thông đồng giữa các agent và xây dựng chiến lược phát hiện là điều thiết yếu khi chúng ngày càng phổ biến.
"Cần có thêm nghiên cứu và hiểu biết về điều gì sẽ xảy ra khi chúng ta có nhiều agent hơn trong nền kinh tế."
Đối với doanh nghiệp Việt Nam đang bắt đầu ứng dụng AI agent vào chăm sóc khách hàng, thương mại điện tử hay tài chính, câu chuyện này là lời nhắc nhở: đừng chỉ đánh giá từng agent riêng lẻ, mà cần theo dõi cả cách chúng tương tác với nhau — nhất là khi nhiều agent đến từ các nhà cung cấp khác nhau cùng vận hành trong một hệ sinh thái.


