Một triệu tác nhân AI: Bài toán hệ phân tán, không phải bài toán trí tuệ
Khi số lượng tác nhân AI tăng lên hàng nghìn, hàng triệu, vấn đề không còn là trí tuệ nhân tạo mà là hệ phân tán. Nghiên cứu từ Google và MIT cho thấy thêm tác nhân có thể cải thiện 80,9% với tác vụ song song nhưng làm giảm tới 70% với tác vụ tuần tự. Bài học cốt lõi: trạng thái phải tồn tại lâu hơn tác nhân.

Một triệu tác nhân AI: Bài toán hệ phân tán, không phải bài toán trí tuệ
Khi các tác nhân AI (AI agent) mở rộng từ một lên hàng triệu, câu hỏi trở nên giống hệt những gì các kỹ sư hệ phân tán đã giải quyết hàng chục năm nay: lập lịch, điều phối, phục hồi sau lỗi và quản lý trạng thái. Nghiên cứu mới từ Google Research và MIT chỉ ra rằng thêm tác nhân không đồng nghĩa với thêm trí tuệ — đôi khi còn phản tác dụng.
Một tác nhân là một tiến trình
Tác nhân AI đang dần trông giống các tiến trình trong hệ điều hành. Dự án AIOS của Đại học Rutgers đề xuất một nhân hệ điều hành (kernel) dành riêng cho tác nhân, nơi mỗi yêu cầu được chia nhỏ thành các lời gọi hệ thống: gọi LLM, đọc bộ nhớ, ghi dữ liệu, sử dụng công cụ. Một bộ lập lịch quyết định lời gọi nào chạy tiếp theo, còn trình quản lý ngữ cảnh chụp lại trạng thái giữa chừng để có thể ngắt và khôi phục.
Kết quả: tốc độ thực thi nhanh hơn tới 2,1 lần khi phục vụ các tác nhân xây dựng trên framework hiện có. Lập lịch, chuyển ngữ cảnh, quản lý bộ nhớ, kiểm soát truy cập — đó chính là hệ điều hành. Chỉ khác là các tiến trình ở đây biết suy nghĩ.
Một nghiên cứu khác tại ACL 2026 với tên gọi LLM-as-Scheduler cho thấy phần lớn truy vấn không cần đến quy trình đa tác nhân phức tạp. Bằng cách để bộ lập lịch tự chọn quy trình cho từng truy vấn, họ tiết kiệm 43% token và giảm hơn 36% độ trễ, trong khi độ chính xác chỉ giảm tối đa 1,4 điểm phần trăm.
Tác nhân AI vận hành trên tài nguyên hữu hạn
Mười người tự phối hợp, mười nghìn người cần quản lý
Mười người có thể tự phối hợp trong một căn phòng. Một nghìn người thì không — đó là lý do chúng ta phát minh ra nhóm, quản lý, phòng ban và cuối cùng là CEO. Quản lý tồn tại một phần vì bản thân việc điều phối đã là công việc.
Google Research và MIT đã chạy một nghiên cứu có kiểm soát với 180 cấu hình tác nhân trên năm kiến trúc khác nhau. Kết luận đáng chú ý:
- Với tác vụ cần suy luận tuần tự nghiêm ngặt, mọi biến thể đa tác nhân đều làm kết quả tệ hơn từ 39% đến 70%.
- Với công việc có thể song song hóa như suy luận tài chính, điều phối tập trung giúp cải thiện 80,9%.
Lý do rất rõ ràng: chi phí giao tiếp làm phân mảnh suy luận và lấy đi "ngân sách nhận thức" vốn dành cho chính nhiệm vụ. Thêm tác nhân không mua thêm trí tuệ — nó mua thêm điều phối, và điều phối tiêu tốn đúng nguồn lực mà nhiệm vụ đang cần.
Phát hiện thứ hai thậm chí còn quan trọng hơn: các tác nhân chạy song song mà không trao đổi với nhau khuếch đại sai số lên 17,2 lần. Chỉ cần đặt một bộ điều phối trung tâm phía trước, con số đó giảm xuống 4,4 lần. Đó chính là vai trò của người quản lý: không làm mọi việc, mà quyết định việc gì cần xảy ra, chia nhỏ công việc, giám sát tiến độ và hợp nhất kết quả.
Giao tiếp không phải là điều phối
Nghiên cứu Silo-Bench (được chấp nhận tại ACL 2026) giao cho các nhóm từ 2 đến 100 tác nhân ba mươi nhiệm vụ thuật toán phân tán, với dữ liệu được phân mảnh để không tác nhân nào nhìn thấy toàn bộ. Qua 1.620 thí nghiệm, các tác nhân nói chuyện rất nhiều nhưng suy luận phân tán rất kém.
Các tác giả gọi hiện tượng này là Khoảng cách Giao tiếp – Suy luận, và cách diễn đạt ngắn gọn của họ sắc sảo hơn bất cứ điều gì tôi có thể viết: "các tác nhân giao tiếp giỏi nhưng suy luận phân tán kém."
Tệ hơn, mọi thứ xấu đi theo quy mô. Tỷ lệ thành công trung bình giảm từ 61% với 2 tác nhân xuống 18% với 100 tác nhân ở mô hình mạnh nhất. Những nhiệm vụ khó nhất cần hợp nhất toàn bộ dữ liệu đạt tỷ lệ thành công bằng 0 khi có 50 tác nhân trở lên.
Nếu bạn từng ở trong một kênh Slack 100 người, bạn đã biết điều này. Đưa 100 người vào một kênh không tạo ra tổ chức. Đưa 100 tác nhân lên cùng một bus tin nhắn cũng không tạo ra trí tuệ tập thể.
Điều gì tồn tại lâu hơn tác nhân?
Hầu hết hệ đa tác nhân hiện nay điều phối qua một bộ điều phối trung tâm. Các kỹ sư hệ phân tán biết chuyện gì xảy ra tiếp theo: nút chính thành điểm nghẽn, rồi nút chính chết. Nó hết ngữ cảnh, bị kẹt, hoặc máy chạy nó hỏng.
Các tác giả của AgentNet (NeurIPS 2025) nói thẳng: hệ thống hiện tại "thường dựa vào điều phối tập trung, dẫn đến điểm nghẽn khả năng mở rộng, giảm khả năng thích ứng và điểm lỗi đơn." Giải pháp của họ là định tuyến phi tập trung, nơi các tác nhân chuyển giao công việc dựa trên chuyên môn cục bộ.
Trạng thái phải tồn tại lâu hơn từng tác nhân
Christopher Meiklejohn, người dành cả sự nghiệp cho lập trình phân tán, đã nói thẳng vào mùa xuân năm nay: "khoảnh khắc bạn có nhiều tác nhân cùng làm việc trên một codebase, bạn có một hệ phân tán" — và các vấn đề kéo theo "không phải lỗi, mà là hệ quả tất yếu của việc có nhiều tiến trình tự trị chia sẻ trạng thái."
Vậy điều gì thực sự quan trọng? Không phải vòng đời của tác nhân, mà là vòng đời của trạng thái. Mục tiêu, kế hoạch, quyết định, nhiệm vụ đã xong, nhiệm vụ đang chờ, tạo tác, quyền sở hữu và các điểm kiểm tra — tất cả phải tồn tại lâu hơn bất kỳ tác nhân riêng lẻ nào. Tác nhân đến rồi đi. Tổ chức vẫn tiếp tục.
Vấn đề thú vị thực sự
Bạn cần một bộ lập lịch, một số cấu trúc phân cấp, bộ nhớ tồn tại lâu hơn người lao động, quyền sở hữu rõ ràng, cơ chế chống quá tải, phục hồi sau lỗi và đủ khả năng quan sát để biết tác nhân nào đang bị kẹt. Đôi khi bạn cần một thủ lĩnh, và một cách để thay thế nó.
Đó là lý do câu hỏi hạ tầng thú vị không phải "làm sao xây dựng một tác nhân chạy mãi không dừng?" mà là "làm sao lập lịch và điều phối hàng triệu lao động thông minh — những kẻ không chạy mãi không dừng?"
Hệ điều hành dạy chúng ta cách lập lịch tiến trình. Các trình điều phối container dạy chúng ta cách lập lịch và phục hồi khối lượng công việc tạm thời. Hệ phân tán dạy chúng ta cách những cỗ máy không đáng tin cậy cộng lại thành một dịch vụ đáng tin cậy. Các tổ chức loài người dạy chúng ta cách những cá nhân hữu hạn xây nên những thứ không ai làm nổi một mình. Tác nhân AI nằm đúng tại giao điểm của cả bốn.
Một tác nhân đơn lẻ là bài toán trí tuệ. Một triệu tác nhân là bài toán hệ phân tán.