Brood War Bench: Khi các mô hình AI học chơi StarCraft nhưng vẫn chỉ ở trình độ người mới
Một benchmark mới có tên Brood War Bench đã cho các mô hình AI hàng đầu như Codex Astra, Claude Fable và Grok 4.6 thi đấu StarCraft: Brood War với nhau. Kết quả cho thấy không mô hình nào vượt qua trình độ người mới, dù Codex Astra tỏ ra vượt trội rõ rệt. Đáng chú ý, các mô hình cũ thường chơi RTS như game theo lượt và bị tiêu diệt trong lúc đang suy nghĩ.

Brood War Bench: Khi các mô hình AI học chơi StarCraft nhưng vẫn chỉ ở trình độ người mới
Một dự án benchmark có tên Brood War Bench vừa công bố kết quả thử nghiệm cho các mô hình AI lớn nhất hiện nay thi đấu StarCraft: Brood War — tựa game chiến thuật thời gian thực (RTS) huyền thoại của Blizzard. Điểm đáng chú ý: dù là những mô hình tiên tiến nhất, không một AI nào chơi vượt qua trình độ người mới.
Bài kiểm tra này ra đời khá tình cờ. Tác giả đã xây dựng một phiên bản Brood War chỉ có thể chơi thông qua các tác nhân AI (agent) để chơi cùng bạn bè. Khi thấy bạn mình chơi tốt bất ngờ dù gần như chưa từng chơi StarCraft, anh phát hiện ra họ chỉ cần ra lệnh cho agent tấn công, và agent tự xây dựng đội quân rồi thực hiện toàn bộ đợt tấn công. Câu hỏi đặt ra: liệu các agent có thể tự đi xa đến đâu? Brood War Bench chính là câu trả lời.
Bảng xếp hạng: Codex Astra dẫn đầu tuyệt đối
Kết quả cho thấy Codex Astra ở chế độ xhigh là cái tên áp đảo hoàn toàn, thắng 18 trận, thua 0, đạt tỉ lệ thắng 100%. Ở chế độ medium, nó cũng chỉ thua đúng 2 trận với tỉ lệ thắng 88,9%.
So sánh hiệu năng các mô hình AI khi chơi Brood War
Các vị trí tiếp theo thuộc về Claude Fable (83,3%), Codex 5.6 Sol và Claude Opus 5 (cùng 66,7%). Trong khi đó, Grok 4.6 gây thất vọng nặng nề khi chỉ đạt tỉ lệ thắng thấp nhất, thậm chí có cấu hình low không thắng trận nào.
Một điểm thú vị: chi phí mỗi trận không tỉ lệ thuận với hiệu quả. Codex Astra ở xhigh tốn khoảng 10,54 USD/trận, trong khi Claude Opus 5 tốn tới 20,78 USD/trận nhưng chỉ thắng 66,7%. Ngược lại, Codex 5.6 Luna ở low chỉ tốn 0,42 USD/trận mà vẫn đạt 50% tỉ lệ thắng.
Điều gì tạo nên sự khác biệt?
Codex tìm ra chiến thuật "phá rối" trước cả macro
Chiến thuật hiệu quả nhất và lặp đi lặp lại của Codex là gây nhiễu loạn. Trong các trận đấu với tộc Protoss, nó thường cử một Probe băng qua bản đồ để tấn công công nhân hoặc nhà của đối phương. Điều này hiệu quả đến bất ngờ, vì các agent đối thủ thường dành hàng chục giây chỉ để suy nghĩ xem nên làm gì với một con Probe, thay vì hành động.
Minh họa cách các mô hình Claude xử lý trận đấu
Tuy nhiên, chính các hệ thống này lại yếu trong việc duy trì sản xuất liên tục. Chúng trì hoãn công nghệ, nhỏ giọt một hai đơn vị cơ bản vào căn cứ đã được phòng thủ, rồi ném công nhân vào những trận tử chiến vô vọng.
Đáng chú ý, Codex thường tạo ra các subagent riêng biệt để quản lý kinh tế, sản xuất quân và điều khiển quân. Nhưng chúng giao tiếp rất kém với nhau, nên subagent quân đội thường ném từng đơn vị mới vào tấn công ngay lập tức, không biết đến đội quân lớn hơn mà các subagent khác đang dự định xây dựng. Đây là lỗi người mới điển hình: gửi quân từng con một thay vì chờ đủ số lượng và thời điểm tấn công có kế hoạch.
Grok dành cả trận đấu giữa các hành động
Grok 4.6 thường xuyên đưa ra những chuỗi lý luận dài nhưng rất ít lệnh hành động. Trong một trận đấu, cấu hình xhigh ghi nhận 11.138 token lý luận nhưng chỉ đưa ra sáu lệnh trong suốt 43 phút và không bao giờ tung ra một đơn vị chiến đấu nào.
Hiệu năng của Grok trong Brood War Bench
Những hành động mà nó thực hiện hiếm khi phát triển thành một vòng điều khiển hoạt động được. Có trận Grok tạo ba lính Marine nhưng không bao giờ tiếp cận được căn cứ địch; trận khác tạo hai Zealot rồi cũng không bao giờ băng qua bản đồ. Những trường hợp này trông không giống chiến lược tồi, mà giống như thất bại trong việc liên tục quan sát và hành động.
Fable thực sự cố gắng chơi game
Ngược lại với Grok, Claude Fable dường như thực sự muốn chơi StarCraft đúng nghĩa. Nó thường cố gắng xây dựng kinh tế và leo cây công nghệ thay vì dừng lại ở đơn vị đầu tiên có sẵn. Nó có vẻ quan tâm đến việc chơi game thật sự hơn bất kỳ mô hình nào khác.
Có trận Fable đạt tới Lair, Spire và Mutalisks rồi giành chiến thắng. Trận khác, nó xây thêm Robotics Facility, Citadel of Adun, Observatory và Templar Archives trước khi thắng. Nhưng tham vọng không đảm bảo thực thi: có trận Fable đạt tới Factory và Academy nhưng vẫn bị Opus 5 đè bẹp.
Không agent nào chơi vượt trình độ người mới
Ngay cả Astra và Fable cũng không thể xây dựng đội quân phức tạp, phòng thủ trước các đợt tấn công đơn giản, hay triển khai chiến lược cụ thể. Như tác giả nhận xét thẳng thắn:
Một người mới chơi dùng chiến thuật photon rush sẽ thắng mọi trận đấu trong số này.
Một phát hiện đáng chú ý về mặt kỹ thuật: các mô hình cũ thường chơi RTS như thể là game theo lượt, khiến chúng bị tiêu diệt trong lúc đang suy nghĩ. Các mô hình mới hơn đôi khi cũng mắc bẫy tương tự — điều này có thể giải thích tại sao một số cấu hình effort thấp lại đạt kết quả tốt hơn. Nhìn chung, các mô hình mới nhận thức rõ hơn về chi phí của việc suy nghĩ.
Cách benchmark vận hành
Brood War Bench xây dựng một ma trận round-robin gồm các cấu hình mô hình và mức effort, cho mỗi cấu hình đấu với tất cả các cấu hình còn lại. Hệ thống chạy các cặp đấu song song trên các máy ảo Freestyle, lưu lại dữ liệu game engine và log của cả hai agent cho mỗi trận.
Dù kết quả còn nhiều hạn chế, tác giả vẫn tỏ ra hào hứng:
"Benchmark này còn lâu mới cạn. Còn rất nhiều điều để các agent học hỏi, và rất nhiều điều để benchmark yêu cầu chúng làm. Tôi mong chờ được xem chúng tiến bộ."
Với cộng đồng AI và gaming tại Việt Nam, Brood War Bench là một minh chứng thú vị cho thấy khoảng cách giữa khả năng suy luận ngôn ngữ ấn tượng của các mô hình lớn và khả năng hành động liên tục, phối hợp trong môi trường thời gian thực vẫn còn rất lớn. Đây cũng là hướng nghiên cứu đáng quan tâm cho các nhóm phát triển agent tự trị trong tương lai.
Bài viết liên quan

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Bài toán tưởng đơn giản: Khi nào dùng "a", khi nào dùng "an" trong tiếng Anh?
19 tháng 9, 2026