Jevman: Các mô hình AI ganh đua chơi Pac-Man, mở ra chuẩn đo lường cho AI ra quyết định

Công nghệ08 tháng 10, 2026·5 phút đọc

Một nhóm phát triển đã cho 6 mô hình AI cùng chơi Pac-Man để so tài khả năng ra quyết định theo thời gian thực. Mỗi mô hình đấu 100 ván với lũ ma cổ điển, kết quả được xếp hạng công khai và mã nguồn mở cho phép bất kỳ ai đưa mô hình của mình vào tranh tài.

Jevman: Các mô hình AI ganh đua chơi Pac-Man, mở ra chuẩn đo lường cho AI ra quyết định

Jevman: Các mô hình AI ganh đua chơi Pac-Man, mở ra chuẩn đo lường cho AI ra quyết định

Trong bối cảnh các mô hình AI ngày càng được dùng để ra quyết định theo thời gian thực, một nhóm phát triển đã tạo ra Jevman — một sàn đấu nơi các mô hình AI chơi trò Pac-Man để so tài tốc độ và chất lượng ra quyết định.

Sáu mô hình đã tham gia, mỗi mô hình chơi 100 ván đấu với lũ ma cổ điển của trò chơi. Kết quả được công bố trên bảng xếp hạng, kèm video các ván đấu và mã nguồn mở để bất kỳ ai cũng có thể đưa mô hình của mình vào thử sức.

Pac-Man như một phép thử cho trí tuệ nhân tạo

Ý tưởng của dự án khá đơn giản nhưng hiệu quả: Pac-Man là một bài toán ra quyết định nhanh, nơi mô hình phải chọn hướng đi ngay tại mỗi ngã rẽ dựa trên trạng thái của màn chơi. Đây là một phép thử phù hợp để đo lường độ trễ thấp và khả năng phản ứng trong thời gian thực — những yếu tố ngày càng quan trọng khi AI được nhúng vào các ứng dụng thực tế.

Theo nhóm phát triển, động lực của dự án xuất phát từ việc nhiều nền tảng ra quyết định mới đang xuất hiện cùng lúc, trong đó có endpoint decisions của OpenAI và dịch vụ Clef của Cloudflare ra mắt cách đây vài tuần. Câu hỏi đặt ra là trong số các lựa chọn này, mô hình nào thực sự ra quyết định nhanh và chính xác nhất.

Sáu mô hình tham gia thử nghiệm gồm jev 1.13, kev, clef, clef flash, GPT-6 Luna và Laya.

Cách thức benchmark được thiết kế

Quy trình đánh giá trong Jevman được xây dựng khá chặt chẽ, nhằm đảm bảo công bằng và có thể kiểm chứng:

  • Số ván đấu: Mỗi mô hình chơi 100 ván với lũ ma kịch bản cổ điển, mỗi ván kéo dài cho tới khi mất hết ba mạng. Các ván được giới hạn tối đa 5 phút để mọi lượt chơi đều kết thúc, nhưng trên thực tế không ván nào tới gần ngưỡng đó — ván dài nhất chỉ kéo dài 2 phút 24 giây.

  • Cách ra quyết định: Tại mỗi ngã rẽ, trò chơi gửi trạng thái màn chơi — gồm mê cung, các viên thức ăn và vị trí lũ ma — dưới dạng JSON cho mô hình. Mô hình trả về xác suất cho từng hướng, và Pac-Man chọn theo xác suất đó.

  • Hạn chót phản hồi: Nếu mô hình mất hơn 2 giây để trả lời, câu trả lời sẽ bị thay bằng một quy tắc dự phòng đơn giản và được tính vào nhóm backup moves.

  • Cách tính điểm: Bảng xếp hạng dùng điểm trung bình với biên sai số 95% (khoảng ±2 sai số chuẩn). Những mô hình nằm trong biên sai số của nhau được xem là hòa. Điểm cao nhất là thành tích tốt nhất của một mô hình trong một ván đơn.

  • Kiểm chứng: Mọi ván đấu đều được ghi lại và chạy lại chính xác, cho phép kiểm tra bất kỳ kết quả nào.

Ai cũng có thể đưa mô hình của mình lên bảng xếp hạng

Điểm đáng chú ý của Jevman là tính mở. Dự án là mã nguồn mở, và bất kỳ mô hình nào nằm sau một endpoint HTTP đều có thể tham gia — dù là mô hình chạy trên dịch vụ đám mây, một bản fine-tune, hay thậm chí chạy ngay trên máy cá nhân.

Quy trình gồm ba bước:

  1. Đặt mô hình sau một endpoint: Trò chơi gửi mê cung dưới dạng JSON và yêu cầu một hướng đi. Kho mã nguồn có sẵn một endpoint mẫu chỉ 34 dòng để bắt đầu.

  2. Chạy benchmark: Một câu lệnh duy nhất sẽ chơi các ván theo đúng luật của bảng xếp hạng — thời gian thực, 2 giây mỗi câu trả lời, lũ ma cổ điển, ba mạng hoặc 5 phút.

  3. Gửi pull request: Hệ thống CI sẽ chạy lại mọi ván bạn gửi và kiểm tra điểm số. Mô hình của bạn sau đó sẽ gia nhập bảng xếp hạng với tư cách tự báo cáo.

Nếu mô hình của bạn đang chạy trên Opper hoặc một API công khai khác, bạn có thể mở một issue và nhóm phát triển sẽ tự chạy thử.

Chơi trực tiếp với AI

Ngoài việc xem các mô hình thi đấu, người dùng còn có thể tự mình vào vai Pac-Man và đối đầu với lũ ma do AI điều khiển — có thể là một hỗn hợp nhiều mô hình, hoặc toàn bộ đều là jev, kev, clef.

Mỗi ván chơi tốn khoảng 2 xu. Tất cả mô hình đều chạy qua startup của nhóm phát triển, và họ đã tặng credit miễn phí cho mọi người dùng thử.

Theo chia sẻ từ nhóm, trò chơi khá thú vị và đáng ngạc nhiên là rất khó vượt qua kỷ lục của jev. Đây cũng là một cách trực quan để người dùng cảm nhận được sự khác biệt về tốc độ và chiến thuật giữa các mô hình.

Ý nghĩa với người dùng Việt Nam

Với cộng đồng phát triển và nghiên cứu AI tại Việt Nam, Jevman là một ví dụ đáng tham khảo về cách xây dựng chuẩn đo lường mở cho các mô hình ra quyết định. Thay vì chỉ dựa vào các bài kiểm tra lý thuyết, việc đánh giá qua một tác vụ có tính tương tác thời gian thực như Pac-Man cho thấy bức tranh sát với ứng dụng thực tế hơn.

Bên cạnh đó, vì dự án cho phép bất kỳ ai đưa mô hình lên endpoint HTTP tham gia, các nhóm phát triển trong nước hoàn toàn có thể thử sức với những mô hình tự huấn luyện hoặc fine-tune, từ đó có thêm dữ liệu so sánh khách quan với các mô hình quốc tế.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗