Tái tạo Minecraft không phải là một bài benchmark

Công nghệ06 tháng 9, 2026·4 phút đọc

Bài viết phân tích hiện tượng các mô hình AI mới được quảng bá qua các 'demo-benchmark' như tái tạo Minecraft hay vẽ con bồ nông, đồng thời chỉ ra lý do vì sao những bài kiểm tra này không còn đo lường được năng lực thực sự của mô hình. Tác giả đề xuất giải pháp dùng các bộ câu hỏi động và được giữ bí mật để đánh giá khách quan hơn.

Tái tạo Minecraft không phải là một bài benchmark

Khi GPT Astra được phát hành cách đây vài ngày, chỉ trong vòng một giờ, toàn bộ newsfeed của tôi tràn ngập năm thứ giống hệt nhau: tái tạo Minecraft chỉ với một câu lệnh, tự vẽ mình trong MS Paint, con bồ nông đạp xe dưới dạng SVG, quả bóng nảy trong hộp xoay với trọng lực chân thực, và một tay cầm chơi game SVG.

Trên giấy tờ, những thứ này trông giống những vấn đề trực quan và khó hơn để mô hình giải quyết, nhưng có một lý do khiến chúng trở nên phổ biến. Tôi bắt đầu gọi chúng là demo-benchmarks — đủ trực quan và dễ hiểu để ai cũng thấy được, nhưng lại đủ hữu hạn để phiên bản mô hình tiếp theo có thể "hoàn hảo" trên chúng.

Đó chính là vấn đề: những bài kiểm tra này không còn cho bạn biết mô hình tốt đến đâu nữa, bởi vì việc tối ưu hóa cho chính xác các bài kiểm tra này trước lần phát hành tiếp theo là điều quá dễ dàng đối với các phòng thí nghiệm AI.

Lỗi không hoàn toàn thuộc về các phòng thí nghiệm

Thành thật mà nói, tôi sẽ nói rằng họ thật ngốc nếu không làm vậy — chẳng có gì bán được một buổi ra mắt bằng hình ảnh con bồ nông hay một tay cầm game 3D mà cả dòng thời gian không ngừng trích dẫn.

Một mục tiêu cố định, nổi tiếng với tám tuần chuẩn bị là một con bồ nông đã được giải quyết. Những bài kiểm tra này không bao giờ thay đổi, và bất cứ thứ gì không bao giờ thay đổi đều có thể bị overfit.

Mỗi chu kỳ ra mắt lại chứng minh điều đó một lần nữa. Một bài kiểm tra mà bạn có thể hoàn hảo theo lịch trình sẽ đo lường sự chuẩn bị thay vì năng lực. Với tôi, điều đó đi ngược lại chính định nghĩa của một benchmark — nó nên là một bài kiểm tra khó, một thứ rất khó để đạt hoàn hảo.

Vấn đề lan cả sang các bài eval công khai

Sự động tương tự cũng diễn ra trong các bài eval mở. Các mô hình nhỏ hơn, cảm giác "ngu" hơn khi dùng thực tế, vẫn đạt điểm cao hơn các mô hình tốt hơn trên các trang như Artificial Analysis. Điều này không phải giả thuyết: Inkling Small của Thinking Machines chỉ kém phiên bản lớn hơn đúng một điểm trên Artificial Analysis Intelligence Index, dù chỉ có chưa đầy một phần ba tham số, và thậm chí còn vượt qua nó trên Humanities Last Exam, GPQA Diamond và SciCode.

Những bộ câu hỏi công khai, tĩnh và nổi tiếng đang bị rò rỉ vào dữ liệu huấn luyện và các lựa chọn fine-tuning.

Một buổi ra mắt là ấn tượng đầu tiên, và ấn tượng đầu tiên là tiếp thị. Đó là lý do vì sao bạn luôn bị sốc — cú sốc đó đã được lên lịch từ trước.

Vậy giải pháp thay thế là gì?

Thành thật mà nói, tôi không chắc chắn lắm, bởi vì nếu bạn nghĩ kỹ, giải pháp hiển nhiên gần như đã tồn tại. LiveBench xoay vòng các câu hỏi của nó, ARC-AGI giữ một bộ câu hỏi riêng tư, Humanity's Last Exam giữ lại một phần nội dung của chính nó.

Kết quả benchmark trên hai mô hình InklingKết quả benchmark trên hai mô hình Inkling

So sánh điểm số giữa Inkling Small và phiên bản lớn hơn cho thấy sự chênh lệch bất thường trên các bài kiểm tra công khai.

Đó là những bài kiểm tra mà bên được kiểm tra không biết chính xác thứ đang được hỏi: bạn không thể dạy theo một bài kiểm tra mà vẫn chưa được viết ra.

Nhưng nếu bài eval giữ bí mật là câu trả lời, thì tại sao con bồ nông vẫn thắng?

Câu trả lời là vì hầu hết mạng xã hội không cần đọc một bài nghiên cứu để nhận ra rằng chiếc xe đạp cuối cùng đã có bàn đạp hoặc được làm chuyển động. Một demo-benchmark giúp người xem hiểu ngay trong vài giây vì sao năng lực đó tốt hơn.

Minecraft và các vật thể 3D được dùng trong các demo gần đâyMinecraft và các vật thể 3D được dùng trong các demo gần đây

Các cảnh 3D như Minecraft thường được dùng làm minh họa trực quan cho năng lực của mô hình.

Vì vậy, không có giải pháp thay thế nào cho một bản demo tốt. Nhưng chắc chắn có những lựa chọn tốt hơn demo-benchmarks để đánh giá mô hình thực sự giỏi đến đâu. Và nếu một mô hình đạt điểm cao nhưng cứ liên tục thất bại trong công việc của bạn, thì đó chính là một khoảng trống đáng để điều tra.

Demo-benchmarks tạo ra nội dung tuyệt vời. Tôi chỉ ước chúng ta ngừng dùng chúng để chấm điểm năng lực AI.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗