Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai

Công nghệ16 tháng 9, 2026·4 phút đọc

Một nghiên cứu trên arXiv với sự tham gia của hơn 50 tác giả đã rà soát lại sáu bộ benchmark Vật lý phổ biến và phát hiện phần lớn câu trả lời bị chấm sai đến từ lỗi của đề bài hoặc đáp án tham chiếu, chứ không phải do mô hình suy luận kém. Sau khi hiệu chỉnh, điểm của GPT-5.6-Sol tăng vọt, cho thấy các mô hình hàng đầu đang tiến gần mức bão hòa trên những bài kiểm tra Vật lý hiện có.

Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai

Các mô hình ngôn ngữ lớn (LLM) hàng đầu thường bị đánh giá là còn yếu trước các bài toán Vật lý nâng cao, dựa trên điểm số thấp trên những bộ benchmark nổi tiếng. Nhưng một nghiên cứu mới đăng trên arXiv đã đặt lại câu hỏi này, và kết quả cho thấy vấn đề nằm ở chính cách chúng ta kiểm tra AI.

Khoảng cách giữa điểm số và trải nghiệm thực tế

Báo cáo mang tên "How Good Are Frontier Models at Physics?" do Ali Ansari cùng hơn 50 nhà nghiên cứu thực hiện, trong đó có nhiều giáo sư và nghiên cứu sinh Vật lý đến từ các trường đại học danh tiếng. Nhóm tác giả xuất phát từ một nghịch lý quen thuộc: điểm số thấp trên các benchmark Vật lý, bao gồm cả những bộ được đưa vào Artificial Analysis Intelligence Index (2026), dường như cho thấy các mô hình hàng đầu vẫn "đuối" trước Vật lý nâng cao.

Thế nhưng, cảm nhận của các chuyên gia khi dùng những mô hình này trong công việc thực tế lại không khớp với bức tranh đó. Chính khoảng cách này đã thúc đẩy nhóm nghiên cứu tiến hành một cuộc rà soát quy mô lớn.

Cách họ kiểm tra lại

Nhóm tác giả đánh giá các mô hình hàng đầu trên sáu bộ benchmark Vật lý phổ biến, tập trung vào các bài toán chỉ dùng văn bản với đáp án cuối cùng có thể kiểm chứng được. Điểm mấu chốt nằm ở bước hậu kiểm: với mỗi lĩnh vực con của Vật lý, các giảng viên và nghiên cứu sinh có chuyên môn tương ứng xem xét kỹ lưỡng đề bài, đáp án tham chiếu và câu trả lời của mô hình.

Mục tiêu là phân biệt rõ ràng giữa:

  • Lỗi thật của mô hình trong lập luận Vật lý
  • Lỗi của hệ thống chấm điểm
  • Đáp án tham chiếu sai
  • Câu hỏi mơ hồ hoặc thiếu dữ kiện

Kết quả gây bất ngờ: phần lớn các trường hợp bị chấm là sai ban đầu thực chất phản ánh vấn đề của bộ đề, chứ không phải do mô hình suy luận Vật lý kém.

Điểm số sau khi hiệu chỉnh tăng mạnh

Sau khi xác định được các vấn đề, nhóm nghiên cứu yêu cầu chuyên gia sửa lại những đáp án tham chiếu sai và loại bỏ hoặc chỉnh sửa các câu hỏi có lỗi. Khi tính lại điểm trên các tập con đã được kiểm duyệt, bức tranh thay đổi hoàn toàn.

Cụ thể với GPT-5.6-Sol:

  • Điểm mean@4 trên HLE-Physics tăng từ 47,3% lên 78,7%
  • Điểm mean@4 trên CMT-Benchmark tăng từ 61,0% lên 87,2%
  • Điểm pass@4 đạt 94,4% trên 54 bài CritPt được giữ lại sau rà soát

Điểm số trên các tập con đã hậu kiểm của UGPhysics, PRISM-PhysicsPHYBench cũng tăng đáng kể.

Những phát hiện này cho thấy các benchmark hiện hành đang đánh giá thấp đáng kể khả năng của mô hình hàng đầu trong việc giải các bài toán Vật lý được đặt vấn đề rõ ràng.

Vì sao điều này quan trọng?

Với người dùng công nghệ, đây không chỉ là câu chuyện học thuật. Benchmark từ lâu đã trở thành thước đo để so sánh mô hình, để các doanh nghiệp chọn công cụ AI và để công chúng hình dung năng lực thực sự của AI. Nếu thước đo đó bị lệch, cả thị trường lẫn niềm tin đều bị ảnh hưởng.

Nghiên cứu cũng nhấn mạnh một hệ quả quan trọng: các mô hình đang tiến gần mức bão hòa trên những bài kiểm tra dạng đóng, tức bài có một đáp án đúng duy nhất. Khi mô hình đã giải đúng gần hết, bộ đề mất dần khả năng phân biệt năng lực giữa các phiên bản. Điều này đòi hỏi những bộ đánh giá mới khó hơn, do chuyên gia xây dựng và kiểm chứng.

Hàm ý cho cộng đồng AI

Với các nhóm nghiên cứu và doanh nghiệp tại Việt Nam đang theo dõi sát tiến độ của AI, bài học là đừng vội kết luận về năng lực mô hình chỉ qua một con số benchmark. Chất lượng của bộ đề, đáp án tham chiếu và quy trình chấm điểm đóng vai trò quyết định.

Việc cộng đồng học thuật quốc tế sẵn sàng huy động hàng chục chuyên gia để "mổ xẻ" từng bài toán là một tín hiệu tích cực, cho thấy cách đánh giá AI đang dần trưởng thành và bám sát thực tế hơn.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗