Benchmark Leipzig: Khả năng suy luận toán học của các mô hình LLM đạt được cột mốc ấn tượng
Một nhóm 49 nhà toán học quốc tế đã hợp tác xây dựng bộ dữ liệu gồm 100 câu hỏi toán học cấp độ nghiên cứu để đánh giá các mô hình ngôn ngữ lớn (LLM). Qua ba giai đoạn thử nghiệm nghiêm ngặt, kết quả cho thấy các LLM tiên tiến, đặc biệt là các mô hình "heavy-thinking", đã giải quyết thành công phần lớn các bài toán khó, chứng minh sự tiến bộ vượt bậc trong khả năng lập luận toán học của AI.

Benchmark Leipzig: Khả năng suy luận toán học của các mô hình LLM đạt được cột mốc ấn tượng
Một nhóm 49 nhà toán học quốc tế đã hợp tác xây dựng bộ dữ liệu gồm 100 câu hỏi toán học cấp độ nghiên cứu để đánh giá các mô hình ngôn ngữ lớn (LLM). Qua ba giai đoạn thử nghiệm nghiêm ngặt, kết quả cho thấy các LLM tiên tiến, đặc biệt là các mô hình "heavy-thinking", đã giải quyết thành công phần lớn các bài toán khó, chứng minh sự tiến bộ vượt bậc trong khả năng lập luận toán học của AI.
Thử thách toán học cấp độ nghiên cứu
Giữa tháng 4 và tháng 5 năm 2026, 49 nhà toán học đã tập hợp tại Viện Max Planck về Khoa học Tính toán (Max Planck Institute for Mathematics in the Sciences) tại Leipzig, Đức để tham dự hội thảo mang tên "Benchmarks in Leipzig". Mục tiêu chính của nhóm là tạo ra một bộ dữ liệu chuẩn (benchmark) gồm các câu hỏi toán học có độ khó ở cấp độ nghiên cứu và đã biết trước đáp án chính xác.
Bộ dữ liệu kết quả bao gồm 100 câu hỏi phức tạp, bao trùm nhiều lĩnh vực chuyên sâu như Hình học Đại số (Algebraic Geometry), Tổ hợp (Combinatorics) và Lý thuyết biểu diễn (Representation Theory).
Quy trình đánh giá ba giai đoạn
Để đảm bảo tính khách quan và đánh giá chính xác khả năng của các mô hình, nhóm nghiên cứu đã thực hiện quy trình kiểm tra qua ba giai đoạn tăng dần về độ sâu:
- Giai đoạn 1: Năm mô hình LLM tiên tiến nhất (state-of-the-art) được thử nghiệm với một lần chạy duy nhất. Kết quả là có 41 câu hỏi hoàn toàn không được giải quyết.
- Giai đoạn 2: Ba trong số các mô hình này được đánh giá kỹ lưỡng hơn với 20 lần chạy cho mỗi mô hình. Nhờ việc tăng số lần thử, số câu hỏi chưa giải quyết được đã giảm xuống còn 16.
- Giai đoạn 3: Hai mô hình "heavy-thinking" (các mô hình có khả năng suy luận sâu, xử lý phức tạp cao) được thử nghiệm với 3 lần chạy. Kết quả ấn tượng là chỉ còn 2 câu hỏi chưa có lời giải.
Kết luận về tiềm năng của AI
Việc giảm số lượng bài toán chưa giải quyết từ 41 xuống chỉ còn 2 qua các giai đoạn thử nghiệm là một minh chứng rõ ràng cho sự phát triển nhanh chóng của công nghệ. Nó cho thấy rằng khả năng lập luận toán học của các mô hình ngôn ngữ lớn đang trở nên đáng kinh ngạc.
"Điều này chứng minh rằng các khả năng lập luận toán học của LLM đang trở nên ấn tượng." - Nhóm tác giả kết luận.
Nghiên cứu này không chỉ cung cấp một bộ dữ liệu quý giá cho cộng đồng trí tuệ nhân tạo để tiếp tục cải thiện các thuật toán, mà còn mở ra triển vọng mới cho việc ứng dụng AI vào hỗ trợ nghiên cứu khoa học, giải quyết các vấn đề toán học phức tạp mà trước đây yêu cầu sự can thiệp sâu của con người.
Bài viết liên quan

Công nghệ
Điều hòa trạng thái rắn: Hứa hẹn tương lai mát mẻ hay thách thức chưa thể giải quyết?
15 tháng 6, 2026

Công nghệ
Tổng hợp thị trường M&A an ninh mạng: 33 thương vụ được công bố trong tháng 4/2026
04 tháng 5, 2026

Công nghệ
Đánh giá Sony Bravia Theater Bar 5: Thiết kế tối giản, chất âm đầy uy lực
13 tháng 5, 2026
