Benchmark Leipzig: Khả năng suy luận toán học của các mô hình LLM đạt được cột mốc ấn tượng

Công nghệ06 tháng 6, 2026·3 phút đọc

Một nhóm 49 nhà toán học quốc tế đã hợp tác xây dựng bộ dữ liệu gồm 100 câu hỏi toán học cấp độ nghiên cứu để đánh giá các mô hình ngôn ngữ lớn (LLM). Qua ba giai đoạn thử nghiệm nghiêm ngặt, kết quả cho thấy các LLM tiên tiến, đặc biệt là các mô hình "heavy-thinking", đã giải quyết thành công phần lớn các bài toán khó, chứng minh sự tiến bộ vượt bậc trong khả năng lập luận toán học của AI.

Benchmark Leipzig: Khả năng suy luận toán học của các mô hình LLM đạt được cột mốc ấn tượng

Benchmark Leipzig: Khả năng suy luận toán học của các mô hình LLM đạt được cột mốc ấn tượng

Một nhóm 49 nhà toán học quốc tế đã hợp tác xây dựng bộ dữ liệu gồm 100 câu hỏi toán học cấp độ nghiên cứu để đánh giá các mô hình ngôn ngữ lớn (LLM). Qua ba giai đoạn thử nghiệm nghiêm ngặt, kết quả cho thấy các LLM tiên tiến, đặc biệt là các mô hình "heavy-thinking", đã giải quyết thành công phần lớn các bài toán khó, chứng minh sự tiến bộ vượt bậc trong khả năng lập luận toán học của AI.

Thử thách toán học cấp độ nghiên cứu

Giữa tháng 4 và tháng 5 năm 2026, 49 nhà toán học đã tập hợp tại Viện Max Planck về Khoa học Tính toán (Max Planck Institute for Mathematics in the Sciences) tại Leipzig, Đức để tham dự hội thảo mang tên "Benchmarks in Leipzig". Mục tiêu chính của nhóm là tạo ra một bộ dữ liệu chuẩn (benchmark) gồm các câu hỏi toán học có độ khó ở cấp độ nghiên cứu và đã biết trước đáp án chính xác.

Bộ dữ liệu kết quả bao gồm 100 câu hỏi phức tạp, bao trùm nhiều lĩnh vực chuyên sâu như Hình học Đại số (Algebraic Geometry), Tổ hợp (Combinatorics) và Lý thuyết biểu diễn (Representation Theory).

Quy trình đánh giá ba giai đoạn

Để đảm bảo tính khách quan và đánh giá chính xác khả năng của các mô hình, nhóm nghiên cứu đã thực hiện quy trình kiểm tra qua ba giai đoạn tăng dần về độ sâu:

  • Giai đoạn 1: Năm mô hình LLM tiên tiến nhất (state-of-the-art) được thử nghiệm với một lần chạy duy nhất. Kết quả là có 41 câu hỏi hoàn toàn không được giải quyết.
  • Giai đoạn 2: Ba trong số các mô hình này được đánh giá kỹ lưỡng hơn với 20 lần chạy cho mỗi mô hình. Nhờ việc tăng số lần thử, số câu hỏi chưa giải quyết được đã giảm xuống còn 16.
  • Giai đoạn 3: Hai mô hình "heavy-thinking" (các mô hình có khả năng suy luận sâu, xử lý phức tạp cao) được thử nghiệm với 3 lần chạy. Kết quả ấn tượng là chỉ còn 2 câu hỏi chưa có lời giải.

Kết luận về tiềm năng của AI

Việc giảm số lượng bài toán chưa giải quyết từ 41 xuống chỉ còn 2 qua các giai đoạn thử nghiệm là một minh chứng rõ ràng cho sự phát triển nhanh chóng của công nghệ. Nó cho thấy rằng khả năng lập luận toán học của các mô hình ngôn ngữ lớn đang trở nên đáng kinh ngạc.

"Điều này chứng minh rằng các khả năng lập luận toán học của LLM đang trở nên ấn tượng." - Nhóm tác giả kết luận.

Nghiên cứu này không chỉ cung cấp một bộ dữ liệu quý giá cho cộng đồng trí tuệ nhân tạo để tiếp tục cải thiện các thuật toán, mà còn mở ra triển vọng mới cho việc ứng dụng AI vào hỗ trợ nghiên cứu khoa học, giải quyết các vấn đề toán học phức tạp mà trước đây yêu cầu sự can thiệp sâu của con người.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗