Terminal-Bench-Science: Chuẩn đánh giá mới giúp AI trở thành trợ lý nghiên cứu khoa học đáng tin cậy

Công nghệ28 tháng 8, 2026·7 phút đọc

Terminal-Bench-Science là bộ tiêu chuẩn đánh giá (benchmark) mới do Đại học Stanford dẫn dắt, đo lường khả năng của các tác tử AI trong các quy trình nghiên cứu khoa học thực tế. Với 70 nhiệm vụ từ 5 lĩnh vực khoa học, bộ benchmark này cho thấy ngay cả mô hình mạnh nhất hiện nay (Claude Opus 5) cũng chỉ đạt tỷ lệ giải quyết thành công 30%, mở ra dư địa phát triển lớn cho AI trong vai trò trợ lý nghiên cứu. Điểm đặc biệt là benchmark này được xây dựng bởi chính các nhà khoa học, liên tục cập nhật để theo kịp sự phát triển của AI.

Terminal-Bench-Science: Chuẩn đánh giá mới giúp AI trở thành trợ lý nghiên cứu khoa học đáng tin cậy

Terminal-Bench-Science: "Thước đo" mới cho năng lực AI trong nghiên cứu khoa học

Một nhóm nghiên cứu tại Đại học Stanford vừa công bố Terminal-Bench-Science, một bộ tiêu chuẩn đánh giá (benchmark) hoàn toàn mới nhằm đo lường khả năng của các tác tử AI (AI agents) trong các quy trình nghiên cứu khoa học thực tế. Khác với các bài kiểm tra lý thuyết hay bài tập chuẩn hóa, benchmark này được xây dựng dựa trên chính các nhiệm vụ và quy trình làm việc của các nhà khoa học, với mục tiêu tạo ra một vòng phản hồi liên tục giữa nhu cầu khoa học và sự phát triển của AI.

Kết quả ban đầu cho thấy ngay cả mô hình mạnh nhất được đánh giá, Claude Opus 5, chỉ đạt tỷ lệ hoàn thành 30% trên 70 nhiệm vụ, phản ánh rằng vẫn còn rất nhiều dư địa để cải thiện. Điều này cũng đồng nghĩa với việc các tác tử AI hiện tại mới chỉ có thể đóng vai trò là "trợ lý" chứ chưa thể thay thế con người trong các công việc nghiên cứu phức tạp.

Minh họa về benchmark khoa họcMinh họa về benchmark khoa học

Mục tiêu: Tạo ra trợ lý nghiên cứu thực thụ, không chỉ là "chatbot"

Theo nhóm phát triển, trong khi các benchmark trước đây như Terminal-Bench tập trung vào kỹ thuật phần mềm, Terminal-Bench-Science mang tham vọng tương tự sang lĩnh vực khoa học. Mục tiêu cuối cùng không chỉ là tạo ra một AI trả lời câu hỏi hay, mà là một tác tử có khả năng thực hiện các quy trình làm việc đòi hỏi kỹ thuật cao và tốn nhiều thời gian, để giải phóng các nhà khoa học tập trung vào những phần quan trọng nhất: xác định câu hỏi nghiên cứu, hình thành giả thuyết, diễn giải và xác nhận kết quả.

"Các tác tử AI có thể mở rộng những gì các nhà nghiên cứu đạt được và giúp đẩy nhanh quá trình khám phá khoa học," đại diện nhóm nghiên cứu chia sẻ.

Để đạt được điều này, benchmark cần đáp ứng ba tiêu chí cốt lõi:

  • Phản ánh quy trình khoa học thực tế: Các nhiệm vụ được đóng góp và phê duyệt bởi chính các nhà khoa học đang hoạt động trong lĩnh vực, không phải bởi các nhà phát triển mô hình hay nhà cung cấp dữ liệu.
  • Cung cấp bằng chứng xác minh được: Các tác tử được đánh giá trong môi trường mô phỏng thực tế và chấm điểm dựa trên các sản phẩm cụ thể như phân tích, mô phỏng, chứng minh, mã nguồn và dữ liệu, thông qua các bài kiểm tra có thể tái lập.
  • Liên tục phát triển theo thời gian: Không giống các benchmark "thả và bỏ", Terminal-Bench-Science được thiết kế như một dự án liên tục, cập nhật thường xuyên để theo kịp sự tiến bộ của các mô hình AI tiên tiến.

Chi tiết về các nhiệm vụ và kết quả đánh giá

Terminal-Bench-Science 0.1 bao gồm 70 nhiệm vụ trải dài trên 5 lĩnh vực khoa học chính:

  • Khoa học sự sống: 19 nhiệm vụ (Sinh học, Y học & Sức khỏe, Khoa học thần kinh, Sinh thái & Tiến hóa)
  • Khoa học vật lý: 17 nhiệm vụ (Thiên văn & Vũ trụ, Vật lý, Khoa học vật liệu, Hóa học)
  • Khoa học Trái Đất: 8 nhiệm vụ (Khoa học địa chất, Khí quyển & Khí hậu, Đại dương & Biển, Môi trường & Bền vững)
  • Khoa học toán học: 17 nhiệm vụ (Toán ứng dụng & Tính toán khoa học, Nghiên cứu vận hành & Tối ưu hóa, Toán hình thức & Chứng minh định lý, Thống kê)
  • Khoa học kỹ thuật: 9 nhiệm vụ (Kỹ thuật cơ khí & Hàng không vũ trụ, Kỹ thuật điện & Máy tính, Kỹ thuật hóa học & Quy trình, Kỹ thuật xây dựng & Kết cấu)

Các nhiệm vụ này thuộc nhiều dạng khác nhau, từ phân tích dữ liệu khoa học, suy luận thống kê, mô phỏng, tối ưu hóa, chứng minh định lý, tái tạo hình ảnh, xử lý tín hiệu, đến học máy khoa học.

Điểm đáng chú ý là tính chọn lọc khắt khe trong quá trình xây dựng benchmark. Từ 920 đề xuất từ cộng đồng 376 nhà nghiên cứu tại 22 quốc gia, sau quá trình phê duyệt, phản biện và kiểm tra chất lượng, chỉ có 70 nhiệm vụ được chấp nhận, tương đương 7,6%.

Biểu đồ phân bố nhiệm vụBiểu đồ phân bố nhiệm vụ

Bảng xếp hạng các mô hình AI

Mỗi mô hình được đánh giá thông qua 3 lần thử nghiệm độc lập cho mỗi nhiệm vụ. Kết quả cho thấy một bức tranh khá phân hóa:

  • Claude Opus 5 (dùng Claude Code): 30,0% — Vị trí dẫn đầu
  • GPT-5.6 Sol (dùng Codex): 22,4%
  • Claude Fable 5 (dùng Claude Code): 21,4%
  • Claude Opus 4.8: 10,5%
  • GLM 5.3 (mô hình mở mạnh nhất): 8,1%
  • GPT-5.6 Luna: 3,3% — Thấp nhất

Kết quả này cho thấy ngay cả mô hình mạnh nhất cũng chỉ giải quyết được chưa đến 1/3 số nhiệm vụ, điều này hoàn toàn có chủ đích. Nhóm phát triển cho biết các nhiệm vụ đã được hiệu chỉnh để thách thức các mô hình tiên tiến nhất hiện nay và tương lai.

Ngoài tỷ lệ hoàn thành, benchmark còn phân tích chi phí và số token sử dụng:

  • GPT-5.6 Sol đạt hiệu suất tương đương Claude Fable 5 nhưng chi phí chỉ bằng 1/3 (4,2 nghìn USD so với 14,2 nghìn USD).
  • Claude Fable 5 sử dụng ít token hơn khoảng 25% so với GPT-5.6 Sol khi đạt cùng mức hiệu suất (6,4 tỷ so với 8,4 tỷ token).
  • Kimi K3 là lựa chọn tiết kiệm token nhất, trong khi Claude Opus 5 dẫn đầu về hiệu suất cao nhất.

Vì sao benchmark này lại quan trọng với cộng đồng AI và khoa học?

Terminal-Bench-Science không chỉ là một bảng xếp hạng khô khan. Nó giải quyết một vấn đề cốt lõi: làm sao để đánh giá một cách đáng tin cậy năng lực thực sự của AI trong khoa học? Nhiều benchmark hiện tại dễ bị "bão hòa" khi các mô hình học thuộc lòng đáp án hoặc chỉ cần giải các bài tập mẫu. Bằng cách sử dụng các quy trình nghiên cứu thực tế từ chính các phòng thí nghiệm, benchmark này tạo ra một chuẩn mực khó hơn, thực tế hơn và có giá trị hơn nhiều.

Đối với các nhà phát triển AI tại Việt Nam, đây là một tín hiệu đáng chú ý. Nó cho thấy xu hướng đánh giá AI đang dịch chuyển từ các bài kiểm tra kỹ năng tổng quát sang các bài kiểm tra chuyên sâu theo lĩnh vực, đòi hỏi sự kết hợp chặt chẽ giữa chuyên môn khoa học và kỹ thuật AI. Việc xây dựng đội ngũ có kiến thức liên ngành sẽ là lợi thế cạnh tranh quan trọng.

Lộ trình phát triển và lời kêu gọi cộng đồng

Nhóm nghiên cứu xác nhận phiên bản 0.2 đang được triển khai với hạn chót nhận đề xuất (pull request) là ngày 5 tháng 10 năm 2026. Họ kêu gọi các nhà nghiên cứu, đặc biệt là những người có quy trình làm việc mà các mô hình AI hiện tại chưa thể thực hiện, hãy tham gia đóng góp thông qua quy trình: Đề xuất → Xây dựng → Đánh giá.

Dự án hoàn toàn mở, được lưu trữ trên GitHub với giấy phép Apache-2.0, và nhóm phát triển tổ chức các buổi họp trực tuyến hàng tuần để hỗ trợ cộng đồng. Đây là một sân chơi khoa học mở cho bất kỳ ai muốn định hình tương lai của AI trong nghiên cứu khoa học.

"Hãy để các nhà khoa học định nghĩa năng lực khoa học của AI trông như thế nào, và đo lường nó một cách nghiêm túc, cùng nhau."

Terminal-Bench-Science là một bước tiến quan trọng trong việc đưa AI từ vai trò "công cụ hỗ trợ gõ phím" lên thành "người bạn nghiên cứu" thực thụ trong phòng thí nghiệm. Kết quả 30% cho thấy chặng đường phía trước còn dài, nhưng cũng hé lộ tiềm năng to lớn của AI trong việc thúc đẩy khám phá khoa học trong tương lai gần.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗