Artificial Analysis ra mắt Chỉ số Trí tuệ v4.2: Cập nhật then chốt giữa "cơn sốt" AI biên giới

Công nghệ05 tháng 9, 2026·5 phút đọc

Artificial Analysis vừa công bố Chỉ số Trí tuệ (Intelligence Index) phiên bản 4.2 với các bài kiểm tra phức tạp và thực tế hơn, đồng thời tăng gấp đôi tỷ trọng bộ dữ liệu riêng tư nhằm chống gian lận benchmark. Bản cập nhật mang tính trung gian này bổ sung hai bài đánh giá mới là AA-Briefcase và GDP.pdf, đồng thời cho thấy cuộc đua AI đang diễn ra gay cấn với sự dẫn đầu của Anthropic và OpenAI. Nổi bật trong bảng xếp hạng, GPT-6 Astra của OpenAI được đánh giá là mô hình tiết kiệm token hiệu quả nhất hiện nay.

Artificial Analysis ra mắt Chỉ số Trí tuệ v4.2: Cập nhật then chốt giữa "cơn sốt" AI biên giới

Chỉ số Trí tuệ AI v4.2 chính thức ra mắt: Thước đo mới cho kỷ nguyên agentic

Artificial Analysis vừa phát hành bản cập nhật v4.2 cho Chỉ số Trí tuệ (Intelligence Index) của mình, đánh dấu bước trung gian quan trọng trước thềm phiên bản v5 lớn hơn. Bản cập nhật này bổ sung các bài kiểm tra tác nhân AI (agentic) phức tạp và tăng cường các bộ dữ liệu ẩn nhằm ngăn chặn các phòng lab "luyện" chỉ số.

Được đưa ra trong bối cảnh các mô hình AI biên giới liên tục được ra mắt với tốc độ chóng mặt, v4.2 không chỉ giúp chỉ số này bám sát thực tế hơn mà còn hé lộ cục diện cạnh tranh khốc liệt giữa các ông lớn công nghệ như Anthropic, OpenAI và Meta. Trọng tâm chính của bản cập nhật là hai bài đánh giá mới mang tên AA-BriefcaseGDP.pdf, cùng với sự thay đổi đáng kể trong cách tính điểm.

Những thay đổi chính trong v4.2

Phiên bản 4.2 không phải là một thay đổi toàn diện mà là một sự "tăng tốc" mang tính chiến thuật trước khi phát hành v5. Giám đốc dự án cho biết: "Chúng tôi đã cố tình trì hoãn các bản cập nhật để giữ chỉ số ổn định trong các đợt phát hành mô hình lớn gần đây. Tuy nhiên, với biên giới AI dịch chuyển quá nhanh, việc cung cấp một bản cập nhật trung gian ngay lập tức là rất quan trọng."

Cụ thể, v4.2 có những thay đổi sau:

  • Thêm bài đánh giá AA-Briefcase: Một bài kiểm tra nội bộ mới mô phỏng các dự án công việc tri thức (knowledge work) kéo dài nhiều tuần với hàng nghìn tệp dữ liệu đầu vào. Bài kiểm tra này đánh giá khả năng hoàn thành nhiệm vụ, chất lượng phân tích và trình bày báo cáo của các mô hình AI.

  • Thêm bài đánh giá GDP.pdf: Được tạo bởi Surge AI, bài kiểm tra này thử thách khả năng suy luận tài liệu dài của AI với 100 tệp PDF thuộc 10 lĩnh vực, yêu cầu AI tổng hợp thông tin trải dài trên 4.592 trang bao gồm cả văn bản, bảng biểu, biểu đồ, chú thích và cả các phần loại trừ.

  • Tăng tỷ trọng bộ dữ liệu riêng tư: Đây là động thái chống gian lận benchmark. Hiện tại, 40% trọng số đánh giá của Chỉ số này dựa trên các bộ kiểm tra ẩn như AA-Briefcase, AA-Omniscience - tăng gấp đôi so với phiên bản v4.1. Điều này khiến các phòng lab khó có thể "học tủ" để đạt điểm cao.

  • Nâng cấp hạ tầng chấm điểm: Sửa lỗi trong hệ thống chấm điểm tự động, cải thiện độ chính xác trong trả lời và tái cân chỉnh thang điểm Elo để giữ ổn định khi thêm mô hình mới.

Loại bỏ GPQA Diamond: Một bài kiểm tra khoa học từng được đánh giá cao đã bị loại bỏ vì đã đạt đến trạng thái "bão hòa" (saturation), tức là các mô hình hiện tại đều đạt điểm gần như tuyệt đối, không còn giá trị phân loại.

Cục diện bảng xếp hạng: Anthropic và OpenAI dẫn đầu

Kết quả từ bản cập nhật v4.2 cho thấy sự cạnh tranh khốc liệt ở nhóm đầu:

  • Anthropic’s Claude Fable 5.1 hiện đang dẫn đầu toàn bộ Chỉ số.
  • OpenAI’s GPT-6 Astra đứng thứ hai, có mức điểm tăng 4 điểm so với GPT-5.6 Sol ra mắt trước đó.
  • Meta đứng thứ ba với mô hình Muse Spark 1.3, cũng ghi nhận những bước tiến đáng kể.

Điều đáng chú ý là trong khi Claude Fable 5.1 dẫn đầu về điểm số, thì GPT-6 Astra lại thống trị vùng "biên giới hiệu suất token". Nói một cách dễ hiểu, GPT-6 Astra có khả năng tạo ra mã code hoặc văn bản chất lượng cao với chi phí tính toán (token) thấp hơn hầu hết các đối thủ.

Biểu đồ minh họa kết quả benchmark AIBiểu đồ minh họa kết quả benchmark AI

Bảng xếp hạng về AA-Briefcase cũng chứng kiến sự vượt trội của nhóm dẫn đầu. GPT-6 Astra cho thấy mức tăng ~85 điểm Elo so với thế hệ trước, cho thấy các nhà sản xuất mô hình không chỉ cải thiện kiến thức mà còn tập trung sâu vào khả năng "hành động và suy luận" như một trợ lý thực thụ.

Ý nghĩa với người dùng và doanh nghiệp Việt Nam

Đối với cộng đồng công nghệ và doanh nghiệp Việt Nam, việc các bộ chỉ số ngày càng hướng đến các tác vụ thực tế (agentic work) là một tín hiệu tích cực. Trước đây, các bài test thường chỉ dừng lại ở việc hỏi đáp kiến thức. Giờ đây, các mô hình đang được đánh giá dựa trên khả năng leverage trên các dự án tài liệu dài, phân tích dữ liệu chuyên sâutự động hóa quy trình làm việc - những kỹ năng cực kỳ quan trọng khi doanh nghiệp Việt bắt đầu ứng dụng AI vào dịch vụ khách hàng, lập trình và xử lý hợp đồng.

Việc tỷ trọng các bài kiểm tra ẩn (private) tăng lên cũng là một cam kết về độ tin cậy của các bảng xếp hạng AI, tránh tình trạng một số công ty chỉ tối ưu hóa model của mình để "ăn điểm" các bài test công khai. Sự rõ ràng này giúp các kỹ sư và nhà quản lý tại Việt Nam có căn cứ vững chắc hơn khi đưa ra quyết định đầu tư công nghệ.

Nhóm phát triển cũng tiết lộ họ đang nỗ lực cho bản v5 lớn hơn và sẽ có thêm nhiều bản cập nhật gia tăng trong thời gian tới.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗