GPT-6 Astra của OpenAI đạt 99,9% trên ARC-AGI-3, vượt qua người dùng về hiệu suất hành động

Công nghệ03 tháng 9, 2026·6 phút đọc

ARC Prize công bố kết quả ấn tượng của OpenAI GPT-6 Astra trên benchmark ARC-AGI-3: đạt 99,9% độ chính xác với harness Provider Adapter, vượt qua đường cơ sở về hiệu quả hành động của con người trên 96% cấp độ. Astra thể hiện khả năng tự xây dựng mô hình thế giới dạng biểu tượng và tạo công cụ tùy chỉnh đáng chú ý.

GPT-6 Astra của OpenAI đạt 99,9% trên ARC-AGI-3, vượt qua người dùng về hiệu suất hành động

GPT-6 Astra của OpenAI đạt 99,9% trên ARC-AGI-3, vượt qua con người về hiệu quả hành động

Kết quả mới nhất từ ARC Prize cho thấy GPT-6 Astra của OpenAI đã đạt điểm số ấn tượng trên ARC-AGI-3, một benchmark thế hệ mới về trí tuệ nhân tạo tổng hợp (AGI). Với harness Provider Adapter, Astra đạt 99,9% độ chính xác, trong khi với Standard harness đạt 62,7% — cả hai đều là mức điểm cao nhất từ trước đến nay.

Điểm đáng chú ý hơn cả là Astra đã vượt qua đường cơ sở về hiệu quả hành động của con người, sử dụng ít hành động hơn mức trung bình trên 96% cấp độ. Astra còn thể hiện khả năng tự phát triển các ký hiệu toán học rút gọn, biến môi trường lạ thành mô hình thế giới có thể dự đoán.

Thử nghiệm Astra GPT-6 trên ARC-AGI-3Thử nghiệm Astra GPT-6 trên ARC-AGI-3

ARC-AGI-3 là gì?

ARC-AGI-3 là thế hệ thứ ba của dòng benchmark ARC-AGI, được thiết kế để đo lường trí thông minh tác nhân (agentic intelligence) trong các môi trường trừu tượng, xoay vòng và mới lạ. Khác với các benchmark truyền thống, tại đây AI phải tự chủ động khám phá, suy luận mục tiêu và xây dựng mô hình nội tại về môi trường để lập kế hoạch hành động mà không có hướng dẫn rõ ràng.

Benchmark này kiểm tra bốn kỹ năng cốt lõi của trí thông minh tác nhân:

  • Khám phá: Chủ động thu thập thông tin bằng cách tương tác với môi trường
  • Mô hình hóa: Chuyển đổi quan sát thô thành mô hình dự đoán được
  • Thiết lập mục tiêu: Xác định trạng thái tương lai mong muốn chỉ với phần thưởng thưa thớt
  • Lập kế hoạch và thực thi: Vạch đường từ trạng thái hiện tại đến mục tiêu, tự điều chỉnh khi xuất hiện thông tin mới

Kết quả chi tiết của Astra

Bảng xếp hạng ARC-AGI-3 với AstraBảng xếp hạng ARC-AGI-3 với Astra

Với Standard harness — cho phép model mang theo ghi chú xuyên suốt môi trường — GPT-6 Astra (mức suy luận tối đa) đạt 62,7% trên ARC-AGI-3 Semi-Private với chi phí 26.098 USD. Tuy nhiên, kết quả cao hơn nhiều đến từ Provider Adapter harness, giúp bảo toàn trạng thái suy luận không minh bạch giữa các yêu cầu và sử dụng cơ chế nén cho hội thoại dài. Với harness này, Astra (mức cao) đạt 99,9% với chi phí chỉ 18.817 USD.

Một phát hiện thú vị: chi phí thấp hơn thường đi kèm với mức suy luận cao hơn. Lý do là Astra giải quyết trò chơi bằng ít hành động hơn, giảm tổng số lượt gọi model và token sử dụng.

Để so sánh, con người tham gia thử nghiệm nhận 115 USD cho mỗi phiên 90 phút, cộng thêm 5 USD cho mỗi trò chơi hoàn thành. Tuy nhiên, nếu chỉ tính riêng năng lượng não bộ (khoảng 20W) theo giá điện, chi phí ước tính chỉ 0,067 cent cho mỗi lần thử.

Chiến lược đáng kinh ngạc: Ký hiệu toán học tự phát triển

Điểm nổi bật nhất mà nhóm ARC đánh giá là cách Astra tự xây dựng ngôn ngữ ký hiệu riêng để theo dõi trạng thái và lập kế hoạch:

Trạng thái trò chơi: L8: hub q2 (8↓). Độ dài: 14=1...
Kế hoạch nhiều bước: extend8 to3; retract10 to2; shorten8 to1
Tọa độ điều khiển: 9−=(39,4), rotate=(49,18), 14+=(59,11)
Thời gian và vị trí: Turn 5: P=(24,20), empty, facing west

Mô hình ký hiệu mà Astra tự tạoMô hình ký hiệu mà Astra tự tạo

Đây không phải một ngôn ngữ lập trình đầy đủ mà là dạng viết tắt đại số được tạo ra trong thời gian thực. Astra ghi lại chính xác vị trí đối tượng, quy luật tương tác và thứ tự hành động cần thiết — thể hiện khả năng hiểu sâu và nén thông tin vượt trội.

Vượt qua hiệu quả hành động của con người

Trước khi phát hành benchmark, ARC đã thử nghiệm khoảng 500 người để thiết lập đường cơ sở. Kết quả cho thấy Astra (mức tối đa, với Provider Adapter harness) sử dụng ít hành động hơn mức trung bình ở 96% cấp độ và trung bình giảm 51,7% số hành động mỗi cấp. Đây được xem là cột mốc quan trọng — điều mà nhóm ARC từng dự đoán sẽ là ranh giới khó vượt giữa AI và con người.

So sánh hiệu quả hành động Astra so với con ngườiSo sánh hiệu quả hành động Astra so với con người

Khi AI tiên phong đã "hiểu" các cơ chế, nó thường thực thi trong phạm vi hiệu quả tương đương con người.

Công cụ tùy chỉnh trong môi trường PRO-LONG

Trong một thử nghiệm nâng cao với harness PRO-LONG, nơi Astra có quyền truy cập sandbox để chạy mã, nó tự tạo ra bộ công cụ riêng cho từng trò chơi — từ trình phân tích bàn cờ, mô hình trạng thái, đến thuật toán tìm kiếm. Với trò chơi mê cung tu93 có lính canh tuần tra, Astra liên tiếp xây dựng các module như maze_solver.py, combat_solver.py, patrol_solver.py rồi dùng sync_state.py để kiểm tra dự đoán với quan sát thực tế.

Astra giải tu93 trong PRO-LONGAstra giải tu93 trong PRO-LONG

Hai harness, hai câu hỏi khoa học

Sự khác biệt lớn giữa hai harness đặt ra câu hỏi về cách đánh giá AI đúng đắn:

  • Standard harness — câu hỏi "so sánh công bằng giữa các nhà cung cấp" với giao diện tối giản, model tự quyết định ghi chú gì
  • Provider Adapter harness — câu hỏi "model hoạt động tốt thế nào khi dùng cơ chế mà nhà cung cấp thiết kế riêng", tận dụng trạng thái suy luận ẩn và nén hội thoại dài

Kết quả cho thấy Provider Adapter harness nhanh hơn khoảng 3,66 lần về thời gian tổng hợp và dùng ít hơn 49% token trên 167 cặp trò chơi-suy luận mà cả hai harness cùng giải quyết. Trong tương lai, ARC sẽ công bố đồng thời cả hai kết quả trên bảng xếp hạng chính thức.

Ý nghĩa đối với cộng đồng AI Việt Nam

Kết quả này có ý nghĩa lớn với các nhà nghiên cứu và kỹ sư AI tại Việt Nam đang phát triển các tác nhân AI (agent). Nó cho thấy rằng thế hệ model mới không chỉ giỏi suy luận mà còn biết tự xây dựng công cụ, nén thông tin hiệu quảhọc qua tương tác — những kỹ năng thiết yếu cho các ứng dụng thực tế phức tạp như tự động hóa quy trình, phân tích dữ liệu lớn hay xử lý môi trường động.

Dù vậy, các tác giả bài viết nhấn mạnh: Astra đạt điểm cao trên ARC-AGI-3 không phải là bằng chứng đã đạt AGI. Vẫn còn khoảng cách lớn giữa môi trường đóng, có quy luật xác định với sự phức tạp, mở của thế giới thực. ARC đang hướng tới các thế hệ benchmark tiếp theo đánh giá khả năng tự cải tiến đệ quyđổi mới mở.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗