Cuộc Đua NanoGPT Speedrun: AI Đang Tiến Gần Đến Kỷ Lục Con Người Như Thế Nào?
Bài viết phân tích bảng xếp hạng NanoGPT Speedrun từ Prime Intellect, nơi các mô hình AI tiên tiến nhất thế giới cạnh tranh để đạt được kết quả huấn luyện tốt nhất trong thời gian ngắn nhất. Kết quả cho thấy các tác nhân AI hàng đầu như Fable 5 và Opus 5 đã thu hẹp tới hơn 80% khoảng cách so với kỷ lục của con người, đánh dấu một bước tiến quan trọng trong lĩnh vực tự động hóa nghiên cứu AI.

Cuộc Đua NanoGPT Speedrun: AI Đang Tiến Gần Đến Kỷ Lục Con Người Như Thế Nào?
Trong một thí nghiệm đột phá, Prime Intellect đã công bố bảng xếp hạng "NanoGPT Speedrun" — một cuộc đua nơi các tác nhân AI tự động hóa toàn bộ quy trình huấn luyện mô hình ngôn ngữ nhỏ, từ việc viết code, điều chỉnh siêu tham số cho đến tối ưu hóa kiến trúc. Kết quả ban đầu cho thấy các mô hình AI hàng đầu hiện nay đã thu hẹp tới 81,7% khoảng cách so với kỷ lục của con người trên cùng một bài toán, mở ra một tương lai nơi AI có thể tự nghiên cứu và phát triển các mô hình AI khác một cách độc lập.
Bảng xếp hạng này không chỉ đơn thuần là một cuộc thi về tốc độ, mà còn là thước đo quan trọng về khả năng tự động hóa học máy (AutoML) và năng lực suy luận của các tác nhân AI hiện đại. Việc phân tích sâu hơn về các chiến lược, công cụ và giới hạn ngân sách mà các mô hình sử dụng sẽ cung cấp cái nhìn rõ ràng hơn về tương lai của ngành AI.
Bối Cảnh Và Mục Tiêu Của NanoGPT Speedrun
NanoGPT Speedrun là một bài toán chuẩn hóa được thiết kế để huấn luyện một mô hình GPT-2 nhỏ trên tập dữ liệu FineWeb chỉ trong một khoảng thời gian ngắn, thường là dưới 10 ngày trên một GPU duy nhất. Mục tiêu là đạt được điểm validation loss càng thấp càng tốt, với kỷ lục của con người hiện tại là 2.600 điểm. Các tác nhân AI được cung cấp một "ngân sách" tương đương 24 giờ sử dụng GPU (thường là H100), và chúng phải tự quyết định cách phân bổ thời gian và tài nguyên hiệu quả nhất.
Điều đặc biệt ở cuộc đua này là các tác nhân AI không chỉ đơn thuần chạy các script có sẵn. Chúng phải có khả năng:
- Đọc và hiểu tài liệu, paper nghiên cứu về các kỹ thuật huấn luyện hiện đại.
- Viết và debug code phức tạp, bao gồm việc triển khai các kiến trúc mới hoặc thủ thuật tối ưu.
- Thực hiện các thử nghiệm có hệ thống, ghi lại kết quả và điều chỉnh chiến lược dựa trên dữ liệu quan sát được.
- Quản lý ngân sách GPU hạn chế, buộc phải đưa ra quyết định sáng suốt về việc nên thử nghiệm gì và trong bao lâu.
So sánh giữa kết quả của AI và con người trong các tác vụ phức tạp này cung cấp một thước đo khách quan về mức độ "thông minh" thực sự của AI trong việc giải quyết các vấn đề khoa học mở.
Kết Quả Ấn Tượng Từ Các Tác Nhân AI Hàng Đầu
Bảng xếp hạng hiện tại cho thấy một sự phân hóa rõ rệt về năng lực giữa các mô hình và các công cụ lập trình mà chúng sử dụng. Dưới đây là một số kết quả nổi bật trong top 5:
- Fable 5 (sử dụng claude-code, chế độ high): Đạt kết quả tốt nhất với 3.010 điểm, thu hẹp 81,7% khoảng cách so với kỷ lục con người. Mô hình này tiêu tốn đến 800M tokens đầu ra, cho thấy một quá trình suy luận và thử nghiệm rất tích cực.
- Opus 5 (sử dụng claude-code, chế độ max): Đạt 2.920 điểm (53,6% khoảng cách được thu hẹp) sau 12,9 ngày hoạt động, cho thấy chiến lược kéo dài thời gian và cẩn thận hơn.
- Kimi K3 (sử dụng prime-agent, chế độ max): Đạt 2.930 điểm (52,2%), nổi bật với việc tạo ra 2.2 triệu tokens đầu ra — một con số khổng lồ phản ánh sự thử nghiệm rầm rộ.
- Kimi K3 (sử dụng kimi-code, chế độ max): Phiên bản khác của cùng mô hình đạt 2.974 điểm (45,8%), cho thấy việc lựa chọn khung lập trình (framework) ảnh hưởng lớn đến hiệu quả.
- Opus 4.8 (claude-code): Đạt 3.018 điểm (39,4%) sau 3 ngày, thể hiện hiệu suất tốt ngay cả với thời gian hoạt động ngắn.
Một điểm thú vị là GPT-5.6 Sol và GPT-5.6 Sol Pro nằm giữa bảng xếp hạng với khoảng 35,9% và 33,6% khoảng cách được thu hẹp. Điều này trái ngược với kỳ vọng của nhiều người về việc các mô hình của OpenAI sẽ dẫn đầu trong một tác vụ liên quan đến code. Việc sử dụng công cụ codex có vẻ không hiệu quả bằng claude-code hay prime-agent trong bối cảnh này.
Phân Tích Chiến Lược: Tốc Độ vs. Sự Cẩn Trọng
Dữ liệu từ bảng xếp hạng cho thấy không có một chiến lược chiến thắng duy nhất. Trong khi Fable 5 chọn cách đốt cháy ngân sách GPU rất mạnh mẽ (truy cập hơn 11.000 lần và sử dụng 800M tokens) để đạt kết quả tốt nhất, một mô hình khác là Opus 5 lại chọn chiến thuật an toàn hơn, dành thời gian dài hơn để suy nghĩ và thực hiện ít nhất là 690.000 lần truy cập cho đến khi kết thúc.
Một quan sát đáng chú ý là hiệu quả sử dụng tài nguyên của các mô hình khác nhau rất khác nhau. Ví dụ, Grok 4.5 chỉ sử dụng 46M tokens nhưng vẫn đạt được kết quả 3.120 điểm (24,6% khoảng cách được thu hẹp), trong khi GPT-5.6 Sol sử dụng đến 2.9B tokens nhưng chỉ đạt kết quả tương tự. Điều này cho thấy khả năng suy luận và lập kế hoạch quan trọng hơn nhiều so với việc brute-force thử nghiệm mù quáng.
"Việc sử dụng ít tokens nhưng hiệu quả hơn, như trường hợp của Grok 4.5, cho thấy tương lai của AutoML nằm ở khả năng đưa ra quyết định thông minh dựa trên nền tảng kiến thức vững chắc, chứ không phải ở việc thử càng nhiều càng tốt." — Nhận định từ một kỹ sư AI.
Ý Nghĩa Đối Với Cộng Đồng AI Việt Nam
Đối với các nhà phát triển và nghiên cứu AI tại Việt Nam, cuộc đua NanoGPT Speedrun mang lại nhiều bài học quan trọng:
- Sức mạnh của các tác nhân AI (AI Agents): Khả năng tự động hóa các quy trình nghiên cứu và phát triển phức tạp đang trở nên rõ ràng. Việc nắm vững cách sử dụng và tích hợp các công cụ như
claude-code,codexhayprime-agentsẽ là một lợi thế cạnh tranh lớn. - Tối ưu hóa chi phí: Bài toán này cho thấy ngay cả với một ngân sách GPU hạn chế, việc có một chiến lược thông minh có thể tạo ra sự khác biệt rất lớn. Các startup Việt Nam thường có nguồn lực hạn chế, do đó việc học hỏi các chiến thuật "speedrun" này có thể giúp tiết kiệm đáng kể chi phí vận hành.
- Xu hướng nghiên cứu có tính hệ thống: Thay vì chạy theo các kết quả benchmark truyền thống, việc xây dựng các quy trình tự động hóa và có thể lặp lại (reproducible) sẽ giúp các nhóm nghiên cứu tại Việt Nam đạt được kết quả tốt hơn trong thời gian ngắn hơn.
Kết Luận
NanoGPT Speedrun của Prime Intellect không chỉ là một bảng xếp hạng đầy tính cạnh tranh; nó là một minh chứng rõ ràng cho sự trưởng thành của các tác nhân AI trong việc giải quyết các vấn đề khoa học phức tạp. Việc một mô hình AI có thể thu hẹp đến hơn 80% khoảng cách so với kỷ lục của con người chỉ trong vài ngày làm việc là một bước tiến vượt bậc so với chỉ một năm trước.
Tuy nhiên, nhân loại vẫn còn một chặng đường dài trước khi AI có thể hoàn toàn thay thế các nhà nghiên cứu AI hàng đầu. Khả năng đưa ra những ý tưởng đột phá, hiểu biết sâu sắc về mặt lý thuyết và sự sáng tạo vẫn là điểm mạnh của con người. Cuộc đua này cho thấy AI đang tiến gần hơn bao giờ hết, và điều quan trọng nhất là chúng ta cần nắm bắt và hướng dẫn sự phát triển này một cách thông minh để mang lại lợi ích cho toàn xã hội, đặc biệt là trong bối cảnh ngành AI đang phát triển mạnh mẽ tại Việt Nam.