Mô hình transformer nhỏ đạt 44% trên ARC-AGI-1 chỉ với chi phí 67 cent
Một nhà nghiên cứu độc lập đã huấn luyện một mô hình transformer nhỏ từ đầu chỉ trong 1,5 giờ trên GPU RTX 5090, đạt 44% trên benchmark ARC-AGI-1 với tổng chi phí chỉ 67 cent. Kết quả này vượt qua nhiều mô hình ngôn ngữ lớn và ngang bằng với các phương pháp hàng đầu như TRM/HRM, đồng thời mở ra hướng nghiên cứu mới về hiệu quả mẫu trong AI.

Bước đột phá rẻ bất ngờ: Mô hình transformer nhỏ đạt 44% trên ARC-AGI-1 chỉ với 67 cent
Một nhà nghiên cứu độc lập vừa công bố kết quả ấn tượng trên benchmark ARC-AGI-1: huấn luyện một mô hình transformer nhỏ từ đầu chỉ trong 1,5 giờ trên một GPU RTX 5090, đạt 44% độ chính xác với tổng chi phí chỉ 67 cent. Thành tích này không chỉ vượt qua nhiều mô hình ngôn ngữ lớn (LLM) mà còn ngang bằng với các phương pháp hàng đầu như TRM/HRM, trong khi chi phí thấp hơn nhiều lần.
Điểm mấu chốt của nghiên cứu nằm ở việc tối ưu hiệu quả mẫu (sample efficiency) – khả năng học từ rất ít dữ liệu – thay vì dùng lượng dữ liệu khổng lồ như các LLM hiện đại. Toàn bộ mã nguồn đã được công khai trên GitHub, cho phép cộng đồng tiếp tục cải tiến.
Bối cảnh và mục tiêu nghiên cứu
Tác giả cho rằng hiệu quả mẫu là vấn đề quan trọng nhất của AI hiện nay. ARC-AGI là benchmark lý tưởng để kiểm tra điều này vì:
- Chỉ có 1.000 câu đố trong không gian đa chiều, rất ít so với dữ liệu huấn luyện LLM
- Là benchmark về meta-learning: mỗi câu đố có quy luật riêng nhưng dùng chung các khái niệm cơ bản
- Các khái niệm trong bộ đánh giá đều xuất hiện trong bộ huấn luyện, không cần nhiều tiên nghiệm
- Con người giải rất dễ, và benchmark này vẫn chưa bão hòa về mặt hiệu quả mẫu
Cách hoạt động của mô hình
Phương pháp tổng thể tương tự phiên bản trước nhưng có nhiều cải tiến đáng kể:
- Mỗi cặp đầu vào-đầu ra được chuyển thành chuỗi token, huấn luyện autoregressive bằng transformer nhỏ
- Học từ đầu trên cả bộ huấn luyện và bộ đánh giá tại thời điểm test (test time training)
- Sử dụng 3D RoPE embeddings cho vị trí và additive embeddings riêng cho từng câu đố
- Tăng cường dữ liệu bằng hoán vị màu sắc và đối xứng hình học
Cải tiến lớn nhất so với phiên bản trước:
- Kiến trúc hiện đại hơn: SwiGLU thay vì GELU, RMSNorm thay vì LayerNorm
- Tăng độ sâu: 8 lớp thay vì 4
- Bộ tối ưu mới NorMuon kết hợp AdamW
- Flash attention với varlen training giúp tăng tốc đáng kể
Kết quả ấn tượng và các thí nghiệm ablation
Kết quả chính:
- 44% trên ARC-AGI-1 public eval – ngang bằng TRM/HRM
- 7% trên ARC-2
- Chi phí toàn bộ vòng đời (train + inference): 67 cent
Các thí nghiệm ablation cho thấy:
- Bỏ 3D RoPE hoặc per-task embedding làm điểm giảm mạnh xuống còn 25%
- Huấn luyện trên cả input tokens làm điểm giảm nhẹ xuống ~39%
- Giới hạn bộ dữ liệu ARC-1+ConceptARC cho kết quả tương đương ~40%
Điều thú vị là việc huấn luyện không còn trên input tokens (chuyển sang supervised) giúp cải thiện điểm từ 40% lên 44%, dù test loss lại tệ hơn. Điều này cho thấy tối ưu val loss không phải lúc nào cũng dẫn đến kết quả tốt nhất.
Hướng phát triển và đóng góp cộng đồng
Tác giả tự tin rằng mục tiêu 65% có thể đạt được trong khuôn khổ transformer hiện tại, dựa trên việc hợp nhất các câu đố giải được từ nhiều lần chạy đã đạt 55%. Các hướng cải tiến tiềm năng:
- Thay thế RoPE bằng PoPE hoặc embedding vị trí mới
- Hiện đại hóa kiến trúc hơn nữa
- Giảm chi phí 10 lần bằng GPU code tối ưu thủ công
- Loại bỏ data augmentation – điều mà tác giả "ghét phải dùng"
Tranh luận và chỉ trích
Kết quả này vấp phải nhiều chỉ trích từ cộng đồng, nhưng tác giả đã phản bác thuyết phục:
- "Huấn luyện trên eval puzzles là gian lận?" – Sai, vì chỉ huấn luyện trên inputs, không phải labels (outputs). Đây là phương pháp transductive reasoning đã được nghiên cứu từ thời Vapnik.
- "Chi phí bị bỏ qua?" – Sai, chi phí 67 cent bao gồm toàn bộ vòng đời, từ khởi tạo đến inference trên tất cả tasks.
- "Huấn luyện trên tất cả test tasks cùng lúc không thực tế?" – Đồng ý có phần, nhưng không vì thế mà phủ nhận khả năng của mô hình. LLM cũng "không thực tế" khi huấn luyện trên toàn bộ internet.
Bài học từ LLM trên ARC
Từ sự tiến bộ của LLM trên ARC-AGI, tác giả rút ra:
- ARC-AGI tồn tại trước LLM, và chúng hoạt động tệ ban đầu – chứng minh pretraining không tự động mang lại khả năng suy luận
- o1 đạt 75% là cột mốc lớn, cho thấy LLM có thể học gần như mọi thứ trong post-training nếu đủ dữ liệu
- Nhưng khi ARC-2 ra đời, mọi LLM đều tụt lại – chứng tỏ chúng học "cách giải ARC" chứ không phải suy luận trừu tượng tổng quát
- Các LLM hiện tại không hề hiệu quả về mẫu, điểm số tăng chủ yếu nhờ post-training và synthetic data
Kết luận
Nghiên cứu này là minh chứng mạnh mẽ rằng deep learning thuần túy vẫn có thể đạt kết quả tốt trên các benchmark khó nếu được thiết kế đúng, và chi phí không phải rào cản lớn nhất. Với mã nguồn mở và chi phí cực thấp, bất kỳ ai cũng có thể tham gia nghiên cứu và cải tiến – điều mà tác giả hy vọng sẽ thúc đẩy một làn sóng mới trong việc giải quyết vấn đề hiệu quả mẫu của AI.
hero-img.png
rep-ablation.png
ablate-best-scores.png