TurboGPT: Huấn luyện mô hình transformer 22KiB chỉ trong 13 giây bằng CUDA C++

Phần mềm29 tháng 9, 2026·3 phút đọc

Dự án mã nguồn mở TurboGPT cho phép huấn luyện một transformer byte-level siêu nhỏ (chỉ 22KiB) chỉ trong 13 giây nhờ viết hoàn toàn bằng CUDA C++. Lấy cảm hứng từ minGPT, công cụ này hướng đến các thử nghiệm tại nhà nhưng hiện yêu cầu CUDA 13.4 và chỉ hỗ trợ build trên Windows.

TurboGPT: Huấn luyện mô hình transformer 22KiB chỉ trong 13 giây bằng CUDA C++

TurboGPT: Huấn luyện transformer 22KiB chỉ trong 13 giây nhờ CUDA C++

TurboGPT là một dự án mã nguồn mở mới cho phép huấn luyện mô hình transformer byte-level siêu nhỏ, chỉ nặng 22KiB, trong vòng 13 giây. Điểm đáng chú ý là toàn bộ mã nguồn được viết bằng CUDA C++, giúp tận dụng tối đa sức mạnh của GPU.

Dự án lấy cảm hứng từ minGPT – thư viện nổi tiếng của Andrej Karpathy dành cho các thí nghiệm huấn luyện mô hình ngôn ngữ quy mô nhỏ. TurboGPT hướng đến những ai muốn tự tay thử nghiệm huấn luyện mô hình ngay trên máy cá nhân mà không cần đến hạ tầng đám mây phức tạp.

Yêu cầu hệ thống và cách build

Hiện tại, TurboGPT có những ràng buộc khá cụ thể về môi trường chạy:

  • Hệ điều hành: Windows
  • Bộ công cụ build: Visual Studio 2022 C++ tools
  • Phiên bản CUDA: 13.4
  • Script build: chỉ hỗ trợ Windows

Lệnh build được thực hiện như sau:

.\build.ps1 -CudaArch 86

Trong đó, tham số CudaArch tương ứng với compute capability của GPU, tra cứu từ danh sách GPU CUDA của NVIDIA. Ví dụ, giá trị 86 dành cho các dòng card như RTX 30 series.

Cách chạy huấn luyện

Sau khi build thành công, người dùng có thể chạy huấn luyện bằng lệnh:

.\build\turbogpt.exe --data hn1g.txt --log-to runs/ctx4

Quá trình chạy sẽ lưu checkpoint tại đường dẫn runs/ctx4/ctx4.pt, bao gồm trạng thái của model, optimizer, scheduler và trainer. Để tiếp tục huấn luyện từ checkpoint đã có, chỉ cần thêm tham số --load CHECKPOINT.pt.

Nhật ký và báo cáo

TurboGPT hỗ trợ ghi log tương thích với TensorBoard – công cụ trực quan hóa phổ biến trong cộng đồng học máy. Cụ thể:

  • Mỗi batch tạo ra một báo cáo riêng
  • Giới hạn tối đa 8 triệu báo cáo
  • Log được ghi định kỳ hoặc khi lưu checkpoint cuối cùng
  • File runs/ctx4/report.json được tạo tự động từ thư mục log

Kết quả thực nghiệm

Trên tập dữ liệu hn1g (bộ dữ liệu văn bản Hacker News), sau khi huấn luyện với 1,5 tỷ token, mô hình đạt chỉ số 2.52435 BPB (bits per byte). Đây là một con số ấn tượng đối với một mô hình chỉ nặng 22KiB.

Dự án cũng đi kèm script kiểm thử:

python tests\verify.py

Ý nghĩa đối với cộng đồng

TurboGPT là minh chứng cho thấy hiệu suất huấn luyện không nhất thiết phải đi kèm với kích thước mô hình khổng lồ. Với các nhà phát triển Việt Nam đang tìm hiểu về AI, học sâu và lập trình GPU, đây có thể là một dự án thú vị để nghiên cứu cách tối ưu hóa mã CUDA cho các tác vụ học máy.

Tuy nhiên, việc giới hạn ở Windows và yêu cầu CUDA 13.4 có thể gây khó khăn cho những ai quen làm việc trên Linux – môi trường phổ biến hơn trong cộng đồng nghiên cứu AI. Nếu dự án mở rộng hỗ trợ đa nền tảng trong tương lai, sức hút của nó chắc chắn sẽ tăng lên đáng kể.

Dự án được phát hành dưới giấy phép MIT, cho phép tự do sử dụng, chỉnh sửa và phân phối.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗