AI Agent viết kernel CUDA nhanh hơn cả PyTorch: Sự thật hay chỉ là ảo giác benchmark?
Các AI agent hiện có thể tự viết kernel CUDA vượt mặt PyTorch về tốc độ, nhưng chứng minh những con số đó là thật lại là bài toán khó hơn nhiều. Qua thử nghiệm trên NVIDIA DGX Spark, tác giả nhận ra rằng cách thiết kế benchmark quan trọng không kém gì chất lượng code.
Trong thế giới lập trình hiệu năng cao, việc viết kernel CUDA tối ưu từ lâu vẫn là công việc đòi hỏi chuyên môn sâu. Nhưng khi các AI agent bắt đầu tự sinh ra những kernel này, một câu hỏi mới xuất hiện: liệu chúng có thực sự nhanh hơn PyTorch, hay chúng ta chỉ đang đo sai?
Khi AI agent tự viết kernel CUDA
Các mô hình ngôn ngữ lớn gần đây đã chứng minh khả năng viết code song song phức tạp, bao gồm cả kernel CUDA — những đoạn mã chạy trực tiếp trên GPU để tăng tốc tính toán. Theo một thử nghiệm được công bố trên Towards Data Science, các AI agent có thể tạo ra kernel vượt qua hiệu năng của PyTorch trong một số trường hợp cụ thể.
Điều này nghe có vẻ ấn tượng, bởi PyTorch đã được tối ưu hóa suốt nhiều năm bởi đội ngũ kỹ sư hàng đầu. Tuy nhiên, điểm mấu chốt nằm ở chỗ: vượt qua PyTorch trên một phép đo không có nghĩa là vượt qua trên mọi phép đo.
Bài toán khó hơn: chứng minh tốc độ là thật
Tác giả đã đưa các AI agent lên thử nghiệm trên NVIDIA DGX Spark — một hệ thống máy trạm AI mạnh mẽ. Kết quả cho thấy các kernel do AI viết có thể nhanh hơn, nhưng chỉ trong những điều kiện benchmark rất cụ thể.
Vấn đề nằm ở chỗ thiết kế benchmark:
- Chọn phép toán không đại diện: Một kernel có thể thắng ở phép nhân ma trận nhỏ nhưng thua ở quy mô thực tế.
- Đo thời gian sai cách: Thời gian khởi động kernel, sao chép bộ nhớ hay đồng bộ hóa đều có thể làm sai lệch kết quả.
- Bỏ qua điều kiện biên: Kernel tối ưu cho một kích thước tensor cụ thể có thể sụp đổ khi kích thước thay đổi.
Cách thiết kế benchmark quan trọng không kém gì chất lượng code — một bài học mà bất kỳ kỹ sư hiệu năng nào cũng nên khắc cốt ghi tâm.
Ý nghĩa với cộng đồng lập trình viên
Đối với các nhà phát triển tại Việt Nam đang làm việc với AI và GPU, câu chuyện này mang lại vài bài học thực tế:
- Đừng tin ngay vào benchmark: Khi đánh giá một giải pháp tối ưu, hãy tự kiểm chứng trên workload thực tế của mình, không chỉ dựa vào con số được công bố.
- AI agent là công cụ, không phải chuyên gia: Chúng có thể tăng tốc quá trình viết code, nhưng vẫn cần kỹ sư hiểu rõ kiến trúc GPU để đánh giá và tinh chỉnh.
- Hiệu năng thật khó đo: Việc đánh giá đúng hiệu năng đòi hỏi kiến thức vững về phần cứng, trình biên dịch và cách phần cứng tương tác với phần mềm.
Tương lai của tối ưu hóa hiệu năng
Sự xuất hiện của các AI agent viết kernel CUDA mở ra một hướng đi mới: thay vì con người viết từng dòng mã tối ưu, các kỹ sư có thể dùng AI để sinh code rồi kiểm tra, tinh chỉnh. Nhưng để làm được điều đó một cách đáng tin cậy, cả công cụ lẫn con người đều cần nâng cấp.
Với những ai đang làm việc trên các hệ thống AI tại Việt Nam — từ startup đến các trung tâm nghiên cứu — đây là lời nhắc rằng tối ưu hóa không chỉ là viết code nhanh hơn, mà là hiểu đúng vấn đề cần giải quyết.


