Tôi đã thử nghiệm 10 tổ hợp mô hình và khung công cụ trên cùng một bài tập Three.js
Một bài kiểm tra thực nghiệm so sánh hiệu suất của 10 tổ hợp mô hình AI và khung công cụ lập trình (Codex, OMP, OpenCode, DSH) khi giải cùng một bài tập dựng cảnh ba chiều sci-fi bằng Three.js. Kết quả cho thấy sự khác biệt lớn về thời gian, số token tiêu thụ, số lần gọi công cụ và khả năng hoàn thành nhiệm vụ, giúp độc giả có cái nhìn tổng quan về lựa chọn phù hợp cho từng nhu cầu.
Khi thế giới lập trình ngày càng phụ thuộc vào trợ lý AI, việc chọn đúng mô hình và khung công cụ (harness) trở thành một bài toán không kém phần quan trọng so với việc viết code. Một nhà phát triển vừa công bố kết quả kiểm tra chi tiết trên 10 tổ hợp khác nhau cho cùng một yêu cầu dựng cảnh 3D bằng Three.js, hé lộ sự khác biệt rõ rệt về tốc độ, chi phí token và khả năng hoàn thành tác vụ.
Thí nghiệm được thực hiện với một prompt duy nhất trong chế độ /goal: xây dựng một trang HTML độc lập mô phỏng nhà chứa máy bay sci-fi với drone bay lượn, đèn cảnh báo nhấp nháy, dải băng phát sáng trên đường băng và hiệu ứng sương mù khối. Các mô hình được đưa vào thử nghiệm gồm GLM 5.3 Flash Max, Luna 5.6 Max, SOL 5.6 Max, Astra 6.0 Max và Qwen 3.8 27B x-high, chạy trên bốn khung công cụ chính: Codex, OMP, OpenCode và DSH/PT.
Bài toán không chỉ nằm ở mô hình
Một trong những phát hiện thú vị nhất là yếu tố "khung công cụ" (harness) đóng vai trò quyết định không kém gì sức mạnh của mô hình. Cùng một mô hình Qwen 3.8 27B x-high nhưng khi chạy trên Codex chỉ mất 8 phút 48 giây, trong khi đó khi dùng OMP lại kéo dài đến hơn 41 phút. Số lần gọi công cụ cũng biến động từ 13 lần (với Codex) lên đến 89 lần (với OMP), cho thấy cách khung công cụ điều phối luồng suy nghĩ và hành động của AI có thể tạo ra khác biệt rất lớn về hiệu suất.
Có vẻ như sự kết hợp ăn ý giữa mô hình và khung điều phối là chìa khóa, chứ không phải chỉ dựa vào một mô hình "mạnh" đơn thuần.
Thời gian chờ và số token: hai thước đo đắt giá
Khi xem xét dữ liệu chi tiết, Astra 6.0 Max chạy trên Codex là tổ hợp tiêu tốn thời gian nhất (37 phút 29 giây) và tiêu thụ lượng token khổng lồ (hơn 1,3 triệu tổng cộng). Tuy nhiên, nó hoàn thành nhiệm vụ và có thời gian phản hồi đầu tiên rất nhanh (3.5 giây). Ngược lại, Qwen 3.8 27B x-high đi cùng Codex tỏ ra là phương án tối ưu nhất về mặt thời gian (chưa đến 9 phút) và chỉ dùng khoảng 665.000 token đầu vào nhờ 95% dữ liệu được lưu trong bộ nhớ đệm, một con số hết sức ấn tượng.
Một chi tiết đáng lưu ý là tất cả các tổ hợp đều ghi nhận tỷ lệ lưu trữ token trong bộ nhớ đệm (cached input) trên 70%, thậm chí có trường hợp lên đến 96%. Điều này đồng nghĩa với việc phần lớn ngữ cảnh được tái sử dụng qua nhiều vòng giao tiếp, một yếu tố then chốt giúp giảm chi phí vận hành cho các dự án dài hơi.
Kỷ nguyên mới của việc tối ưu cho AI coding
Điều đáng nói nhất từ thí nghiệm này là hai trong số các tổ hợp (GLM 5.3 Flash Max với Codex và Qwen 3.8 27B x-high với DSH) đã không thể hoàn thành nhiệm vụ chỉ đơn giản vì không mở được trình duyệt để kiểm tra giao diện, dù kết quả tạo file có vẻ thành công. Điều này cho thấy kỹ năng "kiểm thử thị giác" của AI vẫn còn là điểm nghẽn lớn, dù khả năng tạo mã lệnh ngày càng tiến bộ.
Đối với các lập trình viên tại Việt Nam đang tìm cách tối ưu chi phí thuê bao AI hoặc cân nhắc giữa việc dùng mô hình thương mại lớn hay mô hình nguồn mở như Qwen, việc hiểu được hành vi của từng khung công cụ sẽ giúp đưa ra quyết định sáng suốt hơn. Không có một "viên đạn bạc" nào cho tất cả mọi tác vụ, nhưng với dữ liệu thực nghiệm rõ ràng như thế này, nhà phát triển có thể dễ dàng lựa chọn cấu hình phù hợp nhất với bài toán cụ thể của mình — ví dụ như dùng Codex cho các tác vụ cần tốc độ và sự ổn định, hay chọn Astra nếu muốn xử lý những nhiệm vụ phức tạp đòi hỏi suy luận sâu.
Kết luận
Việc so sánh hiệu năng của các mô hình và khung công cụ AI không còn là câu chuyện của riêng các phòng nghiên cứu lớn. Với những bài kiểm tra được công bố công khai như trên, cộng đồng lập trình — từ những người làm freelance đến đội ngũ tại các startup công nghệ trong nước — có thêm một nguồn dữ liệu quý giá để đưa ra lựa chọn sáng suốt, tiết kiệm thời gian và tài nguyên cho các dự án phát triển phần mềm, đặc biệt là trong lĩnh vực đồ họa 3D tương tác trên trình duyệt.