Đánh giá 12 khung tác nhân AI: Cùng một mô hình, chi phí mỗi lần chạy chênh lệch tới 17 lần
Một bài đánh giá mới từ FrontierHarness so sánh hiệu suất của 12 khung (harness) tác nhân AI khác nhau khi chạy cùng một mô hình trên cùng một tập nhiệm vụ. Kết quả cho thấy chất lượng và chi phí có sự phân hóa rõ rệt, với chi phí trung bình mỗi tác vụ dao động từ 1,05 USD đến 18,34 USD — chênh lệch gấp 17 lần, dù tỷ lệ vượt qua chỉ khác biệt khoảng 16%.

Đánh giá 12 khung tác nhân AI: Cùng một mô hình, chi phí mỗi lần chạy chênh lệch tới 17 lần
Một cuộc thử nghiệm mới từ dự án FrontierHarness vừa hé lộ bức tranh toàn cảnh về hiệu suất của 12 khung tác nhân AI (harness) phổ biến nhất hiện nay, từ Codex, Claude Code cho đến các lựa chọn tối giản như Exo Harness hay OpenCode. Điểm đáng chú ý nhất không nằm ở việc khung nào "thông minh" nhất, mà là mức độ chênh lệch khổng lồ về chi phí giữa các khung khi cùng sử dụng một mô hình nền tảng duy nhất.
Theo kết quả công bố, chi phí trung bình cho mỗi tác vụ có thể dao động từ 1,05 USD (Exo Harness) đến 18,34 USD (Claude Code) — tức gấp tới 17 lần, trong khi tỷ lệ hoàn thành tác vụ (pass rate) chỉ chênh lệch không quá 16%. Điều này đặt ra câu hỏi lớn cho các nhà phát triển: làm thế nào để tối ưu chi phí mà không hy sinh chất lượng?
Phương pháp thử nghiệm: Kiểm soát tuyệt đối để so sánh công bằng
FrontierHarness v1.0 không chỉ đánh giá chất lượng đầu ra mà còn xem xét kỹ lưỡng các yếu tố chi phí và tốc độ. Toàn bộ thử nghiệm được thực hiện trên nền tảng Runta, nơi mọi khung tác nhân đều được chuẩn bị sẵn trong một golden checkpoint.
Mỗi lần chạy là một lần khôi phục hoàn toàn mới từ checkpoint này, với cùng một lượng vCPU, RAM, dung lượng ổ cứng và trạng thái bộ nhớ cho tất cả các khung. Điều này giúp loại bỏ tối đa các biến số môi trường và đảm bảo sự khác biệt chỉ đến từ chính thiết kế của từng khung tác nhân.
Chất lượng: Codex dẫn đầu với 66,7% tỷ lệ vượt qua
Trong danh sách 12 khung được thử nghiệm, Codex v0.148.0 nổi lên như người dẫn đầu về chất lượng với 66,7% tỷ lệ hoàn thành tác vụ thành công. Đứng ở vị trí thứ hai là Claude Code (63,3%) và DSH Creator cũng đạt mức 63,3% — một kết quả rất ấn tượng đối với một khung ít tên tuổi hơn.
Dưới đây là bảng xếp hạng toàn bộ theo tỷ lệ vượt qua:
- Codex: 66,7% — chi phí 3,47 USD/tác vụ
- Claude Code: 63,3% — chi phí 18,34 USD/tác vụ
- DSH Creator: 63,3% — chi phí 3,28 USD/tác vụ
- Pi / DSH PTC / DSH Standard: 60,0% — chi phí từ 2,43 đến 4,58 USD
- Oh My Pi / Kimi Code / DSH Minimal: 56,7%
- Exo Harness: 53,3% — chi phí chỉ 1,05 USD/tác vụ
- Hermes / OpenCode: 50,0%
Một điểm đáng lưu ý là tỷ lệ vượt qua cao nhất (66,7%) thấp hơn tỷ lệ thấp nhất của nhóm top 4 (60,0%) chỉ khoảng 7%, cho thấy chất lượng của các khung không chênh lệch quá lớn trong khi chi phí thì có thể biến động... không lường trước được.
Chi phí và tốc độ: Nghịch lý đắt giá
Trong khi Claude Code đứng thứ hai về chất lượng, nó lại... đắt nhất một cách kinh ngạc khi trung bình một tác vụ tiêu tốn tới 18,34 USD — đắt hơn gần 6 lần so với DSH Creator cũng có cùng tỷ lệ vượt qua 63,3%. Trong khi đó, OpenCode dù tỷ lệ vượt qua thấp nhất (50%) nhưng lại đứng đầu về chi phí hiệu quả nếu tính trên mỗi lần thử thành công.
Exo Harness gây bất ngờ lớn khi chỉ tiêu tốn 1,05 USD cho mỗi tác vụ ở mức chất lượng 53,3%, trở thành lựa chọn kinh tế nhất trong danh sách. Nếu bạn cần một khung hoạt động nhanh, DSH Minimal là lựa chọn tối ưu với thời gian hoàn thành trung bình chỉ 5 phút 41 giây.
Những lưu ý quan trọng khi diễn giải dữ liệu
Tác giả bài đánh giá cũng đưa ra ba lời cảnh báo để tránh hiểu lầm:
"OpenCode: khi loại trừ các lần chạy thất bại, nó chỉ thực sự hoàn thành 15 tác vụ. Nếu tính cả các lần thất bại, chi phí thực tế là 3,24 USD mỗi tác vụ."
"Tỷ lệ cache hit không phải là chi phí. Một lần chạy thất bại với 300 vòng lặp cache vẫn có thể ngốn nhiều tài nguyên hơn một lần cache miss ngắn gọn."
"Chất lượng và chi phí có thể phân kỳ hoàn toàn. Claude Code vượt qua 19 tác vụ nhưng đồng thời đẩy chi phí lên 18,34 USD mỗi tác vụ."
Những cảnh báo này cho thấy rằng việc đánh giá khung tác nhân AI không nên chỉ dựa vào một thông số duy nhất mà cần cân nhắc đầy đủ bối cảnh sử dụng thực tế.
Lời khuyên cho nhà phát triển tại Việt Nam
Với xu hướng ngày càng nhiều công ty phần mềm Việt Nam ứng dụng tác nhân AI vào quy trình phát triển, kết quả từ FrontierHarness mang đến vài gợi ý chiến lược. Nếu bạn ưu tiên chất lượng tối đa cho các tác vụ phức tạp, Codex hoặc DSH Creator là sự lựa chọn an toàn. Nếu ngân sách hạn hẹp và bạn cần một giải pháp chạy được khối lượng lớn tác vụ, Exo Harness hoặc Pi sẽ giúp tối ưu chi phí đáng kể.
Tác giả cũng lưu ý rằng FrontierHarness v1.0 tập trung vào các bối cảnh kỹ thuật phần mềm và tác vụ dựa trên terminal, nên kết quả có thể không khái quát hóa cho các lĩnh vực tri thức khác. Vì vậy, độc giả nên cân nhắc kỹ đặc thù của từng dự án trước khi áp dụng một khung tác nhân cụ thể vào quy trình sản xuất. Việc thử nghiệm thực tế trên chính dữ liệu và quy trình nội bộ vẫn luôn là bước bắt buộc trước khi đưa ra quyết định cuối cùng.
Biểu trưng FrontierHarness


