Claude, Codex hay Cursor chọn công cụ nào? Kết quả từ 17.000 lần chạy thử nghiệm
Một nghiên cứu quy mô lớn với gần 17.000 phiên chạy thử nghiệm đã hé lộ cách các trợ lý lập trình AI như Claude Code, Codex và Cursor đưa ra quyết định chọn công cụ, thư viện hay dịch vụ bên thứ ba. Kết quả cho thấy sự khác biệt rõ rệt về nguồn thông tin mà mỗi agent dựa vào, cũng như các yếu tố bất ngờ ảnh hưởng đến lựa chọn cuối cùng.

Khi các trợ lý lập trình AI (coding agents) ngày càng đóng vai trò quan trọng trong quy trình phát triển phần mềm, một câu hỏi lớn được đặt ra: chúng thực sự dựa vào đâu để quyết định chọn công cụ nào cho một tác vụ cụ thể? Một nghiên cứu mới từ Armature Tech đã thực hiện gần 17.000 phiên chạy thử nghiệm để tìm ra câu trả lời, qua đó phơi bày những hành vi thú vị và đôi khi gây bất ngờ của các "nhân viên AI" này.
Phương pháp nghiên cứu: Xây dựng một hệ sinh thái giả lập thực tế
Thay vì chỉ đơn thuần đưa ra các câu hỏi lý thuyết, nhóm nghiên cứu đã xây dựng một quy trình phức tạp để tái hiện môi trường làm việc thực tế của lập trình viên.
Đầu tiên, họ phân tích hàng nghìn repository công khai trên GitHub để nắm được bức tranh tổng quan về ngôn ngữ lập trình, framework, dịch vụ bên thứ ba và nền tảng triển khai phổ biến. Sau đó, các agent được giao nhiệm vụ tạo ra 75 repository mô phỏng bằng 10 ngôn ngữ khác nhau, với tên công ty giả, lịch sử git giả, API key giả nhưng lockfile thật đã được kiểm tra trên các registry như npm.
Mỗi "thí nghiệm" là một tác vụ thực tế được đưa ra bởi một trong bốn hồ sơ người dùng khác nhau: lập trình viên "vibe-coding" (chỉ mô tả triệu chứng và trạng thái mong muốn), kỹ sư junior, kỹ sư senior và kỹ sư tại một tập đoàn lớn với các ràng buộc về tuân thủ và mua sắm công nghệ.
Điểm đặc biệt là hệ thống có một "người mô phỏng" do Gemini 3.7 Flash đóng vai, để tạo ra các tình huống hội thoại nhiều lượt gần với thực tế — nơi agent cần đề xuất giải pháp và xin phép trước khi triển khai. Một phiên bản Gemini khác đóng vai "giám khảo" để đánh giá tính hợp lệ và xác định người chiến thắng cuối cùng trong mỗi phiên.
5 quan sát quan trọng từ dữ liệu
Từ hơn 5.292 phiên hợp lệ, nghiên cứu đã rút ra những phát hiện đáng chú ý:
1. Ba agent chọn nguồn thông tin khác nhau và thường bất đồng
- Cursor dựa vào tìm kiếm web trong 2/3 số phiên.
- Codex gần như luôn tìm kiếm web (94%), nhưng có tới 9/10 truy vấn sử dụng các toán tử như
site:để giới hạn trong các tên miền đáng tin cậy. - Claude Code chủ yếu dựa vào kiến thức nội tại và chỉ tìm web trong khoảng 30% trường hợp — tuy nhiên khi tìm kiếm, nó duyệt số trang nhiều gấp 3 lần Codex. Với các lĩnh vực mới như sandboxes, tỷ lệ này tăng lên 80%.
Cả ba agent chỉ cùng chọn một công cụ trong 42% các ô thí nghiệm. Ví dụ, với voice agents, Claude Code chọn Twilio, Codex chọn OpenAI Realtime API, còn Cursor chọn Vapi.
2. Claude Code thích tự xây dựng nội bộ hơn
Trong khi Codex và Cursor có tỷ lệ chọn giải pháp tự phát triển (build in-house) là 10%, thì con số này của Claude Code lên tới 19% — gần gấp đôi.
3. Bối cảnh repository quyết định kết quả
Cùng một yêu cầu nhưng chạy trên 4 repository với 4 ngôn ngữ khác nhau cho ra 4 nhà cung cấp email khác nhau: Resend thắng trên TypeScript (55/89), Sendgrid thắng trên Python (22/24), Postmark thắng trên Go và Azure ACS thắng trên Java. Tương tự, Vercel gần như bất bại trên các repo NextJS nhưng không bao giờ được gợi ý trên repo Python — nơi Render thống trị.
4. Được nhắc đến nhiều không đồng nghĩa với chiến thắng
Dữ liệu cho thấy nhiều ông lớn thường xuyên xuất hiện trong các cuộc trò chuyện nhưng hiếm khi được chọn:
PayPal được nhắc tới 139 lần nhưng không bao giờ được chọn (Stripe thắng 124/139 phiên đó). Adyen nhắc tới 175 lần nhưng chỉ thắng 3 lần. LangChain có 194 lượt đề cập nhưng chỉ được chọn 4 lần (!).
5. Cách trình bày thông tin có thể làm thay đổi quyết định
Chi tiết nhỏ nhưng gây ảnh hưởng lớn: Mailgun thường thua Postmark khi agent đọc thấy điều khoản "giữ dữ liệu 1 ngày" trong gói miễn phí. Supabase thường thua vì giới thiệu quá nhiều tính năng BaaS không cần thiết (auth, storage, realtime) đi kèm trong gói giá trọn bộ, trong khi agent chỉ đơn giản cần một cơ sở dữ liệu.
Bức tranh cạnh tranh từng mảng
- Stripe thắng 9/10 trường hợp về thanh toán, chỉ thua trên các thị trường có quy định EU đặc thù (Paddle, Mollie).
- Neon chiếm 66% thị phần database được chọn, theo sau là các giải pháp cloud-native.
- Amazon S3 chiếm 45% cho lưu trữ file, Azure và GCP mỗi bên 20%.
- Resend (35,6%) và Postmark (27,4%) dẫn đầu mảng email.
Kết luận và hướng ứng dụng
Nghiên cứu này đặt ra câu hỏi lớn cho các nhà phát triển công cụ và nhà cung cấp dịch vụ: làm thế nào để sản phẩm của bạn được các coding agent lựa chọn? Câu trả lời không chỉ nằm ở chất lượng sản phẩm mà còn ở cách thông tin được trình bày trên trang chủ, docs hay trang giá.
Với cộng đồng lập trình viên Việt Nam, điều này cũng là lời nhắc hữu ích: khi sử dụng các trợ lý AI, đừng ngại thêm ngữ cảnh cụ thể, ràng buộc chi phí hay các yêu cầu kỹ thuật chi tiết vào prompt. Bởi kết quả cho thấy, cách bạn đặt câu hỏi có thể ảnh hưởng mạnh mẽ đến việc AI sẽ chọn công nghệ nào cho dự án của bạn.
Toàn bộ dữ liệu và trace của 17.000 phiên thử nghiệm đã được Armature Tech công bố công khai, mở ra cơ hội cho các nghiên cứu sâu hơn về hành vi ra quyết định của AI trong tương lai.