Big Pickle trên SWE Atlas: Mô hình miễn phí bất ngờ vượt qua các đối thủ hàng đầu trong chuẩn đánh giá Codebase QnA

16 tháng 8, 2026·6 phút đọc

Bài viết phân tích kết quả ấn tượng của big-pickle, một mô hình AI miễn phí trên OpenCode Zen, khi đạt tỷ lệ giải quyết 50.8% trên chuẩn SWE Atlas Codebase QnA của Scale AI. Kết quả này vượt qua các mô hình nổi tiếng như GPT-5.5/5.6 và GLM 5.2, chỉ xếp sau hai phiên bản Claude sử dụng scaffold riêng, mở ra câu hỏi về tiềm năng của mô hình này.

Big Pickle trên SWE Atlas: Mô hình miễn phí bất ngờ vượt qua các đối thủ hàng đầu trong chuẩn đánh giá Codebase QnA

Big Pickle trên SWE Atlas: Mô hình miễn phí bất ngờ vượt qua các đối thủ hàng đầu trong chuẩn đánh giá Codebase QnA

Một mô hình AI mang tên big-pickle đang hoạt động miễn phí trong thời gian "tàng hình" trên nền tảng OpenCode Zen vừa gây chú ý khi đạt tỷ lệ giải quyết 50.8% trên chuẩn đánh giá SWE Atlas Codebase QnA của Scale AI. Kết quả này không chỉ vượt qua tất cả các mô hình sử dụng cùng khung scaffold mini-swe-agent, mà còn đánh bại cả những mô hình GPT mạnh nhất đang chạy trên scaffold Codex.

Điều đáng chú ý là toàn bộ quá trình đánh giá 124 tác vụ chỉ tốn 0 đồng cho chi phí mô hình, dù người dùng phải trả khoảng 70 USD cho hạ tầng Modal và 25 USD cho phí đánh giá từ Anthropic. Sự xuất hiện của big-pickle, với các manh mối từ lỗi nhà cung cấp và chữ ký API cho thấy nó có thể được phục vụ bởi hạ tầng của DeepSeek, đặt ra câu hỏi lớn về tương lai của các mô hình mã nguồn mở và miễn phí trong lĩnh vực lập trình AI.

Kết quả và bối cảnh so sánh

So với bảng xếp hạng chính thức của SWE Atlas QnA (cập nhật ngày 28/07/2026), big-pickle xếp ở vị trí thứ ba toàn bảng, chỉ sau hai mô hình Claude sử dụng scaffold độc quyền:

  • Opus 5 (Claude Code, xHigh): 63.17%
  • Opus 4.8 (Claude Code, xHigh): 57.26%
  • big-pickle (Mini-SWE-Agent) — kết quả mới: 50.81%
  • GLM 5.2 (Mini-SWE-Agent): 48.12%
  • GPT-5.6-Sol (Codex, xHigh): 46.00%
  • GPT 5.5 (Codex, xHigh): 45.43%

Đáng chú ý, trong nhóm scaffold Mini-SWE-Agent — được xem là so sánh công bằng nhất — không có mô hình nào trên bảng xếp hạng chính thức đạt được kết quả cao hơn big-pickle. Kết quả này cũng vượt qua mọi mô hình GPT dùng scaffold Codex. Chỉ có hai phiên bản Claude chạy trên scaffold riêng của họ là nhỉnh hơn.

Phân tích theo ngôn ngữ và danh mục

Kết quả cho thấy điểm mạnh và yếu của big-pickle ở các ngôn ngữ và danh mục khác nhau:

Theo ngôn ngữ lập trình:

  • TypeScript: 18/31 tác vụ (58.1%)
  • Python: 16/29 tác vụ (55.2%)
  • Go: 19/38 tác vụ (50.0%)
  • C: 10/26 tác vụ (38.5%)

Theo danh mục kỹ năng:

  • Code Onboarding (làm quen mã nguồn): 17/28 (60.7%)
  • Architecture & system design (kiến trúc & thiết kế hệ thống): 23/44 (52.3%)
  • Root-cause analysis (phân tích nguyên nhân gốc): 17/37 (45.9%)
  • Security (bảo mật): 5/11 (45.5%)
  • API & library usage / integration: 1/4 (25.0%)

Đáng chú ý là hiệu suất yếu nhất ở mảng API và thư viện, thường đòi hỏi kiến thức cập nhật và chính xác về tài liệu — một điểm yếu chung của nhiều mô hình mã nguồn đóng và mở hiện nay.

Phương pháp đánh giá và tính minh bạch

Toàn bộ quá trình tuân thủ nghiêm ngặt giao thức công bố của Scale AI trong phạm vi ngân sách cho phép:

  • Tác vụ: Tất cả 124 tác vụ Codebase QnA từ kho lưu trữ công khai scaleapi/SWE-Atlas, không sửa đổi — kể cả tệp cấu hình mswea_qa_config.yaml có sẵn với giới hạn 250 bước.
  • Hạ tầng: Harbor v0.18.0 trên Modal sandboxes, theo hướng dẫn chính thức.
  • Scaffold: mini-swe-agent phiên bản 2.4.6 — cùng scaffold bash tối giản mà Scale dùng cho các mô hình không phải của họ.
  • Mô hình: big-pickle qua endpoint tương thích OpenAI của OpenCode Zen, sử dụng tổng cộng 674M token đầu vào và 4.3M token đầu ra, với chi phí 0 đồng.
  • Trình đánh giá: claude-opus-4-5-20251101 — đúng mô hình mà Scale chỉ định, truy cập qua endpoint của Anthropic.

Một tác vụ chỉ được tính là giải quyết thành công nếu vượt qua tất cả các tiêu chí bắt buộc trong đánh giá dựa trên rubric — một tiêu chuẩn khắt khe giúp đảm bảo kết quả có ý nghĩa thực tế.

Các hạn chế cần lưu ý

Người đánh giá nhấn mạnh rằng kết quả này không thể xem là tương đương trực tiếp với bảng xếp hạng chính thức do một số hạn chế:

  • Chỉ chạy một lần cho mỗi tác vụ, trong khi giao thức chính thức yêu cầu 3 lần để lấy trung bình. Sai số chuẩn ở 124 tác vụ là khoảng ±4.5 điểm.
  • Tài nguyên sandbox giảm: 4 CPU / 8 GB thay vì 16 CPU / 16 GB, nhưng không có lần chạy nào bị timeout hoặc hết bộ nhớ, nên ảnh hưởng là không đáng kể.
  • Kết quả tự công bố, không được Scale xác minh. Tuy nhiên, toàn bộ log đánh giá chi tiết được đính kèm để cho phép kiểm toán độc lập.
  • Danh tính mô hình chưa xác nhận: Các lỗi từ nhà cung cấp và chữ ký phản hồi API gợi ý rằng big-pickle được phục vụ bởi hạ tầng DeepSeek, nhưng mô hình nền có thể thay đổi bất cứ lúc nào.

"Mô hình nền có thể thay đổi mà không báo trước, vì vậy kết quả này chỉ là ảnh chụp nhanh của những gì đằng sau bí danh vào ngày 11/08/2026."

Hướng dẫn tái tạo và các bài học kinh nghiệm

Tác giả cung cấp hướng dẫn chi tiết để tái tạo kết quả, kèm theo các "xương máu" kỹ thuật quý giá:

  1. Không dùng cờ --ak reasoning_effort với mô hình có tiền tố openai/ — Harbor sẽ âm thầm chuyển sang OpenAI Responses API mà các endpoint chat-completions-only như Zen không hỗ trợ.
  2. Giữ thông tin xác thực của agent và trình đánh giá riêng biệt — hai hệ thống này cần các nguồn bí mật khác nhau.
  3. Truyền bí mật qua mẫu ${VAR} thay vì chữ viết tay — Harbor sẽ thay thế bí mật dạng chữ bằng dấu **** khi lưu trạng thái, làm hỏng tính năng tiếp tục công việc.
  4. Chấp nhận một vài % lần chạy sẽ chết vì lỗi truyền dữ liệu của Modal — lệnh harbor job resume -f sẽ chạy lại chúng sạch sẽ.

Ý nghĩa đối với cộng đồng AI Việt Nam

Sự xuất hiện của big-pickle với hiệu suất ấn tượng và chi phí bằng 0 mang lại nhiều bài học cho các nhà phát triển và doanh nghiệp Việt Nam đang tìm kiếm giải pháp AI tiết kiệm:

  • Các mô hình miễn phí không còn là lựa chọn hạng hai — kết quả này chứng minh rằng các mô hình giá rẻ hoặc miễn phí hoàn toàn có thể cạnh tranh ở các tác vụ lập trình phức tạp.
  • Scaffold đóng vai trò quan trọng — cùng một scaffold, big-pickle vượt qua mọi đối thủ, cho thấy bản thân mô hình mới là yếu tố quyết định.
  • Cơ hội cho nghiên cứu và phát triển nội địa — các nhóm AI Việt Nam có thể học hỏi mô hình đánh giá minh bạch và chi tiết này để xây dựng chuẩn đánh giá riêng cho các mô hình nội địa.

Toàn bộ tài nguyên trong kho lưu trữ (repo) — bao gồm kết quả chi tiết, log xác minh và cấu hình chạy — được phát hành dưới giấy phép MIT, tạo điều kiện cho cộng đồng kiểm tra và phát triển thêm.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗