Anthropic bị nghi ngờ đang thử nghiệm giảm cấp độ nỗ lực trong Claude Code, khiến người dùng hoang mang

Công nghệ22 tháng 8, 2026·4 phút đọc

Nhiều người dùng phàn nàn rằng Claude Code của Anthropic bỗng nhiên hoạt động "ngu hơn" và chậm chạp hơn trong tuần này. Theo phát hiện từ nhà phát triển Argofowl, nguyên nhân có thể đến từ một thử nghiệm A/B phía máy chủ, khiến các phiên bản mới của Claude Code nhận diện mức độ nỗ lực "high" giống như "low" trước đây. Điều này khiến cộng đồng lập trình viên đặt câu hỏi về chính sách minh bạch của Anthropic.

Anthropic bị nghi ngờ đang thử nghiệm giảm cấp độ nỗ lực trong Claude Code, khiến người dùng hoang mang

Anthropic bị chỉ trích vì thử nghiệm giảm "chất xám" của Claude Code mà không hề thông báo

Một loạt báo cáo từ cộng đồng lập trình viên cho thấy Claude Code của Anthropic đang hoạt động sa sút đáng kể trong vài ngày qua. Cụ thể, nhà phát triển Argofowl đã phát hiện ra rằng công ty đang chạy một thử nghiệm A/B phía máy chủ, âm thầm thu hẹp thang đo nỗ lực (effort scale) của mô hình trên các phiên bản mới nhất, khiến nhiều người dùng lầm tưởng công cụ của họ hoặc code của họ đang bị lỗi.

Theo các bài đăng trên mạng xã hội X và diễn đàn Hacker News, thử nghiệm này không nằm trong ứng dụng mà được triển khai hoàn toàn từ phía máy chủ của Anthropic. Điều này giải thích vì sao nhiều lập trình viên khi kiểm tra phiên bản ứng dụng vẫn thấy mã nguồn không thay đổi, nhưng hành vi của mô hình lại khác hẳn.

Thử nghiệm ảnh hưởng trực tiếp đến hiệu suất mã nguồn

“Nếu bạn cảm thấy Claude dạo này có vẻ ‘đần’ hơn, thì không phải lỗi của bạn đâu.”

Đó là chia sẻ ban đầu của Argofowl trước khi đi sâu vào phân tích. Người dùng này sau đó đã phát hiện ra rằng kể từ phiên bản 2.1.237, mô hình khi được yêu cầu làm việc ở mức “high effort” thực chất chỉ đọc con số nỗ lực là 10/100 — con số chính xác mà trước đây dành cho mức “low”. Phiên bản 2.1.236 trở lên sẽ có khả năng bị cuốn vào nhóm thử nghiệm, trong khi các phiên bản cũ hơn và mô hình Opus 5 (thế hệ mới nhất) được giữ nguyên.

  • Thử nghiệm ảnh hưởng đến các phiên bản 2.1.236+ của Claude Code.
  • Các phiên bản cũ hơn không bị ảnh hưởng.
  • Changelog chính thức không hề đề cập đến sự thay đổi này.

Điều này đồng nghĩa với việc Anthropic đang âm thầm giảm hiệu suất suy luận của mô hình trong các tác vụ phức tạp, có thể nhằm mục đích tiết kiệm chi phí tính toán hoặc tối ưu độ trễ. Tuy nhiên, cách làm thiếu minh bạch này đang gây ra làn sóng chỉ trích từ cộng đồng nhà phát triển - những người trả tiền dịch vụ và kỳ vọng vào chất lượng ổn định.

Người dùng mất cả buổi chỉ vì nghi ngờ sai đối tượng

Một trong những điểm gây bức xúc nhất là người dùng buộc phải tự kiểm tra lại toàn bộ quy trình làm việc của mình. Argofowl chia sẻ rằng anh đã dành cả buổi chiều để tìm lỗi trong code của chính mình và công cụ T3 trước khi nhận ra vấn đề nằm ở phía Anthropic.

“Tôi đã mất cả buổi chiều vì tin rằng code của tôi và ứng dụng T3 có vấn đề, trước khi dò ra được sự thật.”

Sự việc này đặt ra một câu hỏi lớn về độ tin cậy của các nền tảng AI-as-a-Service khi nhà cung cấp có toàn quyền thay đổi hành vi mô hình mà không cần sự đồng ý hay thông báo trước. Với các đội ngũ phát triển phần mềm chuyên nghiệp tại Việt Nam và toàn cầu, việc dựa vào một công cụ có thể “đổi tính cách” bất cứ lúc nào là một rủi ro vận hành không nhỏ.

Ảnh hồ sơ của tài khoản phát hiện sự việcẢnh hồ sơ của tài khoản phát hiện sự việc

Bài học cho cộng đồng lập trình viên

Nếu bạn đang sử dụng Claude Code trong dự án của mình và cảm thấy hiệu suất làm việc gần đây có dấu hiệu đi xuống, hãy kiểm tra phiên bản bạn đang dùng cũng như theo dõi các thông báo từ phía cộng đồng thay vì đổ lỗi cho code. Bên cạnh đó, việc quay trở lại phiên bản cũ hơn (như 2.1.235) có thể là một giải pháp tạm thời nếu bạn cần chất lượng ổn định cho các tác vụ phức tạp.

Sự việc này cũng là lời nhắc nhở rằng các công cụ AI đang ngày càng trở thành hộp đen đối với người dùng cuối. Khi các quyết định thuật toán bị che giấu, cộng đồng phát triển cần xây dựng thói quen kiểm tra, đối chiếu giữa các phiên bản và chủ động báo cáo sự bất thường thay vì chấp nhận mặc định.

Nguồn cảm hứng cho bài viết từ Hacker NewsNguồn cảm hứng cho bài viết từ Hacker News

Kết luận

Chiến thuật A/B testing là phổ biến trong ngành công nghệ, nhưng khi thử nghiệm ảnh hưởng trực tiếp đến chất lượng sản phẩm trả phí, các công ty như Anthropic cần có trách nhiệm thông báo rõ ràng hơn. Việc giữ cho người dùng trong bóng tối không chỉ gây tổn hại lòng tin mà còn tạo ra gánh nặng tìm lỗi không đáng có cho các nhóm phát triển.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗