livenerf: Dự án đo lường liệu Opus 5.5 có bị "nerf" sau khi ra mắt?

Công nghệ29 tháng 9, 2026·7 phút đọc

Một lập trình viên đã xây dựng livenerf — một bộ đánh giá (benchmark) chạy dài hạn nhằm phát hiện liệu các mô hình AI tiên tiến có âm thầm suy giảm năng lực sau khi ra mắt hay không. Dự án bắt đầu đo Claude Opus 5.5 ngay từ ngày đầu tiên và sẽ theo dõi trong 30 ngày với phương pháp thống kê chặt chẽ, minh bạch dữ liệu thô.

livenerf: Dự án đo lường liệu Opus 5.5 có bị "nerf" sau khi ra mắt?

livenerf: Liệu Opus 5.5 có bị âm thầm "nerf" sau khi ra mắt?

Trong nhiều tháng, cộng đồng người dùng AI liên tục đặt câu hỏi: liệu các mô hình tiên tiến như Claude có bị "nerf" — tức suy giảm năng lực một cách âm thầm — sau vài ngày hay vài tuần kể từ khi ra mắt? Câu hỏi tưởng chừng đơn giản này lại chưa từng có lời giải rõ ràng vì thiếu một mốc so sánh đáng tin ngay từ ngày đầu tiên.

Một dự án mã nguồn mở mang tên livenerf do lập trình viên ninjahawk khởi xướng đang cố gắng trả lời câu hỏi đó bằng dữ liệu, thay vì những cuộc tranh luận dựa trên cảm giác.

Vấn đề: "Nerf" là gì và tại sao khó chứng minh?

Khi người dùng phàn nàn rằng mô hình "hôm nay trả lời ngu hơn hôm qua", nguyên nhân có thể rất đa dạng:

  • Lượng tử hóa (quantization) mạnh hơn để tiết kiệm chi phí hạ tầng
  • Thay thế bằng mô hình nhỏ hơn nhưng vẫn giữ nguyên tên gọi
  • Giảm mức độ tính toán (lower effort) cho quá trình suy luận
  • Thay đổi định tuyến (routing) giữa các cụm máy chủ
  • Hoặc đơn giản là... không có gì thay đổi, và người dùng đang nhận diện quy luật từ nhiễu ngẫu nhiên

Không ai có một đường cơ sở (baseline) sạch được thiết lập ngay ngày ra mắt, nên mọi cuộc tranh luận đều kết thúc bằng "cảm giác đối đầu cảm giác".

Badge mô hình Claude Opus 5.5Badge mô hình Claude Opus 5.5

livenerf hoạt động như thế nào?

Claude Opus 5.5 ra mắt ngày 22/09/2026, và livenerf bắt đầu tính giờ ngay từ ngày hôm đó. Điểm mấu chốt của phương pháp là: bạn không thể làm cho các mô hình này có tính xác định (deterministic) — tham số lấy mẫu đã bị loại bỏ và không thể tắt chế độ suy nghĩ. Vì vậy, livenerf cố định mọi thứ còn lại:

  • Prompt đóng băng (frozen prompts)
  • Phiên bản CLI được ghim cứng (pinned CLI)
  • Bộ chấm điểm chính xác tuyệt đối (exact graders)
  • Nhật ký thô lưu vĩnh viễn

Sau đó dự án đo độ trôi dạt (drift) bằng phương pháp thống kê trên hàng nghìn mẫu. Công cụ này được xây dựng trên Inspect — khung đánh giá mã nguồn mở của Viện An toàn AI Vương quốc Anh (UK AI Security Institute) — và áp dụng phương pháp thống kê từ bài báo "Adding Error Bars to Evals" của chính Anthropic, nên không có công thức "tự chế" nào để tranh cãi.

Bảng đánh giá được tuyển chọn kỹ lưỡng

Dự án đã sàng lọc 2.336 câu hỏi từ GPQA Diamond, MMLU-Pro, toán thi đấu và AIME 2025–26, mỗi câu chạy 4 mẫu. Kết quả đáng chú ý:

  • Opus 5.5 trả lời đúng ngay lần đầu khoảng 93%
  • 97% câu hỏi luôn đúng hoặc luôn sai — không mang lại thông tin hữu ích
  • Chỉ 78 câu hỏi đôi khi đúng, đôi khi sai, và chúng tạo thành bảng đánh giá chính thức

Ý tưởng cốt lõi rất thông minh: một câu hỏi mà mô hình luôn trả lời đúng thì không thể cho thấy sự sụt giảm. Chỉ những câu hỏi nằm trong vùng "đôi khi đúng" mới thực sự mang lại tín hiệu về sự thay đổi năng lực.

Phát hiện đáng chú ý: Token là chỉ dấu sớm

Một trong những phát hiện thú vị nhất từ giai đoạn kiểm định (validation) là mức độ suy luận (effort) thể hiện rõ hơn nhiều qua số token đầu ra so với độ chính xác:

  • Effort thấp: giảm 62% token đầu ra, nhưng độ chính xác chỉ giảm 8,3 ± 4,5 điểm
  • Effort trung bình: giảm 26% token, độ chính xác giảm 4,2 ± 3,9 điểm

Điều này có nghĩa: nếu một mô hình âm thầm "suy nghĩ ít hơn", số token đầu ra thường là nơi phát hiện ra đầu tiên — trước cả khi độ chính xác thay đổi đủ để nhận thấy.

"Nếu một mô hình âm thầm bắt đầu suy nghĩ ít hơn, đây là nơi nó xuất hiện đầu tiên, thường là trước khi độ chính xác dịch chuyển."

Badge khung đánh giá Inspect AIBadge khung đánh giá Inspect AI

Quy tắc ra quyết định được đăng ký trước

Điểm làm nên uy tín của livenerf nằm ở tính đăng ký trước (pre-registration). Trước khi thu thập bất kỳ dữ liệu chuỗi nào, tệp PREREGISTRATION.md đã được commit công khai. Một thay đổi chỉ được gọi là "thay đổi" nếu thỏa mãn đồng thời ba điều kiện:

  1. Khoảng tin cậy 99% loại trừ giá trị 0 trong hai cửa sổ 10 ngày liên tiếp
  2. Hiệu ứng tối thiểu 3 điểm
  3. Nhánh đối chứng (control arm) không cho thấy cùng mức dịch chuyển

Nhánh đối chứng ở đây là một mô hình khác (claude-opus-5) chạy cùng bộ câu hỏi GPQA qua cùng khung đánh giá mỗi ngày. Nếu cả hai mô hình cùng dịch chuyển, thì đó là do hạ tầng hoặc nền tảng thay đổi, chứ không phải Opus 5.5 bị nerf.

Dự án cũng nhấn mạnh rằng kết quả rỗng (null result) và cả kết quả cải thiện đều được công bố như nhau — không có chuyện chỉ báo cáo tin xấu.

Giới hạn cần lưu ý

livenerf không phải là công cụ vạn năng. Chính tác giả thừa nhận một số hạn chế quan trọng:

  • Không phát hiện được việc hoán đổi mô hình cùng dòng: Việc thay Opus 5 vào chỗ Opus 5.5 không thể phân biệt được ở mức tin cậy 99%. Công cụ này không đủ nhạy để phát hiện kiểu hoán đổi đó.
  • Đo mô hình qua Claude Code trên gói đăng ký, không phải qua API thô. Đây chính là điểm mà hầu hết các báo cáo "nerf" thực sự hướng tới.
  • Tuần ra mắt không phải là chân lý: Tuần đầu tiên có thể dễ là tuần tệ nhất do hạ tầng mới, quá tải, hoặc lỗi ra mắt. Các sự cố chất lượng năm 2025 hóa ra là lỗi hạ tầng, không phải hạ cấp có chủ đích.
  • Bộ câu hỏi có vấn đề: Kiểm tra cho thấy 8 đáp án có vẻ sai và 30 câu hỏi mơ hồ — điều dễ hiểu với những câu mà một mô hình mạnh chỉ đôi khi trả lời đúng.

Trạng thái hiện tại và ý nghĩa với cộng đồng

Tính đến ngày 29/09/2026, dự án đã thu thập được 6 trong 30 ngày (6/10 ngày cơ sở), không bỏ lỡ ngày nào. Mỗi ngày chạy đủ 90 mẫu trên cùng một mã băm khung đánh giá và cùng phiên bản CLI được ghim. Kết quả chính thức đầu tiên sẽ có sau ngày thứ 20.

Đối với cộng đồng công nghệ và những người theo dõi AI tại Việt Nam — nơi ngày càng nhiều doanh nghiệp và lập trình viên phụ thuộc vào các mô hình tiên tiến cho công việc hàng ngày — livenerf mang lại một bài học quan trọng: những tranh luận về chất lượng mô hình cần được giải quyết bằng dữ liệu có thể kiểm chứng, chứ không phải bằng cảm nhận.

Cách tiếp cận của livenerf — đăng ký trước, dữ liệu thô công khai, bộ chấm điểm là hàm thuần túy (không dùng LLM làm giám khảo vì giám khảo cũng sẽ trôi dạt), và nhánh đối chứng — là một hình mẫu đáng học hỏi cho bất kỳ ai muốn đánh giá mô hình AI một cách nghiêm túc.

Badge ngày bắt đầu dự ánBadge ngày bắt đầu dự án

Lời kết

livenerf không hứa hẹn sẽ đưa ra câu trả lời dứt khoát ngay lập tức. Nhưng bằng cách thiết lập một đường cơ sở sạch ngay ngày ra mắt, cố định mọi biến số có thể kiểm soát, và cam kết đăng ký trước quy tắc ra quyết định, dự án này đang biến cuộc tranh luận "mô hình có bị nerf không?" từ chỗ dựa vào cảm giác thành một câu hỏi có thể trả lời bằng toán học.

Như chính tác giả viết: "Bạn không nên phải tin tưởng tác giả, dù là con người hay AI." Đó có lẽ là nguyên tắc đáng giá nhất mà bất kỳ dự án đánh giá nào cũng nên tuân theo.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗