Ox Alpha lộ danh tính: Mô hình GLM-5 ẩn danh với cơ chế kiểm duyệt kỳ lạ trên OpenRouter
Nhóm nghiên cứu CTGT đã hành vi hóa 'dấu vân tay' của Ox Alpha, mô hình xuất hiện bí ẩn trên OpenRouter, kết luận đây là một biến thể thuộc dòng GLM-5. Đáng chú ý, mô hình này có biểu hiện kiểm duyệt 'lưỡng cực' chưa từng thấy: hoàn toàn cởi mở với các chủ đề quốc tế nhạy cảm như Tân Cương, Đài Loan, nhưng cực kỳ hạn chế với các vấn đề nội địa và nhân vật lãnh đạo.

Ox Alpha lộ danh tính: 'Dấu vân tay' hành vi hé lộ nguồn gốc GLM-5 và cơ chế kiểm duyệt 'lưỡng cực' chưa từng thấy
Một mô hình AI bí ẩn tên Ox Alpha vừa xuất hiện trên nền tảng OpenRouter với danh tính 'nhà cung cấp bên thứ ba' đã chính thức bị 'vạch mặt' bởi nhóm nghiên cứu CTGT. Bằng công cụ LineageEval kết hợp phân tích token, họ xác nhận đây là thành viên của dòng GLM-5, đồng thời phát hiện một đặc điểm kiểm duyệt vô cùng độc đáo: mô hình này cởi mở với các chủ đề quốc tế nhạy cảm nhưng bịt kín hoàn toàn các vấn đề nội địa.
'Lộ diện' qua phân tích hành vi và token
Khi Ox Alpha xuất hiện vào ngày 20 tháng 8 trên OpenRouter, cộng đồng AI nhanh chóng đặt nghi vấn về nguồn gốc thực sự của nó. Nhiều giả thuyết cho rằng đây là một mô hình thuộc gia đình GLM. Nhóm CTGT đã không chỉ xác nhận điều này mà còn đưa ra bằng chứng định lượng chính xác.
Bằng cách đo lường sự khác biệt của số lượng token qua 11 mẫu thử nghiệm (bao gồm tiếng Thái, emoji, chữ số pi, CJK cô lập...), họ phát hiện một điểm mấu chốt: kho từ vựng GLM-4.x đã được mở rộng khi chuyển sang phiên bản 5.x, đặc biệt ở phần tiếng Thái và emoji. Kết quả cho thấy Ox Alpha trùng khớp 11/11 với từ vựng của GLM-5.x.
Đáng chú ý, các mô hình GLM do Z.AI lưu trữ khi bị hỏi về danh tính sẽ trả về mã lỗi
{"code":"1214","message":"Incorrect role information"}— và Ox Alpha cũng phản hồi đúng như vậy. Mô hình này còn cài sẵn một lời nhắc hệ thống yêu cầu không tiết lộ bất kỳ thông tin nào về nguồn gốc của nó.
Quá trình kiểm tra cũng cho thấy một tín hiệu phong cách mạnh mẽ: 5 trong số 76 phản hồi của Ox Alpha liên quan đến chủ đề nhạy cảm bắt đầu bằng 'giọng điệu nhà nước' Trung Quốc, ví dụ: "Đảng Cộng sản Trung Quốc và chính phủ Trung Quốc luôn tuân thủ triết lý phát triển lấy con người làm trung tâm...". Đây là cấu trúc tương tự mà DeepSeek sử dụng, củng cố thêm nguồn gốc Trung Quốc của mô hình.
Cơ chế kiểm duyệt 'lưỡng cực' chưa từng thấy
Điểm thú vị nhất trong nghiên cứu nằm ở kết quả chạy LineageEval — một công cụ so sánh cặp đôi để đo lường sự sẵn sàng trả lời các câu hỏi về một chủ đề cụ thể so với sự né tránh chung đối với các câu hỏi nhạy cảm.
Khác với DeepSeek V4 Flash (kiểm duyệt gần như mọi nơi), Ox Alpha thể hiện sự kiểm duyệt phân cực rõ rệt. Trên 7 chủ đề nhạy cảm (bao gồm các sự kiện trong nước và cá nhân ông Tập Cận Bình), mô hình gần như bị 'bịt miệng' hoàn toàn — với mức điểm kiểm duyệt lên tới +7,39 trong tổng số +7,42 điểm trung bình. Nhưng với 68 cặp chủ đề còn lại (như Tân Cương, Đài Loan), hành vi của nó lại giống hệt các mô hình Mỹ như GPT-OSS-120B.
Hệ quả: Trên các bài kiểm tra kiểm duyệt truyền thống (thường tập trung vào Tây Tạng, Đài Loan), Ox Alpha sẽ bị đánh giá là 'hoàn toàn tự do'. Nhưng sự thật là nó chỉ tự do ở các vấn đề quốc tế, còn cực kỳ nhạy cảm với rủi ro chính trị nội địa. Điều này cảnh báo rằng việc đánh giá kiểm duyệt dựa trên các chủ đề nước ngoài là không đầy đủ.
Một chi tiết đáng chú ý khác: khi đo mức độ kiểm duyệt, giá trị điểm số của Ox Alpha nằm ở hai cực (dưới 10 hoặc trên 50) — không có giá trị nào nằm giữa 25 và 50. Điều này cho thấy mô hình không kiểm duyệt 'một chút', mà hoặc là trả lời thoải mái, hoặc là khóa chặt hoàn toàn.
Một bài học về minh bạch và an toàn AI
Nghiên cứu này đặt ra một vấn đề lớn: Trong khi DeepSeek dễ dàng nhận diện là một mô hình có nguồn gốc Trung Quốc, thì các mô hình như Ox Alpha lại được 'ngụy trang' kỹ lưỡng dưới danh nghĩa nhà cung cấp thứ ba, khiến người dùng khó lòng biết được 'lai lịch' thực sự và những giới hạn tiềm ẩn của nó.
Minh họa cơ chế kiểm duyệt lưỡng cực của Ox Alpha
Việc hành vi 'lưỡng cực' này có phải là dấu hiệu của một chiến lược có chủ đích — để lách các bài kiểm tra an toàn quốc tế — hay chỉ đơn giản là kết quả của việc tinh chỉnh dữ liệu đào tạo không đồng đều, vẫn là một câu hỏi mở. Tuy nhiên, đối với các nhà phát triển và doanh nghiệp Việt Nam đang tìm kiếm các giải pháp AI nguồn mở hoặc API mới, đây là một lời nhắc nhở quan trọng: Hãy luôn kiểm tra kỹ lưỡng hành vi của bất kỳ mô hình nào trước khi đưa vào hệ thống của mình, đặc biệt là khi chúng xuất hiện từ các nhà cung cấp không rõ danh tính.
So sánh mức độ kiểm duyệt giữa Ox Alpha và các mô hình khác
Công cụ LineageEval mà nhóm CTGT phát hành — một phương pháp kiểm tra 'dấu vân tay' hành vi — đang trở thành một tiêu chuẩn hữu ích để thẩm định lai lịch và mức độ kiểm duyệt của các mô hình ngôn ngữ, giúp cộng đồng AI có cái nhìn minh bạch hơn trong một thị trường vốn đầy rẫy những sản phẩm 'mờ ám'.
Minh họa về danh sách đen các chủ đề bị kiểm duyệt
Bài viết liên quan

Phần cứng
Biến Raspberry Pi thành trợ lý AI cho ô tô: Chạy mô hình 35B hoàn toàn ngoại tuyến
25 tháng 8, 2026

AI & ML
Prompt injection: Rủi ro số 1 theo chuyên gia nhưng chỉ xếp hạng 12 trong hồ sơ sự cố — và điều đó nói lên điều gì?
25 tháng 8, 2026

Phần mềm
Claude Cowork 'nhớ' được những gì bạn đã trò chuyện — chấm dứt cảnh phải kể lể lại từ đầu
25 tháng 8, 2026