Abliteration.ai: Dịch vụ 'gỡ bỏ rào cản' của mô hình AI gây tranh cãi
Abliteration.ai biến kỹ thuật abliteration — vốn chỉ là hoạt động ngầm trong cộng đồng mã nguồn mở — thành dịch vụ thương mại, giúp người dùng dễ dàng truy cập các mô hình AI mạnh như GLM-5.3 mà không còn lớp bảo vệ an toàn. Startup này lập luận rằng việc cung cấp công cụ cho 'bên phòng thủ' sẽ giúp tăng cường an ninh mạng, nhưng các chuyên gia an toàn AI cảnh báo nguy cơ lạm dụng để tạo mã độc hoặc hướng dẫn chế tạo vũ khí sinh học.

Abliteration.ai: Biến việc 'vô hiệu hóa an toàn AI' thành một ngành kinh doanh gây tranh cãi
Việc truy cập vào một trong những mô hình AI mã nguồn mở mạnh nhất thế giới, nhưng không có bất kỳ lớp bảo vệ hay từ chối nào, giờ đây trở nên dễ dàng hơn bao giờ hết. Startup có tên Abliteration.ai đã biến một kỹ thuật vốn chỉ tồn tại trong cộng đồng ngầm thành một dịch vụ thương mại, cho phép người dùng chạy các mô hình như GLM-5.3 của Z.ai trong chế độ 'không kiểm duyệt'.
Công ty tuyên bố mục tiêu là hỗ trợ các hoạt động tấn công mạng chủ động (offensive cyber), red-teaming và kiểm tra hệ thống đại lý AI mà các mô hình thông thường từ chối thực hiện.
Logic phòng thủ hay con dao hai lưỡi?
Lập luận của Abliteration.ai dựa trên một nguyên tắc quen thuộc trong an ninh mạng: bạn không thể bảo vệ hệ thống trước một hành vi mà bạn không thể tái tạo. Nếu mô hình AI từ chối viết mã khai thác lỗ hổng, đội ngũ phòng thủ sẽ khó lòng chuẩn bị phương án đối phó.
“Ưu điểm là giờ đây những người bảo vệ có thể phản ứng nhanh nhất có thể. Họ có mọi công cụ cần thiết để mô hình hóa các tác nhân xấu và chống lại chúng,” Devon, đồng sáng lập Abliteration.ai, chia sẻ.
Tuy nhiên, việc bóc bỏ lớp bảo vệ này cũng mở ra cánh cửa cho những mục đích nguy hiểm. Trong bài kiểm tra của TechCrunch, phiên bản GLM-5.3 đã được 'bào mòn' này sẵn sàng viết một chương trình Python đánh cắp mật khẩu Chrome đã lưu, hay thậm chí cung cấp quy trình chi tiết để nuôi cấy mầm bệnh nguy hiểm tại nhà.
Demo kiểm thử mô hình AI đã bị gỡ bỏ an toàn
Kỹ thuật không mới, nhưng mô hình kinh doanh thì có
Abliteration là một kỹ thuật đã tồn tại lâu trong cộng đồng mã nguồn mở. Hàng nghìn mô hình đã bị xử lý theo cách này trên Hugging Face. Nhưng thay vì phải tự tải mô hình về và trang bị hạ tầng tính toán, giờ đây ai cũng có thể truy cập qua trình duyệt hoặc API.
Được thành lập cuối năm ngoái và chính thức đăng ký vào tháng 3, Abliteration.ai đã giảm thiểu rào cản kỹ thuật cho người dùng, đồng thời tạo ra một doanh nghiệp có doanh thu. Theo Devon, startup này đang có hợp đồng với nhiều nhà cung cấp cloud lớn và tự trang trải chi phí từ doanh thu khách hàng.
Phản ứng của giới an toàn AI: Lằn ranh mong manh
Andrew Yoon, trưởng nhóm nghiên cứu tại tổ chức phi lợi nhuận CivAI, thẳng thắn chỉ trích: “Abliteration cho phép bạn biến mô hình thành một 'kẻ thái nhân cách' về mặt AI.”
- Với phiên bản bị gỡ bỏ an toàn, về cơ bản người dùng có thể nhập bất kỳ yêu cầu nào và mô hình sẽ tuân thủ.
- Yoon dự đoán rằng các mô hình bị chỉnh sửa này sẽ sớm bị dùng cho mục đích xấu trong tương lai gần.
Tuy nhiên, phần lớn chuyên gia TechCrunch trao đổi đều cho rằng không thể ngăn chặn thực trạng này. Họ đề xuất các biện pháp can thiệp khác: chính phủ nên yêu cầu nhà cung cấp triển khai hệ thống phân loại để chặn các hoạt động tấn công mạng và vũ khí sinh học, đồng thời các công ty cho thuê GPU phải xác minh danh tính khách hàng.
Lớp 'kiểm duyệt nhẹ' của Abliteration.ai
Abliteration.ai có cung cấp một lớp kiểm duyệt tùy chọn cho khách hàng. Trong thử nghiệm, TechCrunch không thể khiến mô hình đưa ra hướng dẫn tự sát. Devon cho biết anh đang nỗ lực tích hợp thêm các biện pháp ngăn chặn bạo lực.
Tuy vậy, công ty chưa áp dụng quy trình KYC nào ngoài việc ghi nhận thẻ tín dụng khi mua dịch vụ. Devon thừa nhận: "Bạn không muốn trở thành người chịu trách nhiệm nếu ai đó làm điều tồi tệ. Vậy ranh giới trách nhiệm của doanh nghiệp nằm ở đâu? Chúng tôi vẫn đang xác định điều đó."
Người trong cuộc chia rẽ về tính hiệu quả
Dù vậy, giới bảo mật vẫn chưa thống nhất về vai trò của các mô hình này. Một số công ty red-teaming cho rằng họ không dùng mô hình abliterated trong công việc hằng ngày, thay vào đó họ chọn fine-tuning các mô hình mở vốn đã có ít rào cản an toàn.
Ahmed Aly, CEO của Fabraix, nhận định quá trình abliteration làm suy giảm kiến thức và năng lực của mô hình: "Nếu bạn thực sự muốn gây hại — tấn công mạng hay sinh học — mô hình này sẽ không hiệu quả."
David Slater từ Armadin cho rằng với các mô hình mã nguồn mở thế hệ cũ, việc bẻ khóa vốn không khó. Với thế hệ mới, việc nghiên cứu abliteration là cần thiết để hiểu rõ giới hạn năng lực của AI:
“Điều này chắc chắn sẽ xảy ra sau cánh cửa đóng kín. Việc nó diễn ra một cách công khai sẽ cung cấp công cụ cho các nhà nghiên cứu, giúp chúng ta hiểu được ranh giới thực sự của công nghệ và đánh giá được mức độ nguy hại.”
Câu hỏi lớn để ngỏ
Câu chuyện của Abliteration.ai đặt ra một vấn đề mà ngành công nghiệp và chính phủ phải đối mặt: khi ai cũng có thể gỡ bỏ rào cản an toàn của mô hình AI mạnh, việc dân chủ hóa quyền truy cập này sẽ khiến mạng Internet an toàn hơn — hay nguy hiểm hơn?
Với những khách hàng đầu tiên là các startup red-teaming ở Anh và châu Âu, phục vụ ngân hàng, hàng không và hạ tầng trọng yếu, Abliteration.ai đang cố gắng định vị mình ở chiến tuyến 'bảo vệ bằng cách tấn công'. Nhưng ranh giới giữa phòng thủ và tấn công là cực kỳ mong manh — và thị trường AI an toàn sẽ còn tranh cãi gay gắt về cách thiết lập nó trong thời gian tới.