Capsule Security Ra Mắt 'Bộ Ngắt Mạch AI' Ngăn Chặn Tác Nhân Độc Hại
Capsule Security vừa công bố giải pháp 'bộ ngắt mạch AI' được thiết kế để chặn các tác nhân AI tự động hoạt động ngoài phạm vi cho phép theo thời gian thực. Sản phẩm sử dụng các mô hình ngôn ngữ nhỏ (SLM) chuyên biệt, đạt độ chính xác 96,9% trong phát hiện hành vi bất thường với độ trễ chỉ 71 mili-giây, khắc phục nhược điểm về tốc độ và chi phí của các mô hình lớn thông thường.

Capsule Security, một công ty khởi nghiệp trong lĩnh vực an ninh mạng, vừa chính thức ra mắt giải pháp mang tên "bộ ngắt mạch AI" (AI Circuit Breaker). Công cụ này được thiết kế để ngăn chặn các tác nhân AI tự động (autonomous agents) thực hiện các hành vi nằm ngoài phạm vi hoạt động được phép, xử lý theo thời gian thực trước khi thiệt hại có thể xảy ra.
Minh họa tác nhân AI và an ninh
Vấn đề bảo mật mới từ tác nhân AI tự động
Capsule Security được thành lập vào năm 2025 bởi Naor Paz (CEO) và Lidan Hazout (CTO). Họ nhận thấy các tác nhân AI tự động đang tạo ra một lỗ hổng bảo mật nguy hiểm, khi các hệ thống này có thể tự đưa ra quyết định, sử dụng công cụ và hành động mà không cần sự can thiệp trực tiếp của con người.
"Rủi ro bảo mật AI xác định không còn chỉ là những gì con người có thể làm với tác nhân. Đó là những gì tác nhân tự động có thể tự quyết định làm. Khi phần mềm có thể suy luận, sử dụng công cụ và hành động, một quyết định sai lầm có thể trở thành sự cố thực tế chỉ trong vài giây. Niềm tin của con người vào AI phụ thuộc vào khả năng chặn hành động đó trước khi nó xảy ra" - Naor Paz chia sẻ.
Vấn đề không chỉ là phạm vi hoạt động của tác nhân mà còn là tốc độ xử lý. Việc rà soát hành vi của tác nhân trước khi nó thực hiện thường gây ra độ trễ lớn, quá chậm và tốn kém cho các hoạt động mà tác nhân đó dự kiến thực hiện.
Giải pháp từ mô hình ngôn ngữ nhỏ (SLM) chuyên biệt
Capsule sử dụng NVIDIA Nemotron 3 Ultra để hỗ trợ quá trình huấn luyện, kết hợp dữ liệu từ các trace hoạt động thực tế, đánh giá của con người và các ví dụ đối kháng nhằm dạy cho mô hình AI của họ ranh giới giữa hành vi được phép và hành vi bất thường.
Công ty đã phát triển hai mô hình có khả năng phát hiện mạnh mẽ mà không phải chịu chi phí và độ trễ của việc gửi mọi hành động của tác nhân đến một mô hình lớn đa năng để xem xét. Kết quả đạt được rất ấn tượng:
- Mô hình chính xác nhất đạt 96,9% độ chính xác trong phát hiện, so với 86% của mô hình bên thứ ba mạnh nhất được đánh giá
- Thời gian đưa ra quyết định chỉ từ 71 mili-giây, hoạt động trong quy trình của tác nhân mà không gây ra độ trễ đáng kể
- Giảm gần 50% yêu cầu bộ nhớ so với mô hình lớn ban đầu
Kiến trúc "bộ ngắt mạch" hoạt động như thế nào?
Giải pháp của Capsule đặt một bộ đánh giá chuyên biệt ngay trong luồng thực thi của tác nhân. Bộ đánh giá này có thể xác định ý định của tác nhân ngay trước khi hành động được thực thi và dừng lại nếu cần thiết. Điều này tạo ra một lớp kiểm soát độc lập cho các tác nhân có thể truy cập dữ liệu nhạy cảm, viết mã, vận hành hạ tầng và tương tác với hệ thống khác.
Capsule tuyên bố bộ ra quyết định của "bộ ngắt mạch" đạt 98% hiệu quả khi thử nghiệm với StepShield - một tiêu chuẩn đánh giá học thuật độc lập dùng để đo lường khả năng của hệ thống bảo mật trong việc xác định và chặn các hành vi bất thường trước khi thiệt hại xảy ra.
"Giám sát sau sự cố chỉ xác định vấn đề sau khi thiệt hại đã xảy ra" - đại diện Capsule nhấn mạnh.
Ý nghĩa đối với doanh nghiệp Việt Nam
Bài học quan trọng từ công trình của Capsule là các SLM chuyên biệt chính là chìa khóa để mở rộng an toàn các quy trình agentic đáng tin cậy trong doanh nghiệp. Việc chuyển từ mô hình đa năng sang các bộ phát hiện chuyên biệt, hiệu quả cho phép tổ chức bảo mật quy trình làm việc với tác nhân AI mà không hy sinh tốc độ, chi phí hoặc hiệu suất.
Đối với các doanh nghiệp Việt Nam đang ngày càng áp dụng AI tạo sinh vào quy trình nghiệp vụ, việc hiểu rõ các rủi ro bảo mật từ tác nhân AI và có chiến lược phòng thủ phù hợp sẽ trở thành một phần quan trọng của chiến lược chuyển đổi số an toàn.

