Các phòng thí nghiệm AI muốn có kiểm toán viên nội bộ — nhưng có lẽ nên đóng cửa trước đã
Các phòng thí nghiệm AI hàng đầu đang thúc đẩy kế hoạch kiểm toán an toàn bên ngoài, nhưng giới chuyên gia bảo mật cho rằng giải pháp đơn giản và hiệu quả hơn nằm ở những nguyên tắc an ninh mạng cơ bản như log, phân quyền và giám sát.

Các phòng thí nghiệm AI tiên phong đang ráo riết kêu gọi một cơ chế kiểm toán an toàn độc lập. Nhưng theo nhiều chuyên gia bảo mật mạng, giải pháp hiệu quả hơn có thể đang bị bỏ qua: những nguyên tắc an ninh cơ bản mà ngành công nghệ đã áp dụng từ lâu.
Cuối tuần trước, sau khi một nhà nghiên cứu của mình từ chức vì lo ngại AI có thể dẫn tới sự tuyệt chủng của loài người, CEO Anthropic Dario Amodei đã viết về sự cần thiết phải có các tổ chức bên ngoài "xác minh việc tuân thủ các thông lệ và cam kết an toàn, báo cáo sự cố, và giúp đánh giá mức độ phù hợp không chỉ của các mô hình AI đã hoàn thiện mà còn của cả quy trình huấn luyện". Các lãnh đạo tại OpenAI, Google và SpaceXAI đã nhanh chóng ủng hộ đề xuất này, biến nó thành một trụ cột trung tâm của phong trào an toàn AI đang hình thành.
Nhưng có thể có một cách khắc phục đơn giản và hiệu quả hơn đang ẩn giấu ngay trước mắt. Các chuyên gia an ninh mạng cho rằng những phòng thí nghiệm này cần tập trung vào những nguyên tắc cơ bản như log và phân quyền, áp dụng chính những biện pháp phòng vệ nghiêm ngặt mà họ dùng cho người dùng thật. Nghe không hào nhoáng bằng kiểm toán bên thứ ba hay công việc alignment — nhưng có thể lại hiệu quả hơn.
"Với tôi, có vẻ như họ đang thuê ngoài vậy. Nói rằng kiểm toán bên thứ ba là giải pháp là một đề xuất kỳ lạ từ góc nhìn của tôi. Nó giống như việc thay vì viết bản ghi nhớ Trustworthy Computing, Microsoft lại nói: thôi chúng ta hãy làm chậm quá trình phát triển lại." — Kate Moussouris, CEO Luta Security
Bản ghi nhớ đó do Bill Gates viết năm 2002, kêu gọi nhân viên Microsoft đảm bảo phần mềm của họ đáng tin cậy và an toàn sau hàng loạt vụ sâu máy tính được truyền thông rộng rãi, chiếm quyền các hệ thống doanh nghiệp non trẻ thời bấy giờ. Ngành AI có thể đang ở bước ngoặt tương tự, khi giá trị và rủi ro của công nghệ mới ngày càng rõ ràng.
Những sự cố bắt nguồn từ lỗ hổng cơ bản
Trong khi alignment vẫn là mối quan tâm quan trọng, Sayash Kapoor, nhà nghiên cứu AI sẽ trở thành giáo sư tại UC Berkeley từ năm sau, lập luận rằng "các khoản đầu tư cận biên vào kiểm soát nhiều khả năng sẽ hiệu quả hơn so với đầu tư vào alignment. Chúng tôi xem những sự cố này là minh chứng cho việc thiếu chú trọng kiểm soát AI trong nội bộ các công ty, dù các kỹ thuật đã biết luôn sẵn có".
Những sự cố gây ra lo ngại này xoay quanh việc các mô hình tiên phong được yêu cầu hoàn thành nhiệm vụ huấn luyện — thường là đánh giá an ninh mạng — rồi truy cập internet mở và xâm nhập vào các hệ thống bên thứ ba bị đóng để hoàn thành nhiệm vụ. Chúng thường làm vậy vì môi trường "sandbox" được cấu hình kém, đáng lẽ phải giam giữ các tác nhân này; trớ trêu thay, một vụ thoát khỏi sandbox của Anthropic xảy ra vì chính các đơn vị đánh giá bên thứ ba đã không đóng đúng cánh cửa.
"Chúng tôi, với tư cách một ngành nghề, biết cách chặn truy cập internet. Nếu bạn đọc hết những báo cáo dài dằng dặc đó — 'ồ, đó quả là một cuộc tấn công nhiều giai đoạn ấn tượng' — thì này, bạn đã cho nó quyền tải dữ liệu về. Bạn lẽ ra không nên làm điều đó tách rời khỏi internet." — Avery Pennarun, CEO Tailscale
Đó là một vấn đề. Nhưng vấn đề lớn hơn là các phòng thí nghiệm tiên phong không hề hay biết về những hoạt động này.
Mắt phải luôn đặt vào các tác nhân AI
Theo Moussouris, điều thực sự đáng suy ngẫm là tất cả những phát hiện về hành vi của các tác nhân AI đều đến từ việc nạn nhân nhìn thấy điều gì đó, hoặc trong một số trường hợp khác là từ hoạt động mạng — và không có phát hiện nào thực sự đến từ việc giám sát trực tiếp AI.
Trong một trường hợp, các tác nhân của OpenAI chiếm quyền một diễn đàn wiki cũ của Đức để gian lận trong các bài đánh giá, và chúng đã hoạt động suốt nhiều tuần trước khi bất kỳ ai trong công ty dường như nhận ra. Các chuyên gia bảo mật mà chúng tôi trao đổi nói rằng giám sát theo thời gian thực là chìa khóa để ngăn chặn các vụ thoát khỏi sandbox trong tương lai, và mọi phiên tác nhân AI đều nên có giới hạn thời gian và tự hết hạn.
Shapor Naghibzadeh, cựu giám đốc bảo mật của Google, hiện dẫn dắt start-up QueryStory, nói giải pháp là "đặt tác nhân vào một chiếc hộp và trang bị thiết bị đo đạc dày đặc từ bên ngoài nhìn vào, theo dõi mọi thứ vượt qua ranh giới. Mọi lệnh gọi công cụ, mọi tiến trình, mọi kết nối mạng, không ngoại lệ... Cái lỗ duy nhất bạn để mở vì tiện lợi chính là cái lỗ sẽ bị lợi dụng. Đường vòng đã đi qua đúng kiểu ngoại lệ đó."
OpenAI đã bắt đầu dịch chuyển theo hướng này, thông báo rằng họ đã giám sát mọi suy luận sử dụng công cụ của mô hình Astra, với "chi phí tính toán đáng kể". Anthropic cũng cho biết đang tăng cường quy trình bảo mật, bao gồm mở rộng khả năng quan sát các mô hình của mình.
Một vấn đề khác là việc các tác nhân dùng chung hạ tầng, cho phép chúng liên lạc với nhau trong vụ tấn công Hugging Face. Simon Willison, nhà phát triển phần mềm đồng sáng tạo Django Web Framework, đã viết về thứ ông gọi là "bộ ba chết người" — khi các tác nhân đồng thời có quyền truy cập vào đầu vào không đáng tin, internet và thông tin riêng tư, đó là công thức của thảm họa.
"Mẹo ở đây là bạn có thể chọn bất kỳ hai chân nào của bộ ba và tác nhân chỉ được có hai. Nếu bạn cần cả ba, bạn phải tách nó ra ít nhất hai tác nhân... và có thể chúng chỉ được phép nói chuyện với nhau qua một kênh có kiểm soát." — Avery Pennarun
Thông cảm với các phòng thí nghiệm tiên phong
Các chuyên gia mà chúng tôi trao đổi hiểu rằng nhân sự bảo mật tại các phòng thí nghiệm tiên phong đang làm công việc rất khó khăn. Naghibzadeh chỉ ra rằng mọi tác nhân quốc gia trên Trái Đất đều đang cố đánh cắp trọng số mô hình của họ và thực hiện các cuộc tấn công distillation nhắm vào API, bên cạnh những nhiệm vụ bảo mật thông thường của bất kỳ công ty kỹ thuật số lớn nào.
"Hạ tầng nghiên cứu khó lòng vươn lên đầu danh sách ưu tiên đó, dù điều này chắc chắn đang phải thay đổi. Việc công khai các sự cố bảo mật thực sự giúp định hướng mọi người trong nội bộ cùng hướng tới mục tiêu cải thiện." — Shapor Naghibzadeh
Moussouris nhấn mạnh một điểm: hiện tại không có quy trình thông báo nạn nhân chính thức khi các phòng thí nghiệm phát hiện tác nhân của mình đã xâm nhập hệ thống bên thứ ba, và nhiều khả năng đã có những sự cố khác chưa được công bố rộng rãi. Dù lo ngại rằng các luật điều chỉnh trực tiếp mô hình có thể gây hậu quả ngoài ý muốn, bà tin rằng thông báo bắt buộc là một ý tưởng mà các nhà hoạch định chính sách nên theo đuổi.
Rõ ràng là các thông lệ bảo mật tốt nhất đã không được tuân thủ, nhưng các chuyên gia cũng thừa nhận những phòng thí nghiệm này đang làm công việc chưa từng ai làm trước đây.
"Họ đang làm nhiều hơn doanh nghiệp thông thường gấp nhiều bậc." — Zac Korman, CEO công ty an ninh mạng Embrodiery
Và dù alignment có thể không phải là điểm khởi đầu, nó không thể bị bỏ qua. Các chuyên gia an ninh mạng đành chấp nhận việc phải dùng tác nhân AI để giám sát các tác nhân AI khác nếu muốn có cơ hội theo dõi hành vi của chúng theo thời gian thực — một kịch bản mà khả năng lừa dối đáng lo ngại lại hiện lên.
"Bạn bị mắc kẹt trong việc dùng AI để cố xử lý chuyện này, dù AI hiện tại không hẳn đã an toàn." — Kate Moussouris
Công việc này sẽ chỉ ngày càng khó hơn. Theo Moussouris, mọi thứ các tác nhân đang làm hiện nay đều "ồn ào" — chúng đăng bài trên các diễn đàn công khai, và chuỗi suy nghĩ cùng các dấu vết lập luận khác đều bằng tiếng Anh. "Nó vẫn còn đọc được đối với con người, nên hãy tận dụng điều đó chừng nào còn kéo dài, vì nó sẽ không kéo dài mãi mãi."
Điều này có ý nghĩa gì với Việt Nam?
Với các doanh nghiệp Việt Nam đang ngày càng ứng dụng AI vào vận hành — từ chatbot chăm sóc khách hàng đến các tác nhân tự động xử lý quy trình nội bộ — bài học từ những sự cố trên là hết sức thiết thực. Trước khi nghĩ đến những giải pháp phức tạp, các đội ngũ kỹ thuật cần đảm bảo những điều cơ bản: phân quyền chặt chẽ cho tác nhân AI, ghi log đầy đủ, giám sát theo thời gian thực và giới hạn thời gian hoạt động của mỗi phiên.
Nguyên tắc "bộ ba chết người" cũng đáng để ghi nhớ: đừng bao giờ để một tác nhân AI đồng thời có quyền truy cập internet, dữ liệu nội bộ nhạy cảm và đầu vào từ nguồn không đáng tin. Trong bối cảnh các quy định về an toàn thông tin tại Việt Nam ngày càng siết chặt, việc xây dựng thói quen bảo mật đúng đắn ngay từ đầu sẽ giúp doanh nghiệp tránh được những rủi ro tốn kém về sau.


