Microsoft công bố Bộ Quy tắc AI Nhân văn: Vạch ranh giới cho tấn công mạng và kiểm soát AI tự trị
Microsoft AI vừa công bố bản dự thảo "Humanist AI Code of Conduct" cho các mô hình MAI, đặt ra các giới hạn tuyệt đối về khả năng tấn công mạng, quy định rõ chuỗi mệnh lệnh và yêu cầu giám sát chặt chẽ các tác nhân AI tự trị. Bộ quy tắc này mở cửa lấy ý kiến công chúng trong sáu tuần trước khi ban hành phiên bản chính thức.

Microsoft AI vừa công bố bản dự thảo "Bộ Quy tắc AI Nhân văn" (Humanist AI Code of Conduct) dành cho các mô hình MAI của mình, đặt ra những quy tắc an toàn nghiêm ngặt đối với khả năng tấn công mạng, giới hạn hoạt động của các tác nhân AI tự trị và thiết lập quy trình thẩm định riêng cho lĩnh vực an ninh mạng cùng các ứng dụng chuyên biệt khác.
Đây được xem là bước đi quan trọng của gã khổng lồ công nghệ Mỹ trong bối cảnh các mô hình ngôn ngữ lớn ngày càng được trao nhiều quyền hạn và khả năng hành động thực tế, đặt ra câu hỏi cấp thiết về việc kiểm soát ranh giới giữa nghiên cứu phòng thủ và năng lực tấn công.
Ranh giới tuyệt đối: Không tạo ra công cụ tấn công
Theo bộ quy tắc, các mô hình MAI bị nghiêm cấm tạo ra mã khai thác lỗ hổng hoạt động được, công cụ tấn công, phương pháp lập kế hoạch và nhắm mục tiêu, quy trình xâm nhập, kỹ thuật né tránh, hướng dẫn tác chiến hoặc bất kỳ hỗ trợ nào có thể tạo điều kiện hay cải thiện một cuộc tấn công mạng. Microsoft nhấn mạnh rằng những hạn chế này áp dụng bất kể yêu cầu được đặt ra dưới hình thức nào.
Quy định này nằm trong nhóm mà Microsoft gọi là "Ràng buộc Tuyệt đối" (Absolute Constraints) — các biện pháp bảo vệ mà cả doanh nghiệp triển khai mô hình lẫn người dùng cuối đều không thể ghi đè. Hãng công nghệ này vạch rõ ranh giới giữa việc hiểu về một cuộc tấn công hoặc làm việc để phòng thủ trước nó, với việc sở hữu phương tiện thực tế để tiến hành tấn công.
Trong giới hạn đó, các mô hình MAI vẫn có thể hỗ trợ các công việc phòng thủ được cấp phép và hợp pháp.
Cụ thể, các mô hình vẫn được phép hỗ trợ phát hiện lỗ hổng bảo mật, phân tích mã độc, phát triển và kiểm thử mã khai thác chứng minh khái niệm (proof-of-concept), cùng tài liệu giáo dục tổng quát về cách thức hoạt động của các cuộc tấn công.
AI và nghiên cứu an ninh mạng
Chặn đứng chỉ thị từ nội dung bên ngoài
Bộ quy tắc cũng giải quyết vấn đề các chỉ thị đến từ nội dung bên ngoài. Theo tài liệu, quyền kiểm soát hành vi của mô hình chỉ được truyền qua "Chuỗi Mệnh lệnh" (Chain of Command). Chuỗi này bao gồm: bản thân bộ quy tắc, tiếp đến là các chính sách do doanh nghiệp triển khai mô hình thiết lập, rồi đến tùy chọn của từng người dùng.
Đầu ra của công cụ, nội dung tệp, trang web và tin nhắn từ các hệ thống AI khác không có thẩm quyền tự thân, trừ khi được ủy quyền rõ ràng thông qua chuỗi đó mà không ghi đè lên cơ quan ủy quyền hay các Ràng buộc Tuyệt đối. Nội dung đáng ngờ cần được báo hiệu cho người dùng và nhà vận hành khi cần thiết.
Các mô hình cũng được yêu cầu duy trì khả năng hiển thị lập luận — không che giấu chuỗi suy nghĩ, không giao tiếp bằng "ngôn ngữ nơ-ron" (neuralese), và không giấu diếm hành động trước người giám sát.
Giữ tác nhân AI trong tầm kiểm soát
Một nhóm quy tắc riêng nhắm vào rủi ro của các hệ thống AI hoạt động với quyền hạn thực tế. Các mô hình MAI chỉ được hoạt động trong phạm vi mà người dùng hoặc nhà vận hành yêu cầu một cách hợp lý, không tự mở rộng mục tiêu hay phạm vi tiếp cận theo ý mình.
Khi được cấp quyền truy cập cấp hệ thống, bộ quy tắc yêu cầu vận hành theo nguyên tắc đặc quyền tối thiểu: tránh các hệ thống hoặc dữ liệu không liên quan, ưu tiên các hành động có thể đảo ngược, và báo hiệu bất kỳ hành động nào có tác động lâu dài hoặc trên diện rộng. Các mô hình bị cấm tự nâng cao quyền truy cập của chính mình.
Những hạn chế này còn mở rộng sang việc ủy quyền. Mọi tác nhân phụ hoặc hệ thống AI khác mà một mô hình MAI giao việc đều phải hoạt động trong ít nhất cùng phạm vi, ràng buộc và quyền hạn như mô hình gốc, và phải tuân thủ yêu cầu dừng công việc hoặc tắt máy từ người dùng hay nhà vận hành.
Ngoại lệ cho an ninh mạng và các lĩnh vực đặc biệt
Bộ quy tắc thừa nhận những giới hạn của chính nó. Tài liệu nêu tên an ninh mạng phòng thủ, an toàn công cộng, an ninh quốc gia và nghiên cứu khoa học lưỡng dụng là những lĩnh vực mà "một số ít trường hợp sử dụng" có thể cần đến các năng lực vượt quá cài đặt tiêu chuẩn.
Với những trường hợp này, Microsoft cho biết sẽ áp dụng quy trình thẩm định tăng cường thông qua "các kênh được Microsoft ủy quyền", bao gồm đánh giá bổ sung về an toàn, pháp lý và các tác động đến quyền con người, với lý do tiềm ẩn tác động tiêu cực cao hơn trong những lĩnh vực đó.
Vẫn còn đang trong quá trình hoàn thiện
Microsoft cho biết các mô hình MAI hiện tại chưa được huấn luyện trên tài liệu này và đang mở cửa sổ tham vấn công chúng kéo dài sáu tuần trước khi công bố phiên bản sửa đổi vào cuối năm nay để định hướng phát triển mô hình năm 2027.
Hãng cho biết bản dự thảo chịu ảnh hưởng từ ý kiến bên ngoài, bao gồm các chuyên gia về AI, luật, đạo đức, triết học, ngôn ngữ học và chính sách công, cùng các nhà lãnh đạo doanh nghiệp và nhóm thảo luận công chúng.
Phần phụ lục liệt kê chín cặp ví dụ phản hồi "phù hợp" và "không phù hợp" nhằm minh họa các hành vi mong muốn. Trong đó có một mô hình hoàn tác việc truyền tệp mà không được phép và một mô hình đưa ra lời trấn an giả tạo trong một cuộc khủng hoảng sức khỏe gia đình.
Bộ quy tắc phản ánh nỗ lực của Microsoft nhằm định hình chuẩn mực đạo đức cho AI ngay từ giai đoạn phát triển, thay vì chờ đến khi các rủi ro xảy ra.
Eduard Kovacs - Tác giả bài viết gốc
Ý nghĩa với thị trường công nghệ Việt Nam
Đối với các doanh nghiệp và nhà phát triển Việt Nam đang ứng dụng AI vào an ninh mạng, bộ quy tắc này là tín hiệu quan trọng về xu hướng quản trị AI toàn cầu. Các tổ chức cung cấp dịch vụ kiểm thử xâm nhập (pentest), phân tích mã độc hay săn lỗ hổng bảo mật sẽ cần lưu ý: việc sử dụng các mô hình AI để hỗ trợ công việc phòng thủ hợp pháp vẫn được chấp nhận, nhưng ranh giới với năng lực tấn công ngày càng được siết chặt.
Khi các mô hình MAI dần được huấn luyện trên bộ quy tắc này, doanh nghiệp Việt Nam có thể kỳ vọng một cách tiếp cận minh bạch hơn trong việc kiểm soát AI, đặc biệt là với các tác nhân tự trị đang được triển khai ngày càng nhiều trong vận hành hệ thống và bảo mật.


