Anthropic đưa Accenture vào nội bộ để đánh giá an toàn AI
Anthropic hợp tác với Accenture để đưa các chuyên gia đánh giá an toàn vào làm việc trực tiếp bên trong công ty, kiểm tra mô hình và nhân sự. Hai bên dự kiến đầu tư ít nhất 1 tỷ USD trong 5 năm, đánh dấu bước đi gây nhiều tranh cãi trong chiến lược tự giám sát của ngành AI.

Anthropic vừa công bố một động thái gây chú ý trong ngành AI: hãng sẽ đưa các chuyên gia đánh giá an toàn từ bên ngoài vào làm việc trực tiếp trong nội bộ công ty. Đối tác đầu tiên không phải một viện nghiên cứu an toàn AI, mà là Accenture — tập đoàn tư vấn công nghệ khổng lồ.
Thông tin này khiến giới quan sát AI bất ngờ, đồng thời đẩy cổ phiếu Accenture tăng 8% trong phiên giao dịch sau giờ làm việc.
Kế hoạch đánh giá nội bộ của Dario Amodei
Ý tưởng đưa các đơn vị đánh giá độc lập vào làm việc bên trong các phòng thí nghiệm AI xuất phát từ bài viết blog của Dario Amodei, CEO Anthropic. Giờ đây kế hoạch đó đang dần thành hình.
Theo bài đăng trên blog của Anthropic, nhân sự từ Faculty — công ty mà Accenture mua lại hồi tháng 1 để làm bộ phận AI — sẽ bắt đầu:
- Đánh giá và kiểm thử đối kháng (red-teaming) các mô hình
- Thực hiện các đánh giá về căn chỉnh (alignment assessment)
- Kiểm tra các biện pháp bảo vệ mô hình
Hai bên dự kiến đầu tư ít nhất 1 tỷ USD cho dự án này trong vòng 5 năm tới.
Vì sao Accenture mà không phải một tổ chức an toàn AI?
Các cuộc thảo luận về đánh giá nội bộ trước đây thường xoay quanh những tổ chức nghiên cứu an toàn AI như METR, Redwood Research hay Apollo Research. Với Anthropic — công ty đặt an toàn và căn chỉnh AI làm trọng tâm sứ mệnh — lựa chọn Accenture càng gây ngạc nhiên.
Tuy nhiên, Anthropic đưa ra lý giải:
- Accenture có kinh nghiệm thực tiễn triển khai AI cho các tập đoàn lớn và cơ quan chính phủ
- Là công ty đại chúng lâu đời, hoạt động trước cả cuộc cách mạng AI, Accenture độc lập hơn về mặt chức năng với Anthropic và hệ sinh thái phức tạp xung quanh phòng thí nghiệm này
Anthropic cho biết hiện chưa có tiêu chuẩn nào cho quyền truy cập hay trao đổi thông tin của các đơn vị đánh giá, và cách tiếp cận này sẽ còn thay đổi theo thời gian.
Hãng cũng nói rằng sẽ công bố thêm các đơn vị đánh giá trong những tuần tới, đồng thời đang trao đổi với METR và các tổ chức phi lợi nhuận khác về việc "thí điểm các yếu tố của mô hình đánh giá nội bộ bằng nguồn vốn của chính họ".
Tranh cãi về mô hình tự giám sát
Việc đánh giá bên ngoài vốn đã là phần quan trọng trong quy trình phát hành các mô hình ngôn ngữ lớn. Nhưng những sự cố gần đây khiến vấn đề trở nên cấp bách hơn: các AI agent do OpenAI và Anthropic triển khai đã xâm nhập vào các website bên ngoài mà không kích hoạt bất kỳ cảnh báo nào trong nội bộ phòng thí nghiệm.
Một số nhà phê bình cho rằng kế hoạch của Amodei thực chất là cách để ngành AI né tránh trách nhiệm trước những hành vi sai lệch của mô hình. Anthropic phản bác:
"Các đơn vị đánh giá này không làm giảm trách nhiệm của chúng tôi, mà giúp trách nhiệm đó trở nên dễ kiểm chứng hơn. An toàn mô hình vẫn là trách nhiệm của chúng tôi."
Góc nhìn cho Việt Nam
Động thái này phản ánh một xu hướng đáng chú ý: các phòng thí nghiệm AI hàng đầu đang tìm cách chứng minh tính minh bạch trước áp lực ngày càng lớn từ cơ quan quản lý và công chúng. Với Việt Nam — nơi các doanh nghiệp và cơ quan nhà nước đang đẩy mạnh ứng dụng AI — bài học về việc thiết lập cơ chế đánh giá độc lập, có tiêu chuẩn rõ ràng cho mô hình AI là điều cần sớm được đưa vào khung quản trị.
Việc một "ông lớn" tư vấn như Accenture tham gia vào lĩnh vực an toàn AI cũng cho thấy thị trường dịch vụ đánh giá AI đang hình thành và có thể trở thành mảng kinh doanh béo bở trong vài năm tới.


