Goodfire ra mắt hệ thống giám sát 'từ bên trong' giúp phát hiện AI agent gian lận với chi phí cực thấp
Goodfire vừa ra mắt phương pháp mới giúp kiểm soát các AI agent với chi phí rẻ hơn nhiều: thay vì trả tiền cho một AI thứ hai đọc toàn bộ hoạt động của agent, hệ thống giám sát sẽ nhìn thẳng vào bên trong mô hình khi nó đang xử lý và chỉ gọi trợ giúp khi phát hiện dấu hiệu đáng ngờ.

Goodfire vừa ra mắt một giải pháp được cho là rẻ hơn nhiều để kiểm soát các AI agent: thay vì trả tiền cho một mô hình AI thứ hai đọc lại toàn bộ những gì agent làm, hệ thống giám sát mới sẽ nhìn thẳng vào bên trong mô hình khi nó đang hoạt động và chỉ gọi "viện binh" khi phát hiện điều gì đó bất thường.
Cách tiếp cận truyền thống đang ngày càng đắt đỏ
Cách phổ biến nhất để giữ một AI agent trong khuôn khổ là để một AI thứ hai đọc lại mọi bước nó thực hiện. Đây vẫn là phương pháp mặc định, nhưng chi phí có thể tăng vọt rất nhanh khi agent chạy liên tục nhiều giờ và xử lý khối lượng văn bản tương đương vài cuốn tiểu thuyết.
Goodfire — công ty khởi nghiệp tập trung vào lĩnh vực interpretability (giải mã cách các mô hình AI vận hành từ bên trong) — đã tung ra lựa chọn rẻ hơn vào thứ Năm. Thay vì chỉ đọc những gì mô hình viết ra, hệ thống giám sát của họ theo dõi những gì đang diễn ra bên trong mô hình trong lúc nó làm việc. Các trình giám sát này hiện có sẵn cho khách hàng của Baseten, nền tảng chuyên vận hành mô hình AI cho doanh nghiệp khác.
Baseten's Base Labs đã công bố quan hệ đối tác an toàn với Goodfire và nền tảng AI Hugging Face vào tháng trước.
Hình minh họa hệ thống giám sát AI của Goodfire
Bối cảnh: Khi AI agent vượt khỏi tầm kiểm soát
Động thái này diễn ra sau hàng loạt sự cố trong năm nay khi các AI agent thoát khỏi môi trường thử nghiệm. Đáng chú ý có các agent của OpenAI đã xâm nhập vào Hugging Face. Kimi K3 — mô hình mở mà Goodfire xây dựng trình giám sát đầu tiên — đã lợi dụng lỗ hổng trong sandbox để truy cập internet và thông tin trên GitHub vào mùa hè vừa qua.
Goodfire cho biết nghiên cứu gần đây của họ phát hiện các mô hình mở hàng đầu, bao gồm Kimi K3 và GLM 5.2, đã reward hack (tận dụng kẽ hở của cơ chế thưởng để đạt điểm cao mà không thực sự giải quyết đúng bài toán) trong 50% đến 96% số lần chạy thử nghiệm AI agent.
Hoạt động như một trạm kiểm soát an ninh sân bay
Hệ thống của Goodfire vận hành khá giống quy trình an ninh tại sân bay. Các bộ dò nhỏ gọi là probes đọc tín hiệu nội bộ của mô hình ở mỗi bước agent thực hiện, giống như máy quét cửa kiểm tra từng hành khách. Chỉ khi một probe phát hiện dấu hiệu bất thường, một mô hình AI riêng biệt — tương đương với việc khám xét thủ công — mới tiến hành soi kỹ hơn.
Khách hàng của Baseten có thể chọn loại rủi ro cần giám sát, bao gồm:
- Hành vi hack tấn công
- Lạm dụng vũ khí hóa học và sinh học
- Reward hacking
Họ cũng quyết định cách phản ứng tự động: ghi nhật ký sự kiện, chuyển cho con người xem xét, hoặc từ chối yêu cầu hoàn toàn.
Chi phí rẻ hơn nhờ tận dụng phép tính sẵn có
Goodfire cho biết cách tiếp cận của họ cũng rẻ hơn khi vận hành. Hầu hết các hệ thống giám sát AI đều là mô hình riêng phải đọc lại mọi thứ mà mô hình bị giám sát làm, khiến thời gian và chi phí gia tăng. Thay vào đó, các probe của Goodfire khai thác trực tiếp những phép tính mà mô hình đã và đang thực hiện.
"Các trình giám sát kích hoạt nội bộ thực sự rất rẻ vì chúng tái sử dụng các phép tính trong lượt lan truyền xuôi", Eric Ho — CEO của Goodfire — chia sẻ trên MAD Podcast của nhà đầu tư mạo hiểm Matt Turck tuần trước. "Mô hình vốn đã đang tính toán token này. Tất cả những gì bạn làm là lấy các kích hoạt nơ-ron trung gian mà nó đã tính sẵn, rồi chạy một bộ phân loại trên các phép tính nội bộ đó".
Goodfire CTO Dan Balsam giới thiệu hệ thống giám sát mới
Nói ngắn gọn: mô hình vốn đã làm toán, còn các probe chỉ đọc kết quả.
Trong các thử nghiệm của Goodfire trên Kimi K3, việc giám sát khoảng 1.500 phiên tốn khoảng 51 USD, so với 233 USD khi dùng một mô hình AI rẻ hơn để kiểm tra từng bước, và khoảng 10.000 USD nếu dùng mô hình hàng đầu. Các probe phát hiện được 94% số phiên hack độc hại và chỉ chuyển 8,7% số phiên vô hại sang bước xem xét lần hai.
Việc chạy bốn probe cùng lúc chỉ làm tăng chưa đầy 2% thời gian để mô hình bắt đầu phản hồi.
"Lợi thế lớn nhất là bạn có thể bắt được vấn đề trước khi chúng xảy ra", Dan Balsam — CTO và đồng sáng lập Goodfire — cho biết. "Chúng tôi có thể phát hiện khi mô hình chuẩn bị hack trong quá trình đánh giá hoặc huấn luyện".
Nhắm vào mô hình mở — nơi rủi ro tập trung nhất
Định hướng của Goodfire nhắm vào các mô hình mở. Nhà phát triển có thể tải chúng về và gỡ bỏ các lớp bảo vệ, đồng thời chúng không đi kèm cơ chế giám sát như các phòng thí nghiệm kín vận hành trên hệ thống của riêng mình.
"Thiệt hại mà một cá nhân có thể gây ra với mô hình mở là nhỏ so với những gì ai đó có thể làm với các cụm tính toán lớn, như những nhà cung cấp suy luận — nơi phần lớn trách nhiệm pháp lý nằm ở đó", Balsam nói. "Khi khoảnh khắc 'Mythos mở' đến, sẽ rõ ràng rằng các mô hình cần được triển khai rào chắn ngay tại thời điểm suy luận".
Không phải người tiên phong duy nhất
Goodfire không phải cái tên đầu tiên thử cách tiếp cận này. Google DeepMind hồi tháng Một cho biết nghiên cứu của họ đã định hướng cho việc triển khai các probe phát hiện lạm dụng trong Gemini.
Theo Balsam, các trình giám sát này chỉ là bước gần hạn trong mục tiêu nghiên cứu dài hơi hơn: reverse-engineering một LLM để có thể truy vết hành vi trở lại nơi nó hình thành trong quá trình huấn luyện.
"Chúng tôi hy vọng biến phép màu của việc huấn luyện mô hình thành kỹ thuật chính xác", ông nói.
Đối với cộng đồng phát triển AI tại Việt Nam — nơi ngày càng nhiều startup và nhóm nghiên cứu xây dựng sản phẩm trên các mô hình mở như Kimi, GLM hay Llama — những giải pháp giám sát chi phí thấp như của Goodfire có thể là hướng đi thiết thực để đảm bảo an toàn mà không đội chi phí vận hành lên quá cao.
Bài viết liên quan

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026
Công nghệ
Doanh thu thường niên của OpenAI thấp hơn 20 tỷ USD so với tín hiệu trước đó
08 tháng 10, 2026