Circuit Breaker Labs – 'Người giả thử nghiệm va chạm' giúp AI an toàn hơn cho trẻ em và cả người lớn
Giữa những lo ngại về nguy cơ AI hủy diệt loài người trong tương lai, nhiều người quên rằng AI đã gây tổn hại tâm lý cho con người ngay lúc này. Circuit Breaker Labs tạo ra đội quân 'người giả thử nghiệm va chạm' – các tác nhân AI mô phỏng người dùng đa dạng về tuổi tác, ngôn ngữ và văn hóa – nhằm kiểm thử và phát hiện những tương tác nguy hiểm, độc hại về mặt tâm lý.

Giữa vô vàn tranh luận về viễn cảnh AI có thể hủy diệt loài người trong tương lai, người ta dễ quên rằng AI đã gây tổn hại tâm lý cho con người ngay ở hiện tại. Và đó chính là vấn đề mà Circuit Breaker Labs đang nỗ lực giải quyết.
Những tổn thất đã xảy ra, không còn là giả thuyết
Đầu năm nay, Character.AI đã phải dàn xếp nhiều vụ kiện liên quan đến cái chết của người dùng vị thành niên sau khi họ tương tác với các chatbot của nền tảng này rồi tự kết liễu đời mình. Nhiều gia đình cũng đã kiện OpenAI, cáo buộc ChatGPT có vai trò trong các vụ tự sát và hoang tưởng của người thân họ.
"Rất nhiều người, đặc biệt là giới trẻ, tìm đến các hệ thống này để được hỗ trợ, nhưng thường họ không nhận được sự giúp đỡ họ cần. Thay vào đó, trong nhiều trường hợp, họ còn bị tổn hại một cách chủ động, và đáng tiếc là đã có người mất mạng."
Đó là chia sẻ của Arul Nigam, CTO của Circuit Breaker Labs.
Khởi nguồn từ một bi kịch có thật
Hai anh em ruột Shirali Nigam (CEO) và Arul Nigam (CTO) thành lập Circuit Breaker Labs, lấy cảm hứng từ câu chuyện của Sewell Setzer – cậu bé 14 tuổi đã phát triển sự gắn bó tình cảm với một chatbot của Character.AI, tâm sự với nó về ý định tự làm hại bản thân rồi qua đời. Trong đơn kiện năm 2024, cha mẹ của Setzer cáo buộc rằng chatbot đã khuyến khích cậu.
Theo Arul, chatbot có thể đã không hiểu được hàm ý thực sự đằng sau những câu như "Tôi muốn ở bên bạn".
"Những lỗ hổng an toàn kiểu này xảy ra khi người dùng không hề cố tình phá vỡ hệ thống – họ chỉ đang trò chuyện một cách tự nhiên – nhưng hệ thống bị nhiễu ngữ cảnh hoặc không hiểu được sắc thái, rồi đưa ra hành động thực sự nguy hiểm. Chúng tôi đang cố ngăn chặn điều đó."
Đội quân "người giả thử nghiệm va chạm"
Circuit Breaker Labs đã tạo ra các tác nhân AI được ví như một đội quân người giả dùng trong thử nghiệm va chạm xe hơi. Những tác nhân này mô phỏng con người ở mọi lứa tuổi, hoàn cảnh, ngôn ngữ và nền văn hóa, dùng để kiểm thử khả năng phát hiện các tương tác nguy hiểm, độc hại về mặt tâm lý của các mô hình AI.
"Cách một bé gái sáu tuổi nói chuyện khác hoàn toàn với một người đàn ông 45 tuổi, hay người dùng tiếng Anh bản ngữ khác với người dùng tiếng Anh thứ hai, hay tiếng lóng của game thủ khác với tiếng lóng của nhóm khác – tất cả đều có thể khiến mô hình 'vấp ngã'."
Shirali Nigam, CEO của công ty, giải thích thêm: "Các mô hình xử lý rất tốt những mẫu câu chuẩn mực, nhưng chẳng ai nói chuyện như vậy cả. Nếu mô hình hiểu sai sắc thái hoặc tiếng lóng, hậu quả có thể rất nghiêm trọng."
Cách hoạt động
Circuit Breaker Labs phối hợp với các chuyên gia trong từng lĩnh vực để xây dựng những mô phỏng người dùng siêu thực tế, từ đó chạy các bài kiểm thử red-team – tức kiểm thử đối kháng nhằm phát hiện điểm yếu. Các bài kiểm thử này mô phỏng chính xác cách con người thật sự nói chuyện: mẫu câu tự nhiên, tiếng lóng, ngôn ngữ ám chỉ, thậm chí cả lỗi chính tả.
Công ty chạy từ vài chục nghìn đến hàng trăm nghìn cuộc tương tác mô phỏng mỗi ngày, nhằm đảm bảo mô hình có thể phản ứng phù hợp với những tình huống rủi ro xuất hiện dần dần qua nhiều cuộc trò chuyện. Sau đó, Circuit Breaker Labs sử dụng phương pháp chấm điểm độc quyền để đưa ra các điểm số có thể kiểm toán và giải thích được.
Khách hàng và định hướng
Hiện Circuit Breaker Labs hoạt động như một phòng thí nghiệm kiểm thử an toàn AI cho các ứng dụng AI có rủi ro cao như huấn luyện AI, ứng dụng viết nhật ký, hoặc các ứng dụng hỗ trợ sức khỏe tinh thần. Arul từ chối tiết lộ khách hàng lớn của công ty.
Dù đã có sản phẩm vận hành được, startup này vẫn đang ở giai đoạn rất sớm với chỉ năm nhân viên, bao gồm hai anh em nhà Nigam. Tuy nhiên, theo thời gian, nền tảng kiểm thử này có thể được áp dụng cho bất kỳ ứng dụng nào mà người dùng có nguy cơ rơi vào "hố tâm lý AI" – tức phát triển mối quan hệ ái kỷ một chiều (parasocial) với chatbot. Ví dụ điển hình là các tác nhân "đồng nghiệp AI", với phản hồi có thể thay đổi qua từng lần tương tác.
"Mọi người đang ngày càng hoài nghi AI hoặc kháng cự việc áp dụng nó trên mọi phương diện. Việc hoài nghi là lành mạnh, nhưng cấm một công cụ tiềm năng chỉ vì lo ngại an toàn thì lại là bước thụt lùi."
Theo Arul, câu trả lời cho những lo ngại đó chính là làm cho AI an toàn hơn. "Chúng tôi muốn góp phần xây dựng niềm tin đó cho mọi người."
Góc nhìn cho người dùng Việt Nam
Câu chuyện của Circuit Breaker Labs đặc biệt đáng lưu tâm với người dùng Việt Nam, khi các ứng dụng chatbot AI như Character.AI, ChatGPT hay nhiều trợ lý ảo khác ngày càng phổ biến trong giới trẻ. Vấn đề càng phức tạp hơn khi các mô hình phần lớn được huấn luyện chủ yếu bằng tiếng Anh, dễ hiểu sai sắc thái, tiếng lóng hay cách diễn đạt đặc thù của tiếng Việt – đúng như điểm yếu mà Circuit Breaker Labs đang cố gắng giải quyết.
Circuit Breaker Labs là một trong những startup lọt vào vòng chung kết Startup Battlefield 200 năm 2026 của TechCrunch. Công ty sẽ trình bày tại sự kiện TechCrunch Disrupt, diễn ra tại Moscone West ở San Francisco từ ngày 13 đến 15 tháng 10.
Bài viết liên quan

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Pyxel: Engine làm game retro bằng Python với trình vẽ pixel art và biên tập âm thanh tích hợp
01 tháng 10, 2026