Gremlin dùng AI để phá vỡ các hệ thống phân tán nhanh hơn

Phần mềm08 tháng 10, 2026·6 phút đọc

Gremlin ra mắt Foresight AI, tiện ích bổ sung cho dịch vụ chaos engineering, giúp tự động phá vỡ hạ tầng phần mềm nhằm phát hiện lỗi ẩn trước khi chúng xuất hiện trên môi trường production. Công cụ này dựa trên Failure Atlas — kho dữ liệu hàng triệu thí nghiệm chaos engineering được thu thập suốt một thập kỷ.

Gremlin dùng AI để phá vỡ các hệ thống phân tán nhanh hơn

Chaos engineering từ lâu đã là một phương pháp được các kỹ sư tin cậy (SRE) ưa chuộng để kiểm tra độ bền của hệ thống. Giờ đây, Gremlin — startup do cựu kỹ sư Netflix là Kolton Andrus sáng lập — đang tích hợp AI để tự động hóa nhiều bước trong quy trình này.

Chaos engineering là gì và vì sao cần AI?

Chaos engineering là thực hành cố ý tạo ra các lỗi có kiểm soát trong một hệ thống đang vận hành, nhằm kiểm tra khả năng chịu lỗi của hệ thống đó. Cách làm này được Netflix phổ biến từ hơn một thập kỷ trước và đến nay đã trở thành tiêu chuẩn ở nhiều doanh nghiệp lớn.

Ý tưởng khá đơn giản nhưng cũng đầy rủi ro: tắt một máy chủ ngẫu nhiên, ngắt một load balancer, thậm chí vô hiệu hóa toàn bộ một vùng cloud — rồi quan sát xem phần còn lại của hệ thống có thể tiếp tục phục vụ khách hàng hay không. Nếu vẫn chạy ổn, mọi thứ đang tốt. Nếu sập, đồng nghĩa với việc còn nhiều việc phải làm để tăng độ tin cậy.

Kolton Andrus, một trong những kỹ sư từng làm chaos engineering tại Netflix, đã thành lập Gremlin nhằm mang kỹ thuật "tiêm lỗi" (fault injection) đến các doanh nghiệp, kèm theo những công cụ thân thiện với hoạt động kinh doanh như chấm điểm, báo cáo cho ban lãnh đạo và công cụ phân định trách nhiệm trong tổ chức.

Foresight AI: "Failure-as-a-Service"

Foresight AI là tiện ích bổ sung mới cho bộ dịch vụ chaos engineering hiện có của Gremlin. Công cụ này tự động phá vỡ hạ tầng phần mềm để phát hiện các lỗi ẩn trước khi chúng bộc lộ trên môi trường production.

Theo Andrus, việc đưa AI vào quy trình giúp tăng tốc đáng kể, nhờ tự động hóa nhiều tác vụ chuẩn bị và hậu kiểm tra mà trước đây phải làm thủ công.

Các dịch vụ AIOps không phải là điều mới mẻ với giới SRE, nhưng phần lớn chúng chỉ chẩn đoán vấn đề sau khi hệ thống đã gặp sự cố. Andrus nhận xét:

"Nhiều giải pháp AI kiểu 'chúng tôi đoán một cái, đây nhé, chúc may mắn'."

Ngược lại, Gremlin chủ động đẩy hệ thống vào trạng thái lỗi rồi đưa ra lời khuyên chuyên môn về cách ngăn chặn điều đó tái diễn. Người dùng cài đặt các agent trên hệ thống của mình để có thể tiêm độ trễ (latency), "kill" các pod, hoặc đẩy bộ nhớ lên mức tối đa. Dịch vụ cloud của Gremlin sau đó quan sát các cảnh báo telemetry để tìm dấu hiệu điểm yếu mang tính hệ thống.

Failure Atlas — "công thức bí mật"

Điểm khác biệt cốt lõi của Gremlin nằm ở Failure Atlas, một kho dữ liệu gồm hàng triệu thí nghiệm chaos engineering mà công ty đã thực hiện trong suốt một thập kỷ trên "hàng chục nghìn hệ thống", theo Andrus.

Gremlin phát triển một khung kết nối (harness) gắn mô hình ngôn ngữ lớn (LLM) với Failure Atlas, cho phép nó đưa ra câu trả lời có cơ sở kỹ thuật vững chắc hơn về nguyên nhân sự cố, thay vì chỉ dựa vào kho kiến thức ngẫu nhiên thu thập trên Internet. Gremlin sử dụng nhiều LLM khác nhau, cả mã nguồn đóng lẫn mở, tùy vào thời điểm mô hình nào hoạt động tốt nhất.

Theo Andrus, Failure Atlas giúp giữ LLM "đúng hướng" và giảm thiểu hiện tượng hallucination (ảo giác của AI).

Không tạo ra vấn đề, chỉ phát hiện chúng

Các rào cản bảo vệ hiện có của Gremlin được xây dựng dựa trên quyền truy cập của chính doanh nghiệp và các biện pháp bảo mật khác, nhằm giảm thiểu "bán kính ảnh hưởng" (blast radius) — cách gọi của công ty này. Nếu vụ nổ không được kiểm soát, thì đó đã là vấn đề kiểm soát truy cập.

Khi một sự cố hệ thống được tạo ra, Foresight AI sẽ:

  • Xác định nguyên nhân gốc rễ
  • Sinh mã hoặc thay đổi cấu hình được cho là sẽ khắc phục vấn đề
  • Tự động áp dụng giải pháp, hoặc chuẩn bị báo cáo để kỹ sư SRE đọc

Đây về cơ bản là một vòng lặp agentic kiểu "kiểm tra và thay thế" — vẫn giữ con người ở những điểm quyết định quan trọng — chạy cho đến khi lỗi không còn được tạo ra nữa.

Đối tượng khách hàng và bối cảnh

Khách hàng hiện tại của Gremlin chủ yếu là các doanh nghiệp lớn có nhu cầu tính toán cao, tập trung nhiều vào lĩnh vực dịch vụ tài chính, bán lẻ và SaaS doanh nghiệp. Họ dùng Gremlin để kiểm tra kế hoạch khôi phục sau thảm họa, đảm bảo hệ thống vận hành đúng trong điều kiện không lý tưởng, và kiểm chứng khả năng mở rộng của Kubernetes.

Những hệ thống phân tán phức tạp như vậy đặc biệt khó chẩn đoán khi gặp sự cố. Một số lỗi khó bị phát hiện bằng kiểm thử tích hợp và đơn vị thông thường, nhưng có thể lộ diện khi tiêm các lỗi như độ trễ mạng, cạn kiệt bộ nhớ, hoặc những điều kiện khác phơi bày điểm yếu trong hệ thống phân tán.

Rủi ro từ làn sóng AI

Cuộc đua ứng dụng AI để vừa viết ứng dụng vừa triển khai hạ tầng cũng kéo theo những phức tạp riêng. Andrus giải thích trong một cuộc phỏng vấn rằng AI làm việc với tốc độ khiến con người không thể theo kịp để kiểm duyệt, và AI có thể mắc những sai lầm ngớ ngẩn ở bất cứ đâu.

Chuyên gia phân tích Jason English của Intellyx nhận định rằng bất kỳ dịch vụ nào cam kết phá vỡ hệ thống vì lợi ích chung đều cần được phê duyệt ở cấp lãnh đạo cao nhất. Để công cụ này hoạt động hiệu quả, theo ông, "chúng ta cần thay đổi tư duy về rủi ro".

Góc nhìn cho doanh nghiệp Việt Nam

Với các doanh nghiệp Việt Nam đang đẩy mạnh chuyển đổi số và ngày càng phụ thuộc vào hạ tầng cloud cùng các hệ thống microservices, chaos engineering tự động bằng AI là hướng đi đáng quan tâm. Việc chủ động "phá vỡ" hệ thống trong môi trường có kiểm soát giúp phát hiện điểm yếu trước khi sự cố thực sự ảnh hưởng đến người dùng — điều đặc biệt quan trọng với các nền tảng tài chính, thương mại điện tử và SaaS.

Tuy nhiên, các đội ngũ kỹ thuật cần cân nhắc kỹ về phạm vi ảnh hưởng, quyền truy cập và cơ chế giám sát của con người, bởi sức mạnh của AI trong việc tạo lỗi cũng đi kèm rủi ro nếu không được kiểm soát chặt chẽ.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗