Bảo vệ bí mật phải mở rộng theo tốc độ phát triển phần mềm
Số lượng pull request trên GitHub có sự tham gia của AI agent đã tăng từ dưới 1/10 lên 1/3 chỉ trong một năm, khiến các lỗ hổng rò rỉ bí mật trở nên khó kiểm soát hơn bao giờ hết. GitHub đã ra mắt bộ phân loại ModernBERT có khả năng sàng lọc bí mật trong chưa đầy 2 mili-giây, hứa hẹn tăng gấp đôi số lượng bí mật được ngăn chặn trước khi bị đẩy lên kho mã nguồn.

Bảo vệ bí mật phải mở rộng theo tốc độ phát triển phần mềm
Tóm tắt: Số lượng pull request trên GitHub có sự tham gia của AI agent đã tăng vọt từ dưới 1/10 lên 1/3 chỉ trong một năm, khiến các lỗ hổng rò rỉ bí mật trở nên khó kiểm soát hơn bao giờ hết. GitHub đã ra mắt bộ phân loại ModernBERT có khả năng sàng lọc bí mật trong chưa đầy 2 mili-giây, hứa hẹn tăng gấp đôi số lượng bí mật được ngăn chặn trước khi bị đẩy lên kho mã nguồn.
Trong bối cảnh hiện nay, cứ ba pull request trên GitHub thì có một PR liên quan đến AI agent. Một năm trước, con số này chưa đến 1/10. Nếu đà tăng trưởng này tiếp tục, trong vòng hai năm tới, phần lớn mã nguồn được đẩy lên GitHub có thể sẽ do agent viết ra. Phần lớn trong số đó có thể sẽ không bao giờ được con người đọc hết.
Khi các lập trình viên và AI agent di chuyển ngày càng nhanh, trách nhiệm của nền tảng là phải đảm bảo khả năng bảo vệ theo kịp tốc độ tạo mã nguồn. Điều này đồng nghĩa với việc ngăn chặn nhiều rò rỉ hơn trước khi chúng xảy ra, đồng thời giảm sự phụ thuộc vào nỗ lực thủ công của con người đối với những sự cố còn sót lại.
Bị vượt qua, không phải bất cẩn
Trung bình cứ mỗi hai giây lại xuất hiện một bí mật mới trong mã nguồn công khai, và con số này đã tăng gấp đôi mỗi năm trong ba năm qua. Dư luận thường đổ lỗi cho AI khiến lập trình viên trở nên bất cẩn hơn. Tuy nhiên, dữ liệu từ chín quý liên tiếp của GitHub lại cho thấy một bức tranh khác.
Biểu đồ số lượng push công khai và tỷ lệ push chứa bí mật từ Q2 2024 đến Q2 2026
Từ Q2/2024 đến Q2/2026, số lượt push được kiểm tra tăng gấp 2,84 lần, trong khi số lượt push mang theo thông tin xác thực tăng 2,59 lần. Qua chín quý dữ liệu đầy đủ, các chuyên gia GitHub không tìm thấy xu hướng thống kê nào cho thấy tỷ lệ bí mật trên mỗi lượt push gia tăng đáng kể.
Thậm chí, dữ liệu còn cho thấy lập trình viên hiểu rõ rủi ro rò rỉ hơn bao giờ hết và ít sẵn sàng chấp nhận rủi ro đó hơn. Trong cùng giai đoạn, tỷ lệ ghi đè cảnh báo chặn push đã giảm tuyến tính từ 6,63% xuống còn 3,93%.
Vấn đề thực sự nằm ở khả năng xử lý của con người. Thời gian trung bình để thu hồi thủ công một bí mật bị rò rỉ vào khoảng 40 ngày, và khoảng 1/5 trường hợp mất hơn 90 ngày. Trong khi đó, tốc độ tạo mã nguồn ngày càng tăng, đồng nghĩa với việc thông tin xác thực bị lộ có thể vẫn còn hiệu lực trong nhiều tuần hoặc nhiều tháng.
Nhắc nhở lập trình viên cẩn thận hơn không thể tự nó giải quyết vấn đề này. Khi lượng mã nguồn tăng lên, chúng ta phải ngăn chặn nhiều rò rỉ hơn và giảm bớt nỗ lực thủ công cần thiết.
Phòng ngừa mở rộng theo năng lực tính toán
GitHub hiện có danh mục bao gồm hơn 150 đối tác kỹ thuật thông qua chương trình đối tác quét bí mật. Trong Q2/2026, hệ thống quét công khai đã báo cáo trung bình 26 kết quả khớp thông tin xác thực mỗi giây, bao gồm cả các quan sát lặp lại. Sau khi được thông báo, nhiều đối tác như OpenAI, Google Cloud, Slack, Hugging Face và SendGrid đã thu hồi token ngay lập tức mà không cần chờ lập trình viên xử lý cảnh báo trên GitHub.
Cơ chế push protection can thiệp sớm hơn nữa. Nó chặn các thông tin xác thực có thể nhận diện được trước khi chúng đi vào lịch sử kho mã nguồn, cho lập trình viên hoặc agent cơ hội sửa lại thay đổi trước khi xảy ra rò rỉ. Nhờ nỗ lực của các đối tác, trong tháng vừa qua, đã có ít nhất một bí mật bị chặn bởi push protection mỗi giây. Đối với các thông tin xác thực gắn với nhà phát hành, GitHub chặn được nhiều bí mật hơn số lượng bị lọt qua.
Khắc phục vẫn phụ thuộc vào con người
Khi tính cả các loại bí mật bổ sung, push protection dừng được khoảng 30% số bí mật mới phát hiện trước khi chúng đi vào lịch sử kho mã nguồn. 70% còn lại chỉ được phát hiện sau khi thông tin xác thực đã bị rò rỉ.
Đây là điểm mấu chốt: phòng ngừa mở rộng theo năng lực tính toán, nhưng khắc phục vẫn phụ thuộc vào con người. Từ chối một lượt push chỉ tốn tài nguyên tính toán, trong khi dọn dẹp một bí mật đã lộ ra lịch sử công khai lại tiêu tốn thời gian và sự tập trung của lập trình viên.
Khi lượng mã nguồn tăng lên, nền tảng phải nhận trách nhiệm nhận diện nhiều bí mật hơn, sớm hơn trong quy trình phát triển. Nếu không, số lượng lỗ hổng được đưa vào hệ thống sẽ trở nên không thể kiểm soát.
Bài toán bốn yếu tố
Trước khi một bí mật vượt qua ranh giới push, chi phí ngăn chặn rất nhỏ và quyết định chỉ mang tính nhị phân: chặn hoặc cho qua. Sau khi vượt qua, cùng chuỗi ký tự đó có thể xác thực với một hệ thống thực, và chi phí trở nên vô hạn.
Trong nhiều trường hợp, manh mối phát hiện duy nhất có thể là mã nguồn xung quanh và bối cảnh thế giới thực. Token do nhà cung cấp phát hành có thể có tiền tố dễ nhận biết, nhưng mật khẩu cơ sở dữ liệu nội bộ có thể hoàn toàn không có cấu trúc nhận dạng nào.
GitHub gọi đây là "bài toán bốn yếu tố" của bảo vệ bí mật: độ chính xác, độ trễ, thông lượng và chi phí là những ràng buộc gắn kết chặt chẽ với nhau. Một cảnh báo phù hợp để xem xét sau không nhất thiết đủ để chặn một lượt push. Một kết quả dương tính giả sẽ làm gián đoạn lập trình viên và khiến lần chặn tiếp theo khó được tin tưởng hơn.
Bảo vệ ngay tại thời điểm push trong chưa đầy 2 mili-giây
Bộ phân loại ModernBERT mới của GitHub đánh giá các bí mật ứng viên trong ngữ cảnh mà không cần sinh mã hay văn bản. Nó không chỉ chính xác hơn các pipeline dựa trên LLM hiện có, mà còn cực kỳ nhanh, đánh giá cả lô ứng viên trong chưa đầy 2 mili-giây. Mô hình cũng tiết kiệm chi phí đến mức có thể chạy ở quy mô lớn ngay trong đường dẫn tới hạn.
Mô hình phát hiện bí mật chung do AI hỗ trợ của GitHub sử dụng ngữ cảnh mã xung quanh để chặn các giá trị giống mật khẩu
Việc tích hợp mô hình này vào push protection cho phép GitHub tăng hơn gấp đôi số lượng bí mật có thể ngăn chặn. Tính năng hiện đang trong giai đoạn xem trước riêng tư và sẽ sớm khả dụng cho các tổ chức dùng GitHub Secret Protection trên Enterprise Cloud và GitHub Teams, tiêu tốn AI credit.
Mô hình cũng sẽ được đưa ra ngoài phạm vi push. Bắt đầu từ hôm nay, mọi tổ chức sử dụng tính năng phát hiện bí mật bằng AI sẽ được tự động cập nhật lên mô hình mới, với các cảnh báo từ quét sau push vẫn được bao gồm trong gói Secret Scanning mà không phát sinh thêm chi phí. Mô hình cũng sẽ có mặt trên GitHub Enterprise Server 3.23 ở dạng xem trước công khai, mang đến cảnh báo do AI phát hiện cho cả những môi trường biệt lập hoàn toàn.
Ngoài ra, bộ phân loại còn được thêm vào lệnh /security-review cho Copilot CLI và Copilot App, giúp người dùng Copilot xử lý bí mật trước khi push ngay cả khi tổ chức chưa có gói GitHub Secret Protection.
Hướng tới tương lai
Tương lai mà GitHub hướng tới là một thế giới nơi lập trình viên có thể giao phó nhiều công việc hơn cho agent mà không cần giám sát từng yêu cầu, và nơi số lượng người cần thiết để giữ an toàn thông tin xác thực của tổ chức không còn tăng theo lượng mã nguồn được viết ra.
Chúng ta muốn mọi người tạo ra nhiều phần mềm hơn. Năng lực bảo vệ phần mềm cũng phải phát triển tương xứng với năng lực tạo ra nó.
Bài viết liên quan

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Mecka AI huy động 60 triệu USD từ Sequoia để thu thập dữ liệu huấn luyện robot hình người
07 tháng 10, 2026