Cuộc chiến chống AI Crawler: git.kernel.org tiết lộ 20% tài nguyên hệ thống đang bị bóp nghẹt

Công nghệ29 tháng 8, 2026·6 phút đọc

Bài viết từ nhà điều hành git.kernel.org hé lộ bức tranh ảm đạm khi các con bot AI đang tiêu tốn tới 20% sức mạnh CPU toàn hệ thống chỉ để render các commit thành HTML — một cách khai thác dữ liệu cực kỳ kém hiệu quả. Dù đã áp dụng các biện pháp chặn như Anubis, các bot vẫn tìm cách vượt qua, buộc đội ngũ phải cân nhắc tắt bớt tính năng để giảm thiểu thiệt hại.

Cuộc chiến chống AI Crawler: git.kernel.org tiết lộ 20% tài nguyên hệ thống đang bị bóp nghẹt

Cuộc chiến chống AI Crawler: git.kernel.org tiết lộ 20% tài nguyên hệ thống đang bị bóp nghẹt

Git.kernel.org — kho lưu trữ mã nguồn quan trọng nhất của nhân Linux — vừa công bố những con số đáng báo động về tác động của các "AI crawler" (bot thu thập dữ liệu cho mô hình AI). Theo ước tính, khoảng 98% lưu lượng truy cập vào trang web này đến từ các bot, và chúng đang ngốn tới 14-16 trên tổng số 90 lõi CPU của hệ thống chỉ để phục vụ một mục đích duy nhất: render toàn bộ lịch sử commit thành HTML để phục vụ cho việc huấn luyện mô hình ngôn ngữ lớn (LLM).

Vì sao git.kernel.org trở thành "mỏ vàng" cho AI?

Linux phát triển hoàn toàn công khai — từ kho git có thể clone đến các diễn đàn thảo luận. Đối với một mô hình ngôn ngữ lớn, đây là nguồn dữ liệu huấn luyện vô giá, bởi vì toàn bộ lịch sử commit là nội dung "thuần khiết" được tạo ra trước thời kỳ AI. Việc huấn luyện LLM trên dữ liệu do chính LLM tạo ra sẽ dẫn đến "bệnh não xốp kỹ thuật số" — làm suy giảm chất lượng mô hình. Do đó, các nhà phát triển AI xem toàn bộ lịch sử commit của kernel như một nguồn tài nguyên quý giá cần được khai thác triệt để.

Cách khai thác "ngu ngốc" nhất có thể

Điều trớ trêu là toàn bộ dữ liệu của git.kernel.org đều có thể tải về dễ dàng qua một lệnh git clone. Chỉ cần clone kho lưu trữ (repository) là bot có thể sở hữu toàn bộ lịch sử 1,48 triệu commit của linux.git — cùng với 922 fork khác. Tuy nhiên, thay vì sử dụng phương pháp hiệu quả này, các crawler lại chọn cách render từng commit thành trang HTML rồi mới phân tích.

Hệ quả là sự lãng phí khủng khiếp: cgit — giao diện web cho phép xem commit — có thể tạo ra khoảng 1,2 tỷ URL hợp lệ chỉ riêng cho một fork của linux.git. Các bot sẽ quét qua toàn bộ các URL này, nhận về 922 bản sao giống hệt nhau của cùng 1,48 triệu commit, nhưng vẫn tiêu tốn một lượng tài nguyên hệ thống khổng lồ.

Biểu đồ so sánh số URL giữa crawl và cloneBiểu đồ so sánh số URL giữa crawl và clone

Chiến thuật chặn bot và sự leo thang không hồi kết

Giai đoạn 1: Chặn theo User-Agent

Ban đầu, việc chặn bot khá dễ dàng vì chúng "thành thật" khai báo danh tính qua chuỗi User-Agent. Nhưng sau đó, các bot bắt đầu giả dạng trình duyệt thông thường, buộc đội ngũ vận hành phải chuyển sang chặn theo địa chỉ IP.

Giai đoạn 2: Chặn theo IP và ASN

Các bot nhanh chóng lan ra toàn bộ dải mạng con (subnet). Việc chặn toàn bộ ASN (hệ thống tự trị) trở nên cần thiết, dù đôi khi vô tình chặn cả những instance hợp lệ đang cố gắng tự động kiểm tra link.

Giai đoạn 3: "Bot từ TV nhà bạn"

Đây là bước ngoặt tồi tệ nhất. Các bot bắt đầu xuất phát từ hàng triệu địa chỉ IP dân cư và di động ngẫu nhiên, tất cả đều giả dạng trình duyệt hiện đại. Mỗi IP chỉ thực hiện 4-5 yêu cầu rồi biến mất, khiến việc chặn theo IP trở nên vô nghĩa. Đội ngũ vận hành gọi đây là "proxy SDK monetization" — một ngành kinh doanh lớn, nơi các thiết bị gia dụng thông minh của người dùng bị biến thành công cụ tấn công.

Biểu đồ mức độ khó của Anubis và lượng bot vượt quaBiểu đồ mức độ khó của Anubis và lượng bot vượt qua

Anubis: Vũ khí tạm thời

Để đối phó, đội ngũ đã triển khai Anubis — một hệ thống thử thách (challenge) yêu cầu bot phải tính toán một chuỗi hash SHA-256 với 4 số 0 ở đầu. Giải pháp này cực kỳ hiệu quả trong vài tháng đầu: các bot gần như bỏ cuộc hoàn toàn. Tuy nhiên, chỉ sau vài tháng, chúng đã quay lại và giải được cả mức độ khó 5 (mức mà người dùng di động phải mất vài giây và khiến điện thoại nóng lên đáng kể).

Theo số liệu mới nhất, git.kernel.org nhận khoảng 6 triệu yêu cầu mỗi ngày để xem các commit ngẫu nhiên. Trong đó, 66% vẫn bị chặn bởi Anubis, nhưng 33% đã giải được thử thách và xâm nhập vào hệ thống. Ước tính chỉ khoảng 2% lưu lượng là từ người dùng thật.

Mức độ thiệt hại: 20% toàn bộ năng lực hệ thống

Trong tổng số 90 lõi CPU trải khắp 5 node phân tán địa lý, có tới 14-16 lõi CPU đang hoạt động không ngừng chỉ để render commit cho các bot. Con số này chiếm trung bình 20% toàn bộ năng lực xử lý — và thực tế còn tệ hơn do các đợt tấn công dạng sóng (wave) với cường độ đột biến.

Biểu đồ CPU giữa crawl và cloneBiểu đồ CPU giữa crawl và clone

Tương lai nào cho git.kernel.org?

Đội ngũ vận hành thừa nhận họ đang phải tắt bớt một số tính năng để giảm số lượng URL có thể quét và chặn các thao tác tốn kém tài nguyên. Người dùng có thể sẽ mất đi một số chức năng khi truy cập ẩn danh — điều mà chính họ cũng không mong muốn.

Hiện chưa có giải pháp đơn giản nào cho vấn đề này. Các công ty phát triển mô hình AI vẫn tiếp tục xuất hiện mỗi ngày, tất cả đều khao khát dữ liệu huấn luyện. Các nhà sản xuất ứng dụng vẫn tìm cách kiếm lời, biến các thiết bị gia dụng thành vectơ tấn công. Dù vậy, cam kết vẫn là: toàn bộ dữ liệu vẫn sẽ được cung cấp miễn phí cho những ai cần — chỉ là người dùng sẽ phải vượt qua nhiều rào cản hơn để tiếp cận.

Bài toán đặt ra cho cộng đồng công nghệ nói chung và người dùng Việt Nam nói riêng: làm thế nào để cân bằng giữa việc chia sẻ dữ liệu mở và bảo vệ hạ tầng khỏi sự tấn công của các bot AI ngày càng tinh vi? Khi mà các "cỗ máy AI" đang tiêu tốn tài nguyên một cách lãng phí nhất có thể, rất có thể chúng ta đang chứng kiến một trong những hệ quả khó lường nhất của cuộc đua AI toàn cầu.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗