Phát hiện bot thu thập dữ liệu qua hành vi cuộn trang

Công nghệ20 tháng 8, 2026·5 phút đọc

Một nhà nghiên cứu độc lập đã áp dụng hai công thức toán học Burstiness và Memory để phân tích hành vi cuộn trang của người dùng, từ đó phân biệt bot với con người. Kết quả thử nghiệm với mô hình LightGBM đạt độ chính xác 73,4%, mở ra hướng tiếp cận mới trong việc bảo vệ website khỏi các scraper bot tinh vi.

Phát hiện bot thu thập dữ liệu qua hành vi cuộn trang

Phát hiện bot thu thập dữ liệu qua hành vi cuộn trang: Bước đột phá trong chống scraper

Trong bối cảnh các bot thu thập dữ liệu ngày càng tinh vi, một nhà nghiên cứu đã tìm ra cách tiếp cận mới dựa trên phân tích hành vi cuộn trang của người dùng. Bằng cách kết hợp hai đại lượng toán học Burstiness (tính bùng nổ) và Memory (tính nhớ), phương pháp này có thể nhận diện bot với độ chính xác đáng kể, mở ra hướng bảo vệ website hiệu quả hơn cho các trang nội dung.

Nguồn cảm hứng từ nghiên cứu về hệ thống phức tạp

Nhà nghiên cứu cho biết ý tưởng bắt nguồn từ bài báo khoa học "Burstiness and Memory in Complex Systems" của Kwang-Il Goh. Hai công thức này thường được dùng để phân tích động lực học của các hệ thống dựa trên sự kiện như thời gian gửi email, tin nhắn hay thậm chí nhịp tim. Chúng cho phép xác định rõ mẫu hành vi nào mang tính con người và mẫu nào không, dựa trên dữ liệu đã được phân loại trước đó.

Con người thường trả lời tin nhắn theo cách "bùng nổ" - thời gian phản hồi không đồng đều, trong khi bot đơn giản phản hồi nhanh nhất có thể, dẫn đến hệ số B và M khác biệt hoàn toàn.

Biểu đồ minh họa hành vi cuộn trangBiểu đồ minh họa hành vi cuộn trang

Giới hạn của các phương pháp truyền thống

Trước đây, nhà nghiên cứu từng sử dụng hai giá trị này để phân biệt phiên làm việc của bot và con người dựa trên thời gian gửi request. Tuy nhiên, cách tiếp cận này có điểm yếu: nó nhận diện nhầm bất kỳ phiên nào sử dụng trình duyệt tải CSS và JS là con người. Điều này cho phép các bot tiên tiến như ClaudeBot giả dạng người dùng bằng cách sử dụng trình duyệt headless.

Về bản chất, phương pháp cũ chỉ phân biệt được giữa "request được tạo thủ công" và "request từ trình duyệt thực", chứ không phải giữa bot và con người thực sự.

Hành vi cuộn trang: Đặc điểm khó bị giả mạo

Nhà nghiên cứu nhận thấy một hành vi đặc trưng của con người mà bot khó có thể mô phỏng: cách cuộn trang. Khi tìm kiếm thông tin, con người thường không cuộn tuyến tính từ trên xuống dưới mà cuộn theo mô hình bùng nổ - dừng lại, đọc, cuộn tiếp, quay lại - tạo thành một chuỗi sự kiện không đồng đều về thời gian.

Mô hình hành vi cuộn trang khác nhau giữa người và botMô hình hành vi cuộn trang khác nhau giữa người và bot

Để kiểm chứng giả thuyết này, nhà nghiên cứu đã sử dụng bộ dữ liệu công khai từ bài báo "FP-Agent: Fingerprinting AI Browsing Agents" của Ethan Wang và cộng sự. Dữ liệu ghi lại hành vi điều hướng của nhiều loại agent AI và con người khác nhau trên một website kiểm soát.

Kết quả thử nghiệm đầy hứa hẹn

Sau khi tính toán hệ số Burstiness và Memory cho từng sự kiện cuộn trang JavaScript của mỗi agent, kết quả cho thấy sự khác biệt rõ rệt:

  • Phân bố của con người có hệ số Burstiness cao hơn hẳn và gần như không có Memory
  • Hầu hết các bot có đặc tính hoàn toàn khác biệt
  • ChatGPT Agent là trường hợp duy nhất đôi khi có hành vi giống con người

Nhà nghiên cứu tiếp tục huấn luyện mô hình LightGBM (gradient boosting decision tree) với chỉ hai đặc trưng B và M để phân loại từng tương tác trên một trang. Kết quả đạt độ chính xác 73,4% - một con số đáng khích lệ. Như dự đoán, mô hình chủ yếu nhầm lẫn giữa con người và ChatGPT Agent, có thể do số lượng đặc trưng còn ít hoặc kích thước mẫu dữ liệu nhỏ (chỉ khoảng 150 điểm dữ liệu mỗi agent).

Kết quả phân tích dữ liệu hành vi cuộn trangKết quả phân tích dữ liệu hành vi cuộn trang

Ứng dụng thực tế tại Việt Nam

Đối với các website nội dung tại Việt Nam - nơi đang phải đối mặt với tình trạng thu thập tin tức tự động tràn lan - phương pháp này mang lại tiềm năng bảo vệ đáng kể. Các trang báo điện tử, blog kỹ thuật hay diễn đàn có thể tích hợp giải pháp này như một lớp bảo mật bổ sung bên cạnh các biện pháp CAPTCHA truyền thống.

Phương pháp này đặc biệt hiệu quả với các trang yêu cầu cuộn trang như blog dài, trang wiki hoặc trang tin tức. Tuy nhiên, nó sẽ không hiệu quả với các website không yêu cầu thao tác cuộn như trang đăng nhập hay trang cá nhân.

Kết luận và hướng phát triển

Nghiên cứu này đã chứng minh giá trị của hành vi cuộn trang trong việc phân biệt bot với con người. Mặc dù mô hình hiện tại chưa đạt độ chính xác tuyệt đối, việc kết hợp thêm các đặc trưng khác như chuyển động chuột hoặc thói quen gõ phím có thể tạo ra một mô hình tổng quát đủ mạnh để bảo vệ website khỏi scraper bot trong tương lai.

Nhà nghiên cứu cho biết sẽ tiếp tục chia sẻ các phát hiện mới trên blog cá nhân, với dự định sắp tới sẽ phân tích sâu về mẫu chuyển động chuột - một hướng đi hứa hẹn khác trong cuộc chiến chống bot thu thập dữ liệu.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗