Phát hiện bot thu thập dữ liệu qua hành vi cuộn trang
Một nhà nghiên cứu độc lập đã áp dụng hai công thức toán học Burstiness và Memory để phân tích hành vi cuộn trang của người dùng, từ đó phân biệt bot với con người. Kết quả thử nghiệm với mô hình LightGBM đạt độ chính xác 73,4%, mở ra hướng tiếp cận mới trong việc bảo vệ website khỏi các scraper bot tinh vi.

Phát hiện bot thu thập dữ liệu qua hành vi cuộn trang: Bước đột phá trong chống scraper
Trong bối cảnh các bot thu thập dữ liệu ngày càng tinh vi, một nhà nghiên cứu đã tìm ra cách tiếp cận mới dựa trên phân tích hành vi cuộn trang của người dùng. Bằng cách kết hợp hai đại lượng toán học Burstiness (tính bùng nổ) và Memory (tính nhớ), phương pháp này có thể nhận diện bot với độ chính xác đáng kể, mở ra hướng bảo vệ website hiệu quả hơn cho các trang nội dung.
Nguồn cảm hứng từ nghiên cứu về hệ thống phức tạp
Nhà nghiên cứu cho biết ý tưởng bắt nguồn từ bài báo khoa học "Burstiness and Memory in Complex Systems" của Kwang-Il Goh. Hai công thức này thường được dùng để phân tích động lực học của các hệ thống dựa trên sự kiện như thời gian gửi email, tin nhắn hay thậm chí nhịp tim. Chúng cho phép xác định rõ mẫu hành vi nào mang tính con người và mẫu nào không, dựa trên dữ liệu đã được phân loại trước đó.
Con người thường trả lời tin nhắn theo cách "bùng nổ" - thời gian phản hồi không đồng đều, trong khi bot đơn giản phản hồi nhanh nhất có thể, dẫn đến hệ số B và M khác biệt hoàn toàn.
Biểu đồ minh họa hành vi cuộn trang
Giới hạn của các phương pháp truyền thống
Trước đây, nhà nghiên cứu từng sử dụng hai giá trị này để phân biệt phiên làm việc của bot và con người dựa trên thời gian gửi request. Tuy nhiên, cách tiếp cận này có điểm yếu: nó nhận diện nhầm bất kỳ phiên nào sử dụng trình duyệt tải CSS và JS là con người. Điều này cho phép các bot tiên tiến như ClaudeBot giả dạng người dùng bằng cách sử dụng trình duyệt headless.
Về bản chất, phương pháp cũ chỉ phân biệt được giữa "request được tạo thủ công" và "request từ trình duyệt thực", chứ không phải giữa bot và con người thực sự.
Hành vi cuộn trang: Đặc điểm khó bị giả mạo
Nhà nghiên cứu nhận thấy một hành vi đặc trưng của con người mà bot khó có thể mô phỏng: cách cuộn trang. Khi tìm kiếm thông tin, con người thường không cuộn tuyến tính từ trên xuống dưới mà cuộn theo mô hình bùng nổ - dừng lại, đọc, cuộn tiếp, quay lại - tạo thành một chuỗi sự kiện không đồng đều về thời gian.
Mô hình hành vi cuộn trang khác nhau giữa người và bot
Để kiểm chứng giả thuyết này, nhà nghiên cứu đã sử dụng bộ dữ liệu công khai từ bài báo "FP-Agent: Fingerprinting AI Browsing Agents" của Ethan Wang và cộng sự. Dữ liệu ghi lại hành vi điều hướng của nhiều loại agent AI và con người khác nhau trên một website kiểm soát.
Kết quả thử nghiệm đầy hứa hẹn
Sau khi tính toán hệ số Burstiness và Memory cho từng sự kiện cuộn trang JavaScript của mỗi agent, kết quả cho thấy sự khác biệt rõ rệt:
- Phân bố của con người có hệ số Burstiness cao hơn hẳn và gần như không có Memory
- Hầu hết các bot có đặc tính hoàn toàn khác biệt
- ChatGPT Agent là trường hợp duy nhất đôi khi có hành vi giống con người
Nhà nghiên cứu tiếp tục huấn luyện mô hình LightGBM (gradient boosting decision tree) với chỉ hai đặc trưng B và M để phân loại từng tương tác trên một trang. Kết quả đạt độ chính xác 73,4% - một con số đáng khích lệ. Như dự đoán, mô hình chủ yếu nhầm lẫn giữa con người và ChatGPT Agent, có thể do số lượng đặc trưng còn ít hoặc kích thước mẫu dữ liệu nhỏ (chỉ khoảng 150 điểm dữ liệu mỗi agent).
Kết quả phân tích dữ liệu hành vi cuộn trang
Ứng dụng thực tế tại Việt Nam
Đối với các website nội dung tại Việt Nam - nơi đang phải đối mặt với tình trạng thu thập tin tức tự động tràn lan - phương pháp này mang lại tiềm năng bảo vệ đáng kể. Các trang báo điện tử, blog kỹ thuật hay diễn đàn có thể tích hợp giải pháp này như một lớp bảo mật bổ sung bên cạnh các biện pháp CAPTCHA truyền thống.
Phương pháp này đặc biệt hiệu quả với các trang yêu cầu cuộn trang như blog dài, trang wiki hoặc trang tin tức. Tuy nhiên, nó sẽ không hiệu quả với các website không yêu cầu thao tác cuộn như trang đăng nhập hay trang cá nhân.
Kết luận và hướng phát triển
Nghiên cứu này đã chứng minh giá trị của hành vi cuộn trang trong việc phân biệt bot với con người. Mặc dù mô hình hiện tại chưa đạt độ chính xác tuyệt đối, việc kết hợp thêm các đặc trưng khác như chuyển động chuột hoặc thói quen gõ phím có thể tạo ra một mô hình tổng quát đủ mạnh để bảo vệ website khỏi scraper bot trong tương lai.
Nhà nghiên cứu cho biết sẽ tiếp tục chia sẻ các phát hiện mới trên blog cá nhân, với dự định sắp tới sẽ phân tích sâu về mẫu chuyển động chuột - một hướng đi hứa hẹn khác trong cuộc chiến chống bot thu thập dữ liệu.
Bài viết liên quan
Công nghệ
Ameliorate: Nền tảng cộng tác giải quyết vấn đề phức tạp bằng sơ đồ tư duy
20 tháng 8, 2026

Công nghệ
Google Discover sắp có tính năng tùy chỉnh feed bằng AI kiểu chatbot
20 tháng 8, 2026

Công nghệ
Bản đồ 2D vũ trụ lớn nhất từ trước đến nay: 5,6 nghìn tỷ pixel và gần 4 tỷ thiên thể
20 tháng 8, 2026