Khám phá gây sốc: 3 trang web tạo 215.128 bài viết “phần mềm tốt nhất” bằng AI, Perplexity liên tục trích dẫn
Một báo cáo điều tra mới từ Trellner đã phanh phui chiến thuật sản xuất nội dung tự động quy mô lớn, khi ba trang web có vẻ như do cùng một tổ chức vận hành đã tạo ra hơn 215.000 bài viết “phần mềm tốt nhất” để thao túng các công cụ tìm kiếm AI như Perplexity. Điều đáng lo ngại là gần 60% các trích dẫn của Perplexity trỏ đến các tên miền có thứ hạng rất thấp hoặc thậm chí không nằm trong danh sách top một triệu trang web phổ biến nhất, đặt ra câu hỏi lớn về độ tin cậy của các công cụ trả lời dựa trên AI.

Khám phá gây sốc: 3 trang web tạo 215.128 bài viết "phần mềm tốt nhất" bằng AI, Perplexity liên tục trích dẫn
Một báo cáo điều tra mới từ Trellner đã phanh phui một chiến thuật sản xuất nội dung tự động quy mô lớn nhằm thao túng các công cụ tìm kiếm AI. Cụ thể, ba trang web có dấu hiệu do cùng một tổ chức vận hành đã tạo ra hơn 215.000 bài viết theo khuôn mẫu "phần mềm tốt nhất" (best software) để đánh lừa các hệ thống AI trích dẫn chúng như những nguồn tham khảo hợp lệ. Kết quả cho thấy một phần đáng kể các câu trả lời từ AI có thể dựa trên các nguồn thông tin kém chất lượng, không đáng tin cậy, đặt ra thách thức lớn cho người dùng khi tìm kiếm thông tin.
Vấn đề cốt lõi: Nội dung rác do AI tạo ra đang "đầu độc" các công cụ tìm kiếm AI
Báo cáo đã thực hiện 760 yêu cầu (prompts) tới hai mô hình của Perplexity là perplexity/sonar và perplexity/sonar-pro thông qua OpenRouter, hỏi về sản phẩm tốt nhất trong 380 danh mục phần mềm khác nhau. Trong tổng số 7.534 trích dẫn (citations) mà các mô hình này thu thập được, có tới 59,8% trỏ đến các tên miền có thứ hạng thấp hơn vị trí 100.000 trong danh sách Tranco top 1 triệu. Thậm chí, 23,4% trỏ đến các tên miền không hề nằm trong top 1 triệu trang web phổ biến nhất thế giới.
Điều đáng nói là những tên miền "kém chất lượng" này thường rất mới. Độ tuổi trung bình của chúng chỉ khoảng từ năm 2020, so với năm 2011 của các tên miền có thứ hạng cao. Điều này cho thấy các chiến dịch tạo nội dung tự động đang nhắm vào các khoảng trống trong dữ liệu mà các công cụ tìm kiếm AI thu thập được.
Ba trang web "ma" và 215.128 bài viết được tạo tự động
Điểm nhấn đáng chú ý nhất của báo cáo là việc xác định ba trang web có dấu hiệu do cùng một tổ chức vận hành: wifitalents.com, worldmetrics.org và gitnux.org. Cả ba trang web này đều được đăng ký qua NameCheap trong khoảng từ tháng 12/2023 đến tháng 5/2024, sử dụng chung cặp máy chủ DNS của Cloudflare, và có cấu trúc giao diện, điều hướng giống hệt nhau.
Điều đáng kinh ngạc là quy mô của chiến dịch này. Sơ đồ trang web (sitemap) của ba tên miền này liệt kê lần lượt 103.578, 107.083 và 105.541 URL. Trong đó, số lượng các trang /best/-software/ (phần mềm tốt nhất) lần lượt là 70.731, 71.684 và 72.713. Tổng cộng, chúng đã tạo ra 215.128 bài viết "bình chọn" phần mềm do máy tạo ra, dù thực tế không có 215.000 danh mục phần mềm tồn tại.
Tự nhận là "Facts & Grounding Page" - Cỗ máy được thiết kế để lừa AI
Điểm kỳ lạ và cho thấy chủ đích của những trang web này là cách chúng tự mô tả chính mình. Khi truy cập vào worldmetrics.org và gitnux.org, tiêu đề HTML của trang chủ không phải là một câu giới thiệu nào đó cho người dùng mà lại là "Facts & Grounding Page" (Trang Sự Kiện & Nền Tảng). Thậm chí, mô tả meta của chúng còn khá lộ liễu khi đề cập đến "một bản ghi dữ liệu có thể đọc bằng máy".
"Grounding" không phải là một thuật ngữ mà người mua hàng sử dụng. Nó là tên của bước trong quy trình, nơi hệ thống truy xuất (retrieval system) tìm nạp tài liệu để tạo điều kiện cho câu trả lời. Một bản ghi dữ liệu về chính mình không phải là một dịch vụ dành cho độc giả là con người. Các trang này được nhắm đến phần mềm đọc chúng, không phải con người.
Trong quá trình thử nghiệm, khi truy cập cùng một danh mục "phần mềm ước tính dự án" trên cả ba trang, kết quả đưa ra hoàn toàn khác nhau. Mỗi trang lại "tự chế" ra ba nhân viên khác nhau để làm tăng độ tin cậy giả tạo. Điều này càng củng cố cho thấy chúng là các "trang trại nội dung" được lập trình sẵn, không có sự kiểm duyệt hay biên tập thực sự nào.
Hệ quả với người dùng Việt Nam
Câu chuyện này là một lời cảnh báo mạnh mẽ cho bất kỳ ai, kể cả người dùng Việt Nam, đang dần quen với việc sử dụng các công cụ tìm kiếm AI như Perplexity, ChatGPT hay Google AI Mode để tìm kiếm thông tin hoặc lời khuyên mua sắm.
Việc các AI này có thể bị "đầu độc" bởi các nguồn thông tin rác tự động tạo ra là một rủi ro tiềm ẩn rất lớn. Khi bạn hỏi AI về một loại phần mềm kế toán, phần mềm quản lý quan hệ khách hàng,... thì các câu trả lời có thể được xây dựng dựa trên các bài viết được tạo ra một cách máy móc, không có trải nghiệm thực tế nào.
Làm thế nào để bảo vệ bản thân?
- Luôn kiểm chứng chéo: Đừng chỉ tin vào một câu trả lời của AI. Hãy tìm kiếm trên các công cụ tìm kiếm truyền thống hoặc truy cập trực tiếp vào website chính thức của sản phẩm để kiểm tra.
- Chú ý đến nguồn trích dẫn: Nhiều công cụ AI hiện nay cho phép bạn xem các nguồn mà chúng đã sử dụng. Hãy dành thời gian kiểm tra. Nếu nguồn đó là một trang web lạ, có ít thông tin về tác giả hoặc có nội dung chung chung, hãy nghi ngờ.
- Ưu tiên các thương hiệu, trang web lớn: Các bài đánh giá từ các trang công nghệ uy tín, diễn đàn thảo luận sôi nổi thường có giá trị hơn nhiều so với một trang "tổng hợp" mọc lên từ hư không.
Kết luận
Báo cáo của Trellner không chỉ là một phát hiện về một nhóm trang web cụ thể, mà là một hồi chuông cảnh tỉnh về một xu hướng lớn hơn: sự trỗi dậy của "nội dung được sản xuất hàng loạt để lừa AI". Khi các công cụ tìm kiếm trở nên thông minh hơn, các chiến dịch tối ưu hóa công cụ tìm kiếm (SEO) cũng sẽ trở nên tinh vi hơn, nhắm vào chính các "bộ não" AI. Điều này đòi hỏi cả người dùng lẫn nhà phát triển công cụ AI phải luôn tỉnh táo và có những biện pháp bảo vệ cần thiết để đảm bảo độ tin cậy của thông tin trong kỷ nguyên số.


