Khảo sát: 1/3 trích dẫn của Perplexity không chứa số liệu mà nó được trích dẫn
Một cuộc kiểm toán độc lập trên 1.826 trích dẫn từ hai mô hình tìm kiếm của Perplexity cho thấy 34,7% trỏ tới các trang không mở được hoặc không chứa bất kỳ con số nào trong câu được trích dẫn. Tỷ lệ thất bại tính theo từng tuyên bố là 14,4%, đặt ra câu hỏi lớn về độ tin cậy của các công cụ AI trả lời dựa trên nguồn dẫn.

1/3 trích dẫn của Perplexity không chứa số liệu mà nó được trích dẫn
Một cuộc kiểm tra độc lập với hơn 1.800 trích dẫn từ hai mô hình tìm kiếm AI của Perplexity đã phát hiện ra lỗ hổng nghiêm trọng trong hệ thống trích dẫn: hơn một phần ba số trích dẫn trỏ tới các trang web không mở được cho người đọc thông thường hoặc không hề chứa con số nào trong câu mà chúng được dùng để chứng minh. Điều này làm dấy lên nghi ngờ về độ tin cậy của các công cụ trả lời được hỗ trợ bởi AI trong việc cung cấp nguồn dẫn chính xác.
Vấn đề không nằm ở liên kết chết
Theo báo cáo của Haus Research, khi đặt 310 câu hỏi thực tế về 210 công ty công nghệ cho hai mô hình tìm kiếm của Perplexity, họ đã thu thập được 2.511 dấu trích dẫn. Trong số 1.826 trích dẫn gắn với các câu chứa số liệu cụ thể, có tới 34,7% trỏ tới một trang web mà người đọc bình thường không thể truy cập (bị chặn bởi tường phí, yêu cầu đăng nhập hoặc lỗi) hoặc trang mở được nhưng không chứa bất kỳ con số nào trong câu đó.
Điều đáng chú ý là lỗi này không chủ yếu đến từ các liên kết chết. Chỉ có 1,3% URL được trích dẫn là hỏng hoàn toàn. Thay vào đó, hai loại lỗi lớn nhất là các trang không thể truy cập (16,1%) và các trang mở được nhưng không chứa thông tin được trích dẫn (một phần lớn trong số 78,7% trang còn lại).
Ví dụ điển hình: Wikipedia bị "gán" địa chỉ không có thật
Báo cáo đã chỉ ra một mô hình lặp lại: khi được hỏi về trụ sở chính của các công ty, cả hai mô hình của Perplexity đều cung cấp một địa chỉ đường phố cụ thể và gán nó cho bài viết Wikipedia của công ty đó. Tuy nhiên, khi kiểm tra trực tiếp, bốn bài viết Wikipedia (của Docker, Rippling, Substack và SentinelOne) đều không hề chứa số nhà, tên đường hoặc mã bưu điện được trích dẫn, dù chúng mở bình thường.
Một ví dụ khác là khi được hỏi về giá của gói trả phí rẻ nhất của Vercel, sonar trả lời rằng "gói miễn phí Hobby là $0/tháng, vì vậy gói trả phí đầu tiên bắt đầu ở mức $20/tháng" và trích dẫn trang vercel.com/docs/plans. Trang này thực sự mở được và nêu tên các gói, nhưng chuỗi "$20" không xuất hiện ở bất kỳ đâu trên trang đó. Con số có thể đúng, nhưng trích dẫn không phải là bằng chứng cho nó.
Các lĩnh vực thất bại nặng nhất
Khi phân tích theo loại câu hỏi, tỷ lệ trích dẫn chứa số liệu chính xác thấp nhất thuộc về các câu hỏi về CEO hiện tại (chỉ 44,3% trích dẫn chứa thông tin đúng) và địa chỉ trụ sở chính (53,0%). Trong khi đó, các câu hỏi về số lượng nhân viên và năm thành lập có tỷ lệ thành công cao hơn nhiều (82,0% và 75,0%). Lý do được đưa ra là những thông tin như ngày bắt đầu nhiệm kỳ CEO hay số nhà thường không được ghi chép ở một nguồn chuẩn duy nhất, khiến mô hình phải "suy luận" từ các nguồn không chính thức và sau đó gán sai nguồn.
"Một tuyên bố có thể đúng nhưng kèm theo trích dẫn sai, và hầu hết các trường hợp này là như vậy. Chúng tôi không đo lường liệu Perplexity có đúng hay không. Chúng tôi đo lường liệu thứ mà nó đưa ra làm bằng chứng có hoạt động như bằng chứng hay không." - Haus Research
GPT-4.1 và sự khác biệt về phương pháp
Đáng chú ý, GPT-4.1 với plugin web chỉ trích dẫn trung bình 2,0 nguồn cho mỗi câu trả lời, so với 9,8 của Perplexity. Tuy nhiên, GPT-4.1 không sử dụng dấu trích dẫn nội dòng, khiến cho việc kiểm tra từng tuyên bố là không thể. Theo các tác giả, điều này tự nó là một phát hiện: một câu trả lời có danh sách tham khảo ở cuối thì không thể được kiểm toán từng câu một.
Hệ sinh thái trang web "được tạo ra để được tìm thấy"
Một phát hiện đáng lo ngại khác là nguồn trích dẫn ngày càng phụ thuộc vào các trang web hướng dữ liệu B2B như Tracxn, PitchBook, ZoomInfo... Chúng chiếm tới 23,1% tổng số trích dẫn. Những trang này thường được tạo ra hàng loạt để phục vụ SEO và có thể bị gỡ xuống bất cứ lúc nào. Việc kiểm tra 1.500 URL trên Wayback Machine cho thấy 25,1% trong số đó chưa bao giờ được lưu trữ, và con số này lên tới 39,3% đối với các trang dạng thư mục.
Trong bối cảnh "AI trả lời có trích dẫn" ngày càng phổ biến tại Việt Nam và toàn cầu, nghiên cứu này là một lời cảnh báo quan trọng: người dùng nên kiểm tra kỹ các nguồn được trích dẫn, vì không phải lúc nào chúng cũng chứng minh được những gì AI tuyên bố.