Vì sao chúng ta vẫn chưa thực sự hiểu cách con người dùng AI?
Các báo cáo về cách sử dụng AI từ các công ty như Anthropic hay OpenAI thường chỉ tiết lộ dữ liệu có lợi cho họ, thiếu góc nhìn độc lập. Dự án AI Observatory mới ra mắt đã tổng hợp và phân tích hàng nghìn cuộc trò chuyện thực tế từ người dùng, hé lộ những khác biệt lớn giữa các mô hình cũng như các hành vi nhạy cảm mà các báo cáo chính thức thường bỏ qua. Điều này đặt ra thách thức cho các nhà hoạch định chính sách và nghiên cứu trong việc đánh giá đúng tác động của AI.

Vì sao chúng ta vẫn chưa thực sự hiểu cách con người dùng AI?
Các gã khổng lồ AI như OpenAI hay Anthropic thường xuyên công bố báo cáo về cách người dùng tương tác với ChatGPT hay Claude, nhưng các nhà nghiên cứu cho rằng những dữ liệu này chỉ phản ánh một phần có chủ đích. Để lấp đầy khoảng trống đó, một nhóm nghiên cứu từ Stanford và MIT đã xây dựng AI Observatory – một nền tảng độc lập phân tích các cuộc trò chuyện thực tế với AI, nhằm cung cấp góc nhìn toàn diện hơn cho giới nghiên cứu và hoạch định chính sách.
AI Observatory là dự án mới do Anka Reuel, nghiên cứu sinh Tiến sĩ tại Stanford Trustworthy AI Research (STAIR) Lab, đồng dẫn dắt. Mục tiêu của dự án là tổng hợp và phân tích các cuộc trò chuyện thực tế giữa người dùng với các chatbot phổ biến như Claude, Gemini hay ChatGPT, dựa trên dữ liệu được thu thập đồng thuận từ bảy bộ dữ liệu có sẵn.
"Hiện tại không có nguồn dữ liệu độc lập nào để đối chứng với các báo cáo từ công ty AI," Reuel chia sẻ. "Các bên liên quan đang đưa ra những quyết định hệ trọng về lợi ích và rủi ro của AI dựa trên dữ liệu rất hạn chế."
Những điểm mù trong báo cáo từ các công ty AI
Chỉ số Kinh tế Anthropic là một trong những nguồn dữ liệu được trích dẫn nhiều nhất về cách dùng Claude, nhưng nó có những hạn chế rõ ràng. Chỉ số này tập trung vào các mục đích công việc và năng suất, đồng nghĩa với việc loại bỏ các cuộc trò chuyện không liên quan đến lao động.
Khi nhóm AI Observatory áp dụng cùng phương pháp của Anthropic vào bộ dữ liệu của họ, kết quả cho thấy 48% cuộc trò chuyện bị lọc ra. Điều đáng chú ý là trong số các hội thoại bị loại này, tỷ lệ nội dung liên quan đến sức khỏe và các mối quan hệ lên tới 44,2% (so với 31,2% trong phân tích của Anthropic), trong khi tỷ lệ nội dung quấy rối và thù ghét là 27,5% (so với 5,66% được Anthropic ghi nhận). Các chủ đề về nội dung người lớn và tình dục cũng xuất hiện nhiều hơn đáng kể.
Điều này cho thấy các báo cáo từ công ty AI thường tập trung vào việc sử dụng AI trong công việc, làm lu mờ các hình thức sử dụng cá nhân và nhạy cảm khác.
Sự khác biệt lớn giữa các mô hình AI
Dữ liệu thu thập từ năm 2023 đến 2025 cho thấy hành vi sử dụng AI rất khác nhau giữa các nền tảng:
- Người dùng thường dùng Grok và Gemini để tra cứu thông tin. Đáng chú ý, Grok rất phổ biến cho tin tức và chính trị, nhưng cũng là nơi tin giả tập trung nhiều nhất.
- Claude được ưa chuộng cho nhu cầu lập trình và coding.
- Gemini nổi bật trong các tương tác xã hội và nhập vai.
- ChatGPT thường được sử dụng để hỗ trợ làm bài tập.
Ngoài ra, nghiên cứu còn phát hiện sự khác biệt ngay trong các phiên bản của cùng một mô hình. Chẳng hạn, người dùng có xu hướng trò chuyện ngắn gọn hơn với ChatGPT chạy GPT-3.5, nhưng với phiên bản GPT-4o, các cuộc trò chuyện trở nên dài hơn và lặp lại nhiều hơn – điều này khớp với các nghiên cứu trước đó về việc phiên bản này dễ dẫn đến “nghiện” cảm xúc.
Xu hướng thay đổi theo thời gian
Các cuộc trò chuyện trong bộ dữ liệu WildChat – một trong những bộ dữ liệu lớn nhất được phân tích – ngày càng dài và phức tạp hơn theo thời gian, thể hiện qua sự gia tăng của số token trong lời nhắc, phản hồi và số lượt hội thoại.
Một phát hiện thú vị khác là lượng tán gẫu (small talk) tăng đáng kể theo thời gian, cho thấy xu hướng “bầu bạn” với AI ngày càng phổ biến. Đồng thời, các trợ lý AI có xu hướng tự nhận mình là chatbot ít hơn.
Mặt tích cực là các tương tác nhạy cảm – bao gồm quấy rối tình dục và ngôn từ thù ghét – có xu hướng giảm, cho thấy các nền tảng đang triển khai biện pháp kiểm soát hiệu quả hơn.
Giới hạn và tương lai của nghiên cứu độc lập
Mặc dù AI Observatory đã tổng hợp 24.521 cuộc trò chuyện với 85.633 lượt tương tác từ 5.000 người dùng trên 52 mô hình AI khác nhau, con số này vẫn chỉ là “muối bỏ bể” so với dữ liệu mà các công ty lớn nắm giữ. Chỉ số Kinh tế Anthropic mới nhất dựa trên 1 triệu cuộc trò chuyện Claude, trong khi báo cáo của OpenAI phân tích 1,5 triệu cuộc trò chuyện.
Ngoài ra, vì dữ liệu được thu thập dựa trên sự đồng thuận tự nguyện từ người dùng, các hành vi nhạy cảm có thể bị đánh giá thấp hơn thực tế, do người dùng ít khi chia sẻ những cuộc trò chuyện đó. Các nhà nghiên cứu cũng thừa nhận rằng phát hiện của họ không đại diện cho toàn bộ bức tranh sử dụng AI.
"Không một báo cáo công ty nào kể được toàn bộ câu chuyện," Shayne Longpre, nghiên cứu sinh Tiến sĩ tốt nghiệp MIT Media Lab, đồng dẫn dắt nghiên cứu, nhận định.
Vì sao điều này quan trọng với Việt Nam?
Khi AI ngày càng phổ biến tại Việt Nam – từ học tập, giải trí đến sản xuất – các nhà nghiên cứu, doanh nghiệp và nhà quản lý cần hiểu rõ cách người dùng thực sự tương tác với công nghệ này. Nếu chỉ dựa vào các báo cáo từ công ty, các quyết định đầu tư và chính sách có thể sai lệch, bỏ qua những rủi ro tiềm ẩn cũng như cơ hội phát triển bền vững.
AI Observatory hy vọng sẽ mở rộng bộ dữ liệu theo thời gian và giúp các nhà nghiên cứu độc lập tiếp cận nguồn thông tin đáng tin cậy hơn. Như Reuel nhấn mạnh, nếu không có dữ liệu độc lập, các quyết định dựa trên cách sử dụng AI hiện nay giống như “đang đi trong rừng rậm mà không biết điều gì đang thực sự xảy ra ngoài những câu chuyện mà các công ty kể”.


