AI thất bại trước những bài kiểm tra trí thông minh này — bạn có làm tốt hơn không?

26 tháng 8, 2026·7 phút đọc

Trong khi AI đang tiến bộ vượt bậc trong việc giải câu đố, các mô hình ngôn ngữ lớn vẫn mắc lỗi ở các bài kiểm tra không gian, tư duy trừu tượng và trực giác. Bài viết tổng hợp những câu đố từng làm khó AI, mời bạn đọc thử tài và khám phá sự khác biệt giữa nhận thức của máy móc và con người.

AI thất bại trước những bài kiểm tra trí thông minh này — bạn có làm tốt hơn không?

AI thất bại trước những bài kiểm tra trí thông minh này — bạn có làm tốt hơn không?

Câu đố và trò chơi luôn là trung tâm của quá trình phát triển AI ngay từ những ngày đầu tiên. Cũng giống như con người thích thử thách trí não qua ô chữ hay các bài logic, các nhà phát triển có thể đo lường sự tiến bộ của mô hình qua một chuỗi các trò chơi thử thách. Thuật ngữ "machine learning" (học máy) đã được phổ biến vào năm 1959 bởi nhà khoa học máy tính Arthur Samuel trong một bài báo về thuật toán học chơi cờ đam. Cờ vua và cờ vây cũng là những "bãi thử" AI nổi tiếng không kém.

Xét riêng về khả năng giải đố, AI đang cải thiện rất nhanh. Cuối năm 2024, một nhóm nhà khoa học từ Đại học Columbia cho thấy ngay cả những mô hình tốt nhất cũng chỉ giải được 18% câu đố nổi tiếng Connections của tờ New York Times; đến đầu năm 2025, một số mô hình đã gần như giải đúng hoàn toàn mỗi lần thử.

Nhưng câu đố không chỉ đơn thuần làm nổi bật sự tiến bộ của AI. Việc nhìn ra nơi mô hình thành công và thất bại — cũng như nơi con người vẫn vượt trội — cung cấp một góc nhìn hữu ích về điểm mạnh và điểm yếu của công nghệ này. Bất chấp những tiến bộ, các mô hình hiện nay vẫn chật vật: những thay đổi tinh tế trong các câu đố cổ điển thường khiến chúng mắc bẫy, và các câu đố trực quan là điểm yếu đặc biệt.

Hình ảnh minh họa bài kiểm tra trí thông minh của AIHình ảnh minh họa bài kiểm tra trí thông minh của AI

Suy luận không gian (Spatial Reasoning)

Hãy bắt đầu với một lĩnh vực mà con người có lợi thế lớn: suy luận không gian. Nếu từng làm bài kiểm tra IQ, bạn có thể đã gặp các bài toán xoay hình tưởng tượng (mental rotation). Những câu hỏi này yêu cầu xác định xem các hình ảnh khác nhau có phải là cùng một vật thể nhìn từ các góc độ khác nhau hay không.

Dù các mô hình ngôn ngữ hiện nay thường có khả năng phân tích đầu vào hình ảnh, chúng vẫn thất bại thảm hại ở những bài toán này. Dù người ta nói nhiều về việc "world model" có thể giúp AI hiểu môi trường vật lý, các mô hình ngôn ngữ lớn (LLM) dường như vẫn không thể xử lý vật thể 3D theo cách mà những người có tư duy không gian như kiến trúc sư hay kỹ sư cơ khí có thể làm được.

Hướng dẫn: Chọn đáp án thể hiện vật thể trong đề bài, nhưng nhìn từ một góc khác. Trong mỗi trường hợp, chỉ có một đáp án đúng duy nhất.

Trí nhớ và khả năng thích ứng (Memory & Adaptability)

Các LLM hàng đầu có trí nhớ phi thường — chúng được tiếp xúc với một khối lượng dữ liệu khổng lồ trong quá trình huấn luyện và có thể tái hiện trung thực nhiều sự kiện. Đó là lợi thế khi so tài kiến thức với con người, nhưng đôi khi cũng là điểm yếu. Khi một câu đố giống hệt một câu hỏi mà mô hình từng thấy trong lúc huấn luyện, mô hình có thể bỏ qua các khác biệt quan trọng và trả lời theo những gì đã ghi nhớ.

Điều này từng được chứng minh trong một nghiên cứu năm 2024, khi các nhà nghiên cứu từ Google và Đại học Illinois Urbana-Champaign huấn luyện và kiểm tra mô hình trên các biến thể nhỏ của một loại câu đố kinh điển tên là Knights and Knaves (Hiệp sĩ và Kẻ nói dối). Trong các bài toán này, một số nhân vật luôn nói thật, số khác luôn nói dối, và bạn phải tìm ra ai là ai. Nguyên tắc tương tự cũng xuất hiện trong bài kiểm tra SimpleBench — những câu hỏi này trông giống các vấn đề phức tạp mà mô hình có thể gặp trong huấn luyện. Con người nhanh chóng nhận ra mẹo, nhưng ngay cả các mô hình mạnh nhất cũng vấp ngã.

Suy luận trừu tượng và thị giác (Abstract & Visual Reasoning)

AI không chỉ gặp khó với các vấn đề thị giác 3D — hai chiều cũng khiến chúng bối rối. Điều này là yếu tố chính ảnh hưởng đến kết quả của các mô hình trên chuẩn đánh giá câu đố nổi tiếng nhất mang tên ARC-AGI. Những bài toán này yêu cầu suy ra các quy tắc trừu tượng, tổng quát từ một loạt các ví dụ. Các mô hình làm tốt hơn khi nhận mỗi lưới không phải dưới dạng hình ảnh mà là một chuỗi số mã hóa màu của từng ô.

Nghiên cứu cho thấy ngay cả khi các mô hình trả lời đúng các câu hỏi ARC-AGI, chúng thường làm vậy bằng các quy tắc phức tạp và không khái quát hóa được, trong khi con người dựa trên các khái niệm trực quan đơn giản. Dù có những bất lợi này, các mô hình đã trở nên khá giỏi về ARC-AGI trong năm qua, nhưng một số câu đố — như câu dưới đây — vẫn làm chúng bó tay.

Hướng dẫn: Nghiên cứu ba cặp lưới dưới đây để tìm ra quy tắc biến đổi từ bên trái sang bên phải. Sau đó, hãy dùng bút màu điền vào lưới thứ tư theo quy tắc đó.

Hình ảnh bộ câu đố ARC-AGI làm khó AIHình ảnh bộ câu đố ARC-AGI làm khó AI

Trực giác (Intuition)

Không chỉ mô hình AI mới rơi vào bẫy. Con người cũng có những sai lầm nhận thức riêng, nhiều trong số đó AI không mắc phải. Các nhà tâm lý học đã thiết kế những bộ câu hỏi đảo ngược hiện tượng SimpleBench: với những câu này, con người thường đưa ra câu trả lời theo phản xạ, còn mô hình lại trả lời một cách thận trọng, suy nghĩ kỹ lưỡng. Một số câu hỏi khai thác các lỗi trong cách chúng ta tính toán trực quan; số khác được diễn đạt gợi ý câu trả lời hiển nhiên nhưng sẽ sai nếu đọc kỹ.

Vòng thi tốc độ — hãy trả lời càng nhanh càng tốt:

  • Trong một hang động, có một đàn dơi mà số lượng tăng gấp đôi mỗi ngày. Nếu mất 60 ngày để hang động đầy dơi, thì cần bao nhiêu ngày để hang đầy một nửa?
  • Trong cuốn tiểu thuyết nổi tiếng nào, Alice nói "Tôi trễ, tôi trễ, vì một cuộc hẹn rất quan trọng"?

Độ phức tạp tăng dần (Increasing Complexity)

Trong một số trường hợp, việc LLM có giải được câu đố hay không chỉ là vấn đề quy mô. Một nghiên cứu của các nhà nghiên cứu Apple phát hiện rằng LLM làm tốt các phiên bản đơn giản của bài toán Tháp Hà Nội (di chuyển một chồng đĩa, mỗi lần một cái, không bao giờ đặt đĩa lớn lên đĩa nhỏ) và các bài toán qua sông. Nhưng chỉ đến một giới hạn: khi số đĩa hoặc số người từ sáu trở lên, các mô hình bắt đầu sai.

Trong một nghiên cứu khác tại Đại học Washington, Stanford và Viện AI Allen, các nhà nghiên cứu quan sát thấy LLM gặp khó tương tự với câu đố logic dạng lưới, yêu cầu suy ra thuộc tính của một nhóm người từ danh sách các manh mối. Bài báo của Apple từng gây sốt, nhưng các nhà bình luận đặt câu hỏi liệu kết quả đó có phản ánh giới hạn duy nhất của lý luận LLM — hay chỉ đơn giản là việc mắc lỗi là bình thường khi độ phức tạp tăng lên.

Lời kết

Không chỉ AI rơi vào bẫy, con người cũng có những giới hạn nhận thức riêng. Những câu đố này không chỉ là trò giải trí — chúng là cửa sổ nhìn vào cách máy móc và con người tư duy khác nhau. Nếu bạn giải được tất cả, bạn đã chứng minh rằng mình có thể đánh bại AI trong trò chơi trí tuệ — ít nhất là ở thời điểm hiện tại.

Grace Huckins là phóng viên AI tại MIT Technology Review, có bằng tiến sĩ khoa học thần kinh.

Minh họa sự khác biệt giữa tư duy AI và con ngườiMinh họa sự khác biệt giữa tư duy AI và con người

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗