Đừng để bị lừa: Mô hình ngôn ngữ lớn không hề biết suy luận

Công nghệ02 tháng 10, 2026·9 phút đọc

Cựu thành viên nhóm AlphaGo tại DeepMind lập luận rằng các mô hình ngôn ngữ lớn như ChatGPT chỉ đang hoạt động ở chế độ "trực giác" (System 1) chứ không thực sự suy luận. Ông kêu gọi một kiến trúc AI mới dựa trên cách AlphaGo tư duy để tạo ra những hệ thống thực sự đáng tin cậy.

Đừng để bị lừa: Mô hình ngôn ngữ lớn không hề biết suy luận

Đừng để bị lừa: Mô hình ngôn ngữ lớn không hề biết suy luận

Vào một buổi chiều tại Seoul tháng 3 năm 2016, Thore Graepel – thành viên nòng cốt của nhóm AlphaGo tại DeepMind – chứng kiến chương trình mình góp phần xây dựng đặt một quân cờ vào hàng thứ năm của bàn cờ vây. Nước đi thứ 37 trong ván thứ hai của trận đấu năm ván trông đến mức vô lý, khiến nhiều bình luận viên tưởng đó là lỗi lập trình.

Nó không phải lỗi. AlphaGo đã thắng ván đó, và cuối cùng giành chiến thắng chung cuộc 4-1 trước Lee Sedol, một trong những kỳ thủ cờ vây chuyên nghiệp vĩ đại nhất mọi thời đại. Sau trận đấu, Lee Sedol nói: “Tôi tưởng AlphaGo hoạt động dựa trên tính toán xác suất và nó chỉ là một cỗ máy. Nhưng khi thấy nước đi này, tôi đã đổi ý. Chắc chắn AlphaGo có sự sáng tạo.”

Câu chuyện này thường được kể như biểu tượng của “trực giác máy”. Nhưng theo chính Graepel, đó là một sự hiểu lầm tai hại – và hiểu lầm này đang định hình sai lệch cả một thế hệ AI hiện đại.

AlphaGo khác gì máy tính cờ vua thế hệ cũ?

Khi Deep Blue đánh bại Garry Kasparov năm 1997, nó thắng nhờ nhìn trước sáu đến tám nước đi cho mỗi bên và đánh giá 200 triệu thế cờ mỗi giây, dựa trên các luật do con người lập trình cứng.

Cờ vây phức tạp hơn nhiều. Giá trị của một quân cờ phụ thuộc vào cách các nhóm quân và lãnh thổ ở xa nhau diễn biến qua hàng chục nước đi. Muốn tính dù chỉ một phần nhỏ các kết cục khả dĩ cũng cần siêu máy tính chạy hàng tỷ năm. Để thắng, AlphaGo buộc phải “cảm nhận” thế trận trong nháy mắt và thậm chí phát minh ra những nước đi mà chưa con người nào từng nghĩ tới.

Hai hệ thống trong một bộ não

AlphaGo được cấu thành từ hai hệ thống:

  • Mạng chính sách (policy network): được huấn luyện để đoán nước đi mà một kỳ thủ mạnh sẽ chọn. Phần “trực giác” này đánh giá nước 37 là không có gì đặc biệt – xác suất chỉ khoảng 1/10.000 nếu do một kỳ thủ chuyên nghiệp thực hiện.
  • Cơ chế tìm kiếm (search machinery): vượt qua tính hợp lý trước mắt để cân nhắc hệ quả tương lai, xây dựng và duyệt một cây trò chơi với hàng nghìn nhánh, mỗi nhánh là một tương lai khả dĩ.

Sự phân chia này tương ứng với lý thuyết nổi tiếng của Daniel Kahneman về hai chế độ tư duy của con người:

  • Hệ thống 1: nhanh, theo bản năng, không tốn sức.
  • Hệ thống 2: chậm rãi, từng bước, có cân nhắc.

Mạng nơ-ron cung cấp linh cảm, còn cơ chế tìm kiếm cung cấp sự cân nhắc. Chỉ trực giác thì không bao giờ chọn nước 37, còn tìm kiếm vét cạn thì khó lòng sàng lọc hết các nước đi khả dĩ.

Vì sao mô hình ngôn ngữ lớn không suy luận?

Điểm khác biệt căn bản so với AI ngày nay nằm ở chỗ: mô hình ngôn ngữ lớn chỉ đoán token tiếp theo, lặp đi lặp lại. Đó chính là Hệ thống 1 – nhanh, theo liên tưởng, hoàn thành mẫu đáng ngạc nhiên giỏi ở gần như mọi chủ đề.

Không lâu sau khi ChatGPT ra mắt, giới nghiên cứu nhận ra rằng chỉ trôi chảy ngôn ngữ là chưa đủ hữu ích. Giải pháp được cho là khả thi: cho mô hình “cân nhắc” bằng cách sinh ra các bước trung gian để phân rã vấn đề, mang theo kết quả từng phần và ảnh hưởng tới suy luận tiếp theo – gọi là chuỗi tư duy (chain of thought). Thành tựu này là thật, đặc biệt trong toán học và lập trình.

Nhưng khác với cơ chế tìm kiếm của AlphaGo, chuỗi tư duy không tạo ra một cơ chế suy luận độc lập thực sự: phần lý luận trung gian vẫn do cùng một quá trình đoán token sinh ra, chỉ được lặp lâu hơn trước khi mô hình chốt đáp án.

Có ba hạn chế khiến những gì chatbot làm không thể coi là suy luận theo nghĩa mà một nhà khoa học công nhận:

  1. Không có trạng thái nhận thức rõ ràng, bền vững và có thể kiểm tra. Không có một sổ cái mở ghi lại các giả thuyết đang cân nhắc, mức độ tin cậy, bằng chứng đang được đánh giá và những câu hỏi chưa có lời giải.
  2. Không tách bạch giữa cái hệ thống biết và cách nó thao tác trên kiến thức đó. Kiến thức và suy luận đan xen không thể tách rời trong trọng số mạng nơ-ron – không có tập niềm tin độc lập được biểu diễn tường minh.
  3. Chuỗi tư duy thường được “chế” ra sau khi đã có đáp án. Nghiên cứu đã chứng minh các mô hình đôi khi đi đến kết luận bằng một con đường nhưng lại báo cáo một con đường khác.

Vì sao điều này quan trọng với y tế, kỹ thuật và khoa học?

Trong các ứng dụng rủi ro cao mà ai cũng quan tâm – y học, kỹ thuật, nghiên cứu khoa học – điều quan trọng không chỉ là hệ thống kết luận gì, mà còn là nó đi đến kết luận đó bằng cách nào.

Khi sai sót xảy ra, ví dụ trong chẩn đoán và điều trị y khoa, ta cần chỉ ra chính xác cái gì đã hỏng: lập luận của hệ thống sai, nó dựa vào bằng chứng không hợp lệ, hay nó đưa ra giả định sai?

Đây là lý do Thore Graepel gần đây rời vị trí tại Google DeepMind. Ông tin rằng cần một cách tiếp cận mới cho suy luận máy, lấy cảm hứng từ chính kiến trúc AlphaGo.

Bài học từ “cây trò chơi” và trạng thái nhận thức

AlphaGo duy trì một bản ghi về những gì nó biết về thế cờ: cây trò chơi (game tree). Cấu trúc dữ liệu này chứa mọi biến thể, mọi tương lai khả dĩ mà AlphaGo đã xem xét, mỗi nước đi và thế cờ đều được chú thích bằng đánh giá của mạng nơ-ron. Khi quá trình suy luận tiến triển, AlphaGo cập nhật cây trò chơi và cuối cùng tổng hợp thông tin để quyết định nước đi.

Với suy luận tổng quát, hệ thống cũng nên duy trì một trạng thái nhận thức (epistemic state) biểu diễn những gì hệ thống coi là đã chắc chắn, những gì còn nghi ngờ, những gì đã loại trừ, và những câu hỏi còn bỏ ngỏ. Khi đó, suy luận có thể được hiểu là chuỗi các bước làm thay đổi trạng thái nhận thức nhằm tiến triển tri thức và giảm bất định: suy diễn hệ quả, chia vấn đề thành phần, và – quan trọng nhất – quyết định câu hỏi nào cần hỏi, phép tính nào cần làm, thí nghiệm nào cần chạy tiếp theo.

Tất nhiên, suy luận trong thế giới mở khó hơn chơi cờ vây hay cờ vua. Trạng thái hiện tại chỉ được biết một phần, tập hành động khả dụng lớn và thay đổi liên tục, hệ quả của hành động mang tính ngẫu nhiên hoặc chưa biết. Nhưng những tiến bộ gần đây của LLM và các mô hình nơ-ron khác đã cho chúng ta khả năng đối mặt với các bài toán suy luận tổng quát như vậy. Ví dụ, LLM có thể gợi ý cách xử lý vấn đề dựa trên kiến thức và nguồn lực sẵn có, tương tác với công cụ qua API hoặc mã nguồn, và hỗ trợ đánh giá liệu một tuyên bố có được bằng chứng ủng hộ hay không.

Nguyên tắc cốt lõi: trung thực và kiểm toán được

Để giữ hệ thống trung thực, một bộ phận độc lập của hệ thống phải đánh giá mỗi bước đi dựa trên mức độ nó thực sự giải quyết được bất định, chỉ cập nhật niềm tin khi thay đổi đó được bằng chứng hậu thuẫn. Khi các quy tắc này được thực thi, mô hình có thể tích lũy tri thức đã được chứng thực và cải thiện chính sách suy luận của mình bằng cách học từ những trải nghiệm suy luận trong quá khứ.

Có thể hình dung một hệ thống như vậy như phương pháp khoa học được tăng cường, với mục đích tạo ra tri thức có thể chịu được sự soi xét.

Kết luận: Quy mô không tạo ra suy luận

Tác giả khẳng định ông không tin chúng ta đạt được trí tuệ máy đáng tin cậy bằng cách làm Hệ thống 1 to hơn. Mở rộng quy mô làm trực giác sắc bén hơn, nhưng không khiến trực giác trở nên có tính cân nhắc.

Nước đi 37 quan trọng vì một cỗ máy đã giữ một lập trường, cân nhắc các tương lai khả dĩ, và chọn nước đi mà bản năng nhân tạo của nó có lẽ sẽ bác bỏ. Xã hội cần những “nước đi sáng tạo” như vậy trong phát triển thuốc, vật liệu, khí hậu, chẩn đoán – những lĩnh vực mà bàn cờ trông chẳng giống bàn cờ vây chút nào và không ai đưa sẵn luật chơi.

Chúng ta chỉ có thể đạt được những hiểu biết đó từ các hệ thống thực sự biết suy luận – những hệ thống mà kết luận của chúng xuất phát từ một chuỗi bằng chứng, suy diễn và điều chỉnh niềm tin có thể kiểm toán được, chứ không phải từ một câu chuyện hấp dẫn được kể lại sau khi đã có đáp án.

Thore Graepel là chủ nhiệm ngành học máy tại Đại học College London. Ông từng là thành viên nòng cốt của nhóm AlphaGo tại DeepMind.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗