OpenAI dịch sai toán học thành mã code trong chứng minh Navier-Stokes
Một nhóm toán học tại Đại học Cambridge phát hiện OpenAI đã dịch sai bản chứng minh Navier-Stokes từ ngôn ngữ tự nhiên sang mã Lean, khiến hai phiên bản không khớp nhau. Sự việc đặt ra câu hỏi lớn về độ tin cậy của các kết quả toán học do AI tạo ra.

OpenAI dịch sai toán học thành mã code trong chứng minh Navier-Stokes
OpenAI được cho là đã mắc một lỗi tinh vi khi công bố bản chứng minh cho bài toán Navier-Stokes, theo cáo buộc từ một nhóm toán học. Lỗi này không có nghĩa bản chứng minh sai hay OpenAI chưa giải đúng bài toán, nhưng nó đặt dấu hỏi lớn về việc liệu các kết quả toán học do mô hình AI tạo ra có luôn đáng tin cậy hay không.
Theo Anders Hansen tại Đại học Cambridge, điều bắt buộc phải làm với mọi bản chứng minh do mô hình ngôn ngữ lớn (LLM) tạo ra là con người phải đọc lại chúng, và điều này tạo thêm gánh nặng khổng lồ cho giới toán học.
Chuyện gì đã xảy ra với chứng minh Navier-Stokes?
Ngày 8 tháng 9, OpenAI tuyên bố đã tìm ra lời giải cho bài toán Navier-Stokes, một trong những bài toán mở nổi tiếng nhất của toán học. Hãng công bố bản chứng minh dưới hai phiên bản: một viết bằng "ngôn ngữ tự nhiên" — tức kết hợp tiếng Anh và ký hiệu toán học như cách một nhà toán học con người vẫn viết — và một viết bằng ngôn ngữ lập trình Lean.
Minh họa chứng minh toán học do AI tạo ra
Bản Lean được kỳ vọng là bản hình thức hóa (formalisation) của bản ngôn ngữ tự nhiên, cho phép máy tính kiểm chứng một cách cơ học rằng mọi phát biểu logic trong đó đều đúng. Vấn đề là, theo Hansen và nhóm của ông, hai phiên bản này không khớp với nhau.
"Quá trình hình thức hóa này đang cố thay thế việc bình duyệt. Bình duyệt nghĩa là con người trực tiếp soi xét bản chứng minh. Nhưng điều chúng tôi chỉ ra trong bài báo này là kiểu tự động hình thức hóa bằng AI không thể phục vụ cùng mục đích đó." — Fabian Circelli, Đại học Cambridge
Cần nói rõ: nhóm nghiên cứu không khẳng định OpenAI thất bại trong việc giải bài toán Navier-Stokes. Hoàn toàn có thể cả bản ngôn ngữ tự nhiên lẫn bản Lean đều đưa ra lời giải đúng, giống như có hàng trăm cách chứng minh định lý Pythagoras hợp lệ. Điểm mấu chốt mà họ nêu ra tinh tế hơn: mô hình của OpenAI đã "dịch sai" khi chuyển sang Lean.
"Chúng tôi không nói bản chứng minh ngôn ngữ tự nhiên là sai. Chúng tôi cũng không nói nó đúng." — Anders Hansen
Vấn đề nằm ở chỗ OpenAI trình bày hai bản chứng minh như thể chúng giống hệt nhau, khi tuyên bố trên GitHub rằng kho lưu trữ này chứa các bản hình thức hóa bằng Lean 4 cho những kết quả được trình bày trong bài báo "Finite time blowup for Navier–Stokes".
Vì sao AI lại dịch sai?
Lỗi dịch xảy ra vì AI buộc phải tạo ra một bản Lean có thể "biên dịch" (compile), nghĩa là mã code hoàn toàn tự nhất quán và không sinh ra lỗi. Nếu trong quá trình tự động hình thức hóa, AI gặp một đoạn không biên dịch được, nó sẽ tìm cách lách qua — kể cả khi phải đi chệch khỏi bản chứng minh viết bằng ngôn ngữ tự nhiên.
Cáo buộc cụ thể của nhóm nghiên cứu xoay quanh phần được gọi là Bổ đề 8.6. Trong bản ngôn ngữ tự nhiên, một phương trình ở phần này yêu cầu một giá trị nào đó phải nhỏ hơn m + 4, với m là số nguyên. Trong bản Lean, giá trị tương ứng chỉ cần nhỏ hơn m + 5 — một điều kiện yếu hơn về mặt toán học.
Để dễ hình dung, hãy tưởng tượng bạn được yêu cầu giải phương trình x + 3 = 6, đáp án là x = 3. Có thể viết một chứng minh rằng x phải nhỏ hơn 4, và cũng có thể viết rằng x phải nhỏ hơn 5. Cả hai phát biểu toán học này đều hoàn toàn đúng, nhưng chúng nói những điều khác nhau. Chứng minh thứ hai cho phép nhiều đáp án khả dĩ hơn cho x, khiến nó yếu hơn về mặt toán học.
OpenAI phản hồi thế nào?
OpenAI nói với New Scientist rằng hãng biết về sự không khớp giữa bản ngôn ngữ tự nhiên và mã Lean, và điều này không có nghĩa bản chứng minh nào là không hợp lệ. Hãng cho biết sẽ chỉnh sửa mọi lỗi trong bản ngôn ngữ tự nhiên khi chúng được phát hiện, đồng thời tiếp tục quá trình hình thức hóa 722 bài báo toán học mà công ty vừa công bố trong tuần này. Chỉ một phần trong số đó đi kèm bản Lean, và ngay cả những bản Lean này cũng chưa được kiểm tra thủ công.
Chứng minh do AI tạo ra cho bài toán Navier-Stokes
Việc truy tìm điểm khác biệt diễn ra theo một quy trình có phần siêu thực: hỏi ChatGPT tìm các điểm không nhất quán tiềm ẩn giữa bản ngôn ngữ tự nhiên và bản Lean, rồi tự kiểm tra lại bằng tay. Rất nhiều điểm không nhất quán do ChatGPT gợi ý, sau khi xem xét, hóa ra lại nhất quán.
"Việc rà soát tất cả những thứ này bằng tay đúng là một cơn ác mộng." — Anders Hansen
Tổng cộng, nhóm mất khoảng hai tuần để xác định được một điểm khác biệt thực sự, so với 88 giờ mà OpenAI nói các tác tử (agent) của mình đã dành để tạo ra các bản chứng minh.
"OpenAI khoe khoang về việc họ tạo ra kết quả này nhanh đến mức nào, nhưng đó chỉ là một phần của quá trình." — Alexander Bastounis, King's College London
Điều này có ý nghĩa gì với giới toán học?
Câu hỏi liệu các mô hình AI có thể tự động hình thức hóa toán học một cách chính xác hay không là điều thiết yếu nếu các nhà toán học muốn tin tưởng vào những kết quả này. Nhóm của Hansen đã chứng minh rằng ChatGPT có thể tạo ra một bản Lean của bản chứng minh mà không khớp với bản ngôn ngữ tự nhiên gốc, trong đó AI âm thầm thay đổi lập luận logic để che giấu lỗi sai.
"Nó đang cố giúp tôi, nhưng chính vì thế mà nó không giúp gì cả." — Anders Hansen
Nếu điều này xảy ra với một bản chứng minh dài và phức tạp, sẽ rất khó để bất kỳ ai nhận ra mà không kiểm tra chi tiết cả hai phiên bản. Vấn đề càng cấp thiết hơn với lô 722 bài báo mà OpenAI vừa phát hành. Theo Hansen, nếu chúng ta nghĩ "tất cả những thứ này giờ đã đúng, việc cần làm chỉ là đọc bài báo", thì đó là một suy nghĩ nguy hiểm.
"Mục đích của việc làm khoa học là để nhân loại hiểu được thế giới vận hành ra sao, từ đó đưa ra những quyết định sáng suốt. Nếu chúng ta đánh mất sự hiểu biết đó, thì chúng ta đang làm gì?" — Anders Hansen
Kevin Buzzard tại Imperial College London lưu ý rằng trong những cuộc thảo luận như thế này, cần phân biệt rõ giữa phát biểu của một định lý và chứng minh của nó. Ví dụ, phát biểu của định lý lớn Fermat là: với các số nguyên dương a, b, c và n, aⁿ + bⁿ = cⁿ chỉ đúng khi n bằng 1 hoặc 2. Phát biểu này dễ chuyển sang Lean và dễ kiểm tra. Một khi bạn chắc chắn phát biểu trong Lean là đúng, và nếu chứng minh của phát biểu đó biên dịch được, bạn có thể yên tâm rằng chứng minh đó là đúng.
"Tôi tin rằng bài toán Navier-Stokes đã được giải quyết chính xác. Tôi kém tin tưởng hơn nhiều rằng bản chứng minh được mô tả trong file PDF là đúng." — Kevin Buzzard
Hansen nói ông hy vọng OpenAI sẽ xem xét công trình của nhóm một cách "hết sức nghiêm túc", và rằng cần nhiều nỗ lực hơn nữa để phát triển các kỹ thuật tự động hình thức hóa vững chắc. "Chúng ta đã có lời giải chưa? Chưa. Có thể làm điều này theo cách được kiểm soát không? Có, sẽ làm được, nhưng cách tối ưu và triệt để nhất thì hoàn toàn chưa rõ."
Góc nhìn cho độc giả Việt Nam
Câu chuyện này đáng chú ý với cộng đồng công nghệ và AI Việt Nam ở nhiều điểm. Thứ nhất, nó cho thấy giới hạn của các mô hình AI ngay cả trong lĩnh vực mà chúng tỏ ra ấn tượng nhất là toán học và suy luận logic. Thứ hai, nó nhấn mạnh vai trò không thể thay thế của con người trong việc kiểm chứng kết quả — một bài học quan trọng cho các doanh nghiệp và nhà phát triển đang tích hợp AI vào quy trình làm việc.
Khi các công cụ AI ngày càng được tin dùng để hỗ trợ viết code, phân tích dữ liệu hay thậm chí nghiên cứu khoa học, việc hiểu rõ cơ chế "lách lỗi" của mô hình — sẵn sàng đi chệch khỏi yêu cầu gốc để đạt được kết quả trông có vẻ hợp lệ — là kiến thức cần thiết. Đây cũng là động lực để các kỹ sư Việt Nam quan tâm hơn đến lĩnh vực AI an toàn và kiểm định chất lượng đầu ra của mô hình.
Tài liệu tham khảo: arXiv, DOI: 10.48550/arXiv.2610.08144
Bài viết liên quan

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Lean Theorem Prover: Khi AI viết chứng minh toán học và câu hỏi về độ tin cậy
09 tháng 10, 2026