Hiện tượng 'grokking': Khi AI bỗng nhiên 'ngộ' ra chân lý sau hàng nghìn vòng huấn luyện
Một phát hiện kỳ lạ trong học máy mang tên 'grokking' đang thu hút sự chú ý của giới nghiên cứu. Hiện tượng này cho thấy mô hình AI có thể đột ngột hiểu ra quy luật ẩn sau dữ liệu, rất lâu sau khi quá trình huấn luyện tưởng chừng đã bão hòa.
Trong lĩnh vực học máy (machine learning), có một hiện tượng kỳ lạ và thú vị mang tên grokking — thuật ngữ được lấy cảm hứng từ tiểu thuyết khoa học viễn tưởng "Stranger in a Strange Land" của Robert Heinlein, nghĩa là "thấu hiểu một cách sâu sắc".
Hiện tượng này mô tả một điều tưởng chừng phi logic: một mô hình AI có thể đột ngột "hiểu" ra quy luật của bài toán, sau khi đã trải qua hàng nghìn, thậm chí hàng chục nghìn vòng huấn luyện mà trước đó dường như chỉ học vẹt.
Grokking là gì?
Thông thường, khi huấn luyện một mô hình học máy, chúng ta quan sát thấy:
- Độ chính xác trên tập huấn luyện (training accuracy) tăng dần theo thời gian.
- Độ chính xác trên tập kiểm tra (validation accuracy) cũng tăng tương ứng.
Nhưng với grokking, câu chuyện diễn ra khác hẳn. Mô hình có thể đạt độ chính xác gần như tuyệt đối trên tập huấn luyện, trong khi độ chính xác trên tập kiểm tra vẫn lẹt đẹt ở mức gần như đoán mò. Mọi thứ tưởng như đã bão hòa, và lẽ ra người kỹ sư nên dừng lại.
Thế rồi, sau rất nhiều vòng huấn luyện nữa — đôi khi lên tới hàng chục nghìn epoch — độ chính xác trên tập kiểm tra bỗng nhiên tăng vọt, đôi khi lên tới gần 100%.
Mô hình chuyển từ trạng thái "học vẹt" sang trạng thái "thực sự hiểu" quy luật. Hiện tượng này lần đầu được ghi nhận trong một bài báo năm 2022 của các nhà nghiên cứu tại OpenAI và được đặt tên là grokking.
Vì sao điều này quan trọng?
Phát hiện này có ý nghĩa sâu sắc đối với cách chúng ta hiểu về quá trình học của mô hình AI:
- Thời điểm dừng huấn luyện (early stopping) có thể là một sai lầm. Nếu dừng quá sớm khi độ chính xác kiểm tra đang đi ngang, ta có thể bỏ lỡ giai đoạn "bùng nổ" sắp tới.
- Điều này thách thức quan niệm truyền thống rằng mô hình đã đạt giới hạn năng lực của nó.
- Grokking cho thấy các mô hình học sâu có thể tồn tại ở hai chế độ học khác nhau: ghi nhớ (memorization) và khái quát hóa (generalization), với một quá trình chuyển đổi đột ngột giữa chúng.
Những yếu tố ảnh hưởng đến grokking
Các nhà nghiên cứu đã xác định một số yếu tố có thể thúc đẩy hoặc kìm hãm hiện tượng này:
- Kích thước tập dữ liệu: Grokking thường xuất hiện rõ hơn khi dữ liệu huấn luyện nhỏ so với năng lực của mô hình.
- Trọng số suy giảm (weight decay): Đây là một kỹ thuật điều chuẩn (regularization) giúp mô hình tránh học vẹt. Mức độ regularization càng cao, grokking càng dễ xảy ra.
- Kiến trúc mô hình: Các mô hình Transformer và MLP nhỏ thường được dùng để nghiên cứu hiện tượng này.
Ý nghĩa đối với giới phát triển AI
Với cộng đồng phát triển và nghiên cứu trí tuệ nhân tạo, grokking mang đến bài học quý giá:
- Đừng vội kết luận một mô hình đã "hết tiềm năng" chỉ vì chỉ số hiệu suất đang đi ngang.
- Việc theo dõi biểu đồ huấn luyện trong thời gian dài, đặc biệt là các mô hình nhỏ chạy trên bài toán có cấu trúc logic, có thể tiết lộ những bước nhảy vọt bất ngờ.
- Hiện tượng này cũng gợi mở các hướng nghiên cứu về việc điều khiển quá trình chuyển đổi từ ghi nhớ sang khái quát hóa một cách chủ động hơn.
Lời kết
Grokking vẫn còn là một hiện tượng chưa được hiểu đầy đủ, nhưng nó nhắc nhở chúng ta rằng học sâu không phải là một quá trình tuyến tính, dễ đoán. Đôi khi, điều bất ngờ nhất lại đến từ những gì ta tưởng chừng đã bỏ qua.
Với những ai đang huấn luyện mô hình tại Việt Nam hay bất cứ đâu, thông điệp khá đơn giản: hãy kiên nhẫn, và đừng dừng lại quá sớm — biết đâu mô hình của bạn đang trên đà "ngộ đạo".
Bài viết liên quan

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Reddit có vấn đề astroturfing? Dữ liệu từ các hội nhóm dao bếp nói lên điều gì
28 tháng 9, 2026