LittleLearner: Khi mô hình ngôn ngữ chỉ được 'học' kiến thức lớp 5 sẽ ra sao?

16 tháng 8, 2026·5 phút đọc

Dự án LittleLearner từ nhóm nghiên cứu quốc tế đã tạo ra một 'phòng thí nghiệm có kiểm soát' bằng cách huấn luyện các mô hình ngôn ngữ lớn (LLM) từ đầu trên một kho dữ liệu chỉ gồm kiến thức tiểu học (K–5) theo chuẩn Common Core của Mỹ. Kết quả cho thấy các phương pháp như tăng kích thước mô hình, tinh chỉnh (post-training) hay học trong ngữ cảnh chỉ giúp khuếch đại những gì mô hình đã thấy, chứ không thể vượt qua 'trần' kiến thức được đặt ra từ khâu tiền huấn luyện. Công trình này mở ra hướng nghiên cứu mới về ranh giới tri thức của AI, học liên tục và khoa học giáo dục.

LittleLearner: Chiếc lồng kiến thức 'lớp 5' và bài toán về giới hạn thực sự của AI

Trong bối cảnh các mô hình ngôn ngữ lớn (LLM) hiện đại được nhồi nhét vô số dữ liệu, gần như không thể xác định một kỹ năng nào đó của chúng là do học được hay chỉ đơn thuần là được 'đánh thức' từ kho dữ liệu khổng lồ. Một nhóm nghiên cứu quốc tế vừa công bố dự án LittleLearner, một thử nghiệm được kiểm soát chặt chẽ nhằm giải mã câu hỏi quan trọng này. Bằng cách huấn luyện các mô hình từ con số 0 trên một kho dữ liệu chỉ bao gồm chương trình tiểu học (từ lớp mẫu giáo đến lớp 5), họ đã tạo ra một 'đứa trẻ AI' và quan sát xem nó có thể vượt qua tầm hiểu biết của một học sinh lớp 5 hay không.

Dự án được thiết kế như thế nào?

Nhóm nghiên cứu đã tạo ra một kho dữ liệu mang tên LittleCurriculum, chứa 88 tỷ token (token - đơn vị dữ liệu của mô hình ngôn ngữ) được lọc từ bộ dữ liệu FineWeb-Edu. Việc lọc dữ liệu được thực hiện qua một quy trình 5 giai đoạn, nghiêm ngặt tuân theo chuẩn chương trình giảng dạy Common Core của Mỹ cho bậc K–5 (từ mẫu giáo đến lớp 5). Các khái niệm, sự kiện và từ vựng có độ khó trên lớp 5 bị loại bỏ hoàn toàn.

Từ nguồn dữ liệu này, họ huấn luyện ba phiên bản mô hình với quy mô khác nhau (0.6B, 1.3B và 5B tham số). Điểm mấu chốt là họ cũng tạo ra các mô hình 'đối chứng' với kiến trúc, token và công thức huấn luyện y hệt nhưng được huấn luyện trên bộ dữ liệu chưa qua lọc. Điều này tạo ra một cặp thí nghiệm hoàn hảo để so sánh.

Phát hiện chính: Học hỏi hay chỉ là ngụy tạo?

Kết quả nghiên cứu cho thấy một thực tế thú vị nhưng cũng không kém phần thách thức cho những ai tin vào sức mạnh của việc 'bồi dưỡng' AI.

  • Tăng quy mô mô hình (Scaling): Khi tăng kích thước mô hình, hiệu suất trong phạm vi kiến thức K–5 được cải thiện rõ rệt và có thể lan tỏa nhẹ sang các vấn đề có cùng 'quỹ đạo học tập'. Tuy nhiên, khả năng này gần như không có tác dụng với các bài toán đòi hỏi kiến thức vượt mức lớp 5.
  • Tinh chỉnh sau huấn luyện (Post-training): Việc áp dụng các kỹ thuật như SFT (Supervised Fine-Tuning) và đặc biệt là GRPO (Group Relative Policy Optimization) giúp tăng cường đáng kể kỹ năng giải toán trong chương trình K–5. Tuy nhiên, nó hoàn toàn không thể thu hẹp khoảng cách với các kiến thức hiện có trong dữ liệu huấn luyện ngoài phạm vi. Điều này tương đương với việc một học sinh giỏi vẫn không thể trả lời các câu hỏi của lớp trên nếu chưa từng được học.
  • Học trong ngữ cảnh (In-context learning - ICL): Với mô hình 5B của họ, việc đưa ra các prompt (lời nhắc) gợi ý khác nhau cũng không thể kích hoạt các khả năng suy luận vốn nằm ngoài dữ liệu huấn luyện K–5.

Ý tưởng chủ đạo: "Khuếch đại, không phải thu nhận"

Điểm cốt lõi trong kết luận của nhóm nghiên cứu là khái niệm "elicitation, not acquisition" (tạm dịch: khơi gợi, không phải học thu nhận). Giáo sư Wieland Brendel và các cộng sự đưa ra giả thuyết rằng các kỹ thuật tinh chỉnh, dù tinh vi đến đâu, cũng chỉ có thể khuếch đại những gì mô hình đã được 'dạy' trong giai đoạn tiền huấn luyện.

"Việc lọc dữ liệu trong giai đoạn tiền huấn luyện (pretraining) đặt ra một 'trần' năng lực tuyệt đối cho mô hình."

Nhóm nghiên cứu nhấn mạnh điều đó là ranh giới hiệu quả tối thượng (capability ceiling) - thứ quyết định toàn bộ khả năng của mô hình, và các phương pháp tối ưu hóa khác chỉ xoay quanh cái trần đó.

Tại sao điều này quan trọng và có ý nghĩa gì với Việt Nam?

Với các nhà phát triển AI trong nước, nghiên cứu này mang đến một bài học sâu sắc về nguồn dữ liệu. Các công ty start-up thường không có đủ nguồn lực tính toán như OpenAI hay Google, nên việc tối ưu hóa dữ liệu là vô cùng quan trọng. Câu hỏi đặt ra là: Nếu một LLM Việt Nam chỉ được huấn luyện trên một kho văn bản tiếng Việt 'nông' (ví dụ: quá nhiều nội dung giải trí, tin tức ngắn), liệu nó có thể xử lý tốt các tác vụ chuyên sâu thuộc lĩnh vực pháp lý hay y tế không? Câu trả lời từ LittleLearner là không, nếu dữ liệu "lõi" không nằm trong tập dữ liệu gốc.

LittleLearner mở ra một hướng nghiên cứu mới: sử dụng các mô hình có ranh giới kiến thức được xác định rõ để nghiên cứu về học liên tục (continual learning) - nơi một mô hình có thể được 'cho biết' về khái niệm mới (ví dụ như số âm) và đo lường hiệu quả học tập, hoặc nghiên cứu về khoa học giáo dục để so sánh cách học của máy với trẻ em con người.

Nếu bạn quan tâm đến việc thử nghiệm, nhóm tác giả đã cung cấp bản demo chat trực tiếp ngay trên trình duyệt web của họ. Bạn có thể đặt câu hỏi và quan sát xem AI sẽ trả lời một cách tự tin như học sinh lớp 5, hoặc tệ hơn, là 'bịa chuyện' (hallucination) khi được hỏi về những chủ đề vượt quá tầm hiểu biết của nó.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗