UniEvo-VL: Phương pháp tự chưng cất giúp mô hình đa phương thức tự nâng cấp chính mình
Các nhà nghiên cứu giới thiệu UniEvo-VL, một khung huấn luyện tự tiến hóa cho mô hình đa phương thức, trong đó mô hình vừa đóng vai giáo viên vừa đóng vai học sinh dựa trên chính những lời tự phê bình của nó. Cách tiếp cận này giúp nâng điểm GenEval từ 0.747 lên 0.808 mà không cần đến một mô hình giáo viên bên ngoài.

Các mô hình đa phương thức hiện đại đang ngày càng có xu hướng hợp nhất khả năng sinh nội dung và hiểu nội dung vào cùng một hệ thống. Chính sự hợp nhất này mở ra một hướng đi mới: để mô hình tự học từ phản hồi do chính nó tạo ra. Một nhóm nghiên cứu vừa công bố trên arXiv một phương pháp mang tên UniEvo-VL, hứa hẹn biến ý tưởng đó thành hiện thực.
Tự chưng cất thay vì cần giáo viên bên ngoài
Điểm cốt lõi của UniEvo-VL nằm ở chỗ nó không cần một mô hình giáo viên riêng biệt, thường là lớn hơn và tốn kém hơn, để dạy cho mô hình học sinh. Thay vào đó, cùng một mô hình đa phương thức sẽ đảm nhận cả hai vai trò, nhưng trong những ngữ cảnh khác nhau.
- Học sinh chỉ nhìn thấy câu hỏi gốc, không có thêm thông tin gì.
- Giáo viên được cung cấp thêm phần tự phê bình của mô hình, đóng vai trò như thông tin đặc quyền.
Quá trình huấn luyện sau đó sẽ tối thiểu hóa sai lệch giữa phân phối khử nhiễu của hai vai trò này, tính trên chính các quỹ đạo lấy mẫu của học sinh. Nói cách khác, mô hình học cách rút ngắn khoảng cách giữa phiên bản "chưa suy nghĩ kỹ" và phiên bản "đã tự soi xét lại" của chính mình.
Cách làm này được gọi là on-policy self-distillation — tự chưng cất theo chính sách hiện hành, tức là học ngay trên dữ liệu do mô hình tự sinh ra trong quá trình suy luận.
Kết quả đáng chú ý trên GenEval
Nhóm tác giả xây dựng UniEvo-VL dựa trên mô hình mã nguồn mở Qwen-image-2512 và ghi nhận những cải thiện rõ rệt:
- Điểm GenEval tăng từ 0.747 lên 0.808.
- Điểm GenEval2 Soft-TIFA tăng từ 32.97 lên 35.53.
Đáng chú ý hơn, khi thử nghiệm với những mô hình phê bình mạnh hơn từ bên ngoài, ví dụ một hệ thống được gọi là GPT5.6-Luna, nhóm nghiên cứu nhận thấy các mô hình đa phương thức có khả năng đánh giá tốt sẽ đạt được "trần tự tiến hóa" cao hơn. Điều này gợi ý rằng chất lượng của năng lực tự phê bình tỉ lệ thuận với tốc độ và giới hạn cải thiện của mô hình.
Tuy nhiên, kết quả cũng cho thấy sự cải thiện không đồng đều. Với các tác vụ liên quan đến hiển thị văn bản hỗn hợp, mức tiến bộ khiêm tốn hơn hẳn so với các tác vụ sinh ảnh thông thường.
Vì sao hướng nghiên cứu này quan trọng
UniEvo-VL nằm trong dòng nghiên cứu tự cải thiện đệ quy đang rất được quan tâm hiện nay. Ý tưởng trung tâm là để mô hình tự nâng cao năng lực mà không cần dữ liệu gán nhãn mới hay sự giám sát từ bên ngoài.
Mục tiêu của nghiên cứu là làm sáng tỏ dòng nghiên cứu tự cải thiện đệ quy đang nóng hiện nay, nhằm nâng cao trải nghiệm người dùng khi sử dụng mô hình đa phương thức mà không cần giám sát hay hướng dẫn từ bên ngoài.
Đối với cộng đồng phát triển AI tại Việt Nam, đây là hướng tiếp cận đáng theo dõi. Các startup và nhóm nghiên cứu trong nước thường gặp hạn chế về hạ tầng tính toán, nên những phương pháp không cần mô hình giáo viên cồng kềnh như UniEvo-VL có thể giúp tiết kiệm đáng kể chi phí huấn luyện và tinh chỉnh.
Những điểm cần lưu ý
Dù kết quả tích cực, phương pháp này vẫn còn một số hạn chế cần cân nhắc:
- Hiệu quả phụ thuộc nhiều vào chất lượng tự phê bình của chính mô hình.
- Cải thiện không đồng đều giữa các loại tác vụ khác nhau.
- Cần thêm kiểm chứng trên các mô hình và bộ dữ liệu đa dạng hơn ngoài Qwen-image-2512.
Bài báo mang mã arXiv:2609.38721, thuộc lĩnh vực Trí tuệ nhân tạo và Thị giác máy tính, do Fang Wu cùng 18 tác giả khác thực hiện, trong đó có những tên tuổi quen thuộc như Jure Leskovec và Yejin Choi. Toàn bộ nội dung chi tiết đã được công bố công khai trên arXiv để cộng đồng nghiên cứu tham khảo.
Bài viết liên quan

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
AnyPS5: Dự án đưa game PS5 lên PC không cần giả lập, đã ánh xạ 87% thư viện hệ thống
06 tháng 10, 2026