ProVer: Giải bài toán gán điểm thưởng cho GRPO mà không cần đánh giá từng bước

Công nghệ02 tháng 10, 2026·3 phút đọc

Một nhóm nghiên cứu đề xuất ProVer, khung phương pháp giúp GRPO xác định đúng những quyết định then chốt trong quá trình huấn luyện tác tử AI. Thay vì đánh giá mọi trạng thái trung gian, ProVer chỉ kiểm chứng những phân đoạn nghi ngờ có ảnh hưởng tới kết quả, giúp cải thiện hiệu năng lên tới 9,91% so với GRPO trên các mô hình Qwen3.5.

ProVer: Giải bài toán gán điểm thưởng cho GRPO mà không cần đánh giá từng bước

Trong huấn luyện các tác tử (agent) dựa trên mô hình ngôn ngữ lớn, một trong những bài toán khó nhất là gán điểm thưởng (credit assignment) — tức xác định chính xác quyết định nào ở bước giữa đã đóng góp vào thành công hay thất bại cuối cùng. Một nhóm nghiên cứu vừa công bố phương pháp ProVer nhằm giải quyết điểm yếu này của thuật toán GRPO, theo bài báo trên arXiv.

GRPO và điểm yếu cố hữu

Group Relative Policy Optimization (GRPO) đang là hướng tiếp cận được ưa chuộng để huấn luyện tác tử AI. Tuy nhiên, GRPO áp dụng cùng một mức lợi thế (advantage) cho toàn bộ chuỗi hành động, khiến mọi token chính sách đều nhận mức thưởng như nhau bất kể chúng quan trọng hay không.

Hệ quả là mô hình không phân biệt được đâu là quyết định mang tính bước ngoặt, đâu chỉ là thao tác phụ. Điều này làm mờ đi thông tin về việc bước trung gian nào thực sự dẫn đến thành công — một vấn đề nan giải khi tác tử phải thực hiện nhiều bước suy luận.

ProVer hoạt động như thế nào?

Thay vì đánh giá toàn bộ quỹ đạo hay duyệt qua mọi trạng thái trung gian, ProVer tiếp cận theo hướng chọn lọc để kiểm chứng:

  • Với một nhóm rollout, một bộ đánh giá tác tử (agentic judge) so sánh các quỹ đạo thành công và thất bại để đề xuất một phân đoạn có khả năng gây ra khác biệt về kết quả.
  • Thay vì tin tưởng tuyệt đối vào phán đoán của bộ đánh giá, ProVer xác minh lại phân đoạn đó bằng cách ước lượng lợi thế từ chênh lệch tỷ lệ thành công đầu cuối giữa các phần tiếp nối của chính sách hiện tại, lấy mẫu trước và sau phân đoạn.
  • Những ước lượng dương sau đó được đưa vào mức lợi thế GRPO cho các token chính sách nằm trong phân đoạn được đề xuất.

Điểm mấu chốt: mô hình chỉ dùng phán đoán để chọn nơi cần kiểm chứng, còn điểm thưởng cục bộ vẫn được neo vào kết quả quan sát thực tế — không cần đánh giá vét cạn mọi trạng thái trung gian.

Kết quả thực nghiệm

Nhóm tác giả thử nghiệm ProVer trên ba môi trường: ALFWorld, WebShop và SearchQA. Kết quả cho thấy ProVer đạt hiệu năng trung bình cao nhất ở cả hai quy mô mô hình:

  • Mức cải thiện tương đối so với GRPO là 9,91% trên Qwen3.5-2B.
  • Mức cải thiện tương đối là 7,12% trên Qwen3.5-4B.

Đáng chú ý, các phân tích bổ sung cho thấy việc chọn phân đoạn thông minh giúp cải thiện huấn luyện chính sách với chi phí sinh thêm vừa phải — ngay cả khi không dùng một mô hình đánh giá quy mô lớn (frontier-scale). Điều này khẳng định tính hiệu quả và tiết kiệm của hướng tiếp cận nhắm trúng các quyết định then chốt.

Ý nghĩa với cộng đồng AI

Với các nhóm nghiên cứu và kỹ sư đang xây dựng tác tử AI tại Việt Nam, ProVer mở ra một hướng thực dụng: không cần tài nguyên khổng lồ để đánh giá từng bước, mà chỉ tập trung vào những điểm có khả năng tạo ra khác biệt. Cách tiếp cận này đặc biệt phù hợp với các dự án huấn luyện tác tử trong điều kiện hạn chế về GPU và ngân sách tính toán.

Bài báo nằm trong lĩnh vực Xử lý ngôn ngữ tính toán (cs.CL) và Trí tuệ nhân tạo (cs.AI), với sự tham gia của các tác giả đến từ nhiều tổ chức nghiên cứu, trong đó có Jaron Lanier — tên tuổi quen thuộc trong giới khoa học máy tính.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗