DAPO: Hệ thống học tăng cường mã nguồn mở của ByteDance Seed và Tsinghua AIR đạt đỉnh cao mới trên AIME 2024

Công nghệ20 tháng 9, 2026·6 phút đọc

ByteDance Seed hợp tác với Tsinghua AIR công bố DAPO — hệ thống học tăng cường (RL) mã nguồn mở hoàn chỉnh cho LLM quy mô lớn, bao gồm thuật toán, hạ tầng mã và bộ dữ liệu. DAPO đạt 50 điểm trên AIME 2024 với mô hình nền Qwen2.5-32B, vượt qua DeepSeek-R1-Zero-Qwen-32B chỉ với một nửa số bước huấn luyện.

DAPO: Hệ thống học tăng cường mã nguồn mở của ByteDance Seed và Tsinghua AIR đạt đỉnh cao mới trên AIME 2024

DAPO: Hệ thống học tăng cường mã nguồn mở của ByteDance Seed và Tsinghua AIR đạt đỉnh cao mới trên AIME 2024

ByteDance Seed vừa hợp tác cùng Tsinghua AIR (Viện Nghiên cứu Trí tuệ Nhân tạo thuộc Đại học Thanh Hoa) công bố DAPO — một hệ thống học tăng cường (Reinforcement Learning - RL) mã nguồn mở hoàn chỉnh dành cho các mô hình ngôn ngữ lớn (LLM) quy mô lớn.

Điểm nhấn đáng chú ý nhất: DAPO đạt 50 điểm trên bộ đề AIME 2024 khi huấn luyện trên mô hình nền Qwen2.5-32B, vượt qua kỷ lục trước đó của DeepSeek-R1-Zero-Qwen-32B chỉ với một nửa số bước huấn luyện. Đây là một bước tiến quan trọng trong lĩnh vực RL cho LLM, khi toàn bộ thuật toán, mã hạ tầng và bộ dữ liệu đều được chia sẻ công khai cho cộng đồng nghiên cứu.

DAPO là gì?

DAPO (viết tắt của Decoupled Clip and Dynamic sAmpling Policy Optimization) là một thuật toán học tăng cường mới được thiết kế để tối ưu hóa khả năng suy luận của LLM ở quy mô lớn.

Toàn bộ hệ thống được xây dựng dựa trên verl — một framework RL mã nguồn mở nổi tiếng của cộng đồng. Nhóm nghiên cứu đã công bố đầy đủ ba thành phần cốt lõi:

  • Thuật toán: Chi tiết về DAPO cùng các cải tiến so với các phương pháp RL hiện có
  • Hạ tầng mã nguồn: Toàn bộ code huấn luyện, đánh giá và suy luận
  • Bộ dữ liệu: DAPO-Math-17k dùng cho huấn luyện và AIME 2024 dùng cho kiểm định

DAPO - bài báo khoa họcDAPO - bài báo khoa học

Kết quả nổi bật: 50 điểm trên AIME 2024

AIME (American Invitational Mathematics Examination) là kỳ thi toán học danh giá dành cho học sinh trung học tại Mỹ, thường được dùng làm thước đo đánh giá khả năng suy luận toán học của các mô hình AI.

DAPO-Qwen-32B — mô hình được huấn luyện bằng thuật toán DAPO trên nền Qwen2.5-32B — đạt 50 điểm trên AIME 2024. Con số này không chỉ vượt qua DeepSeek-R1-Zero-Qwen-32B (SoTA trước đó) mà còn đạt được hiệu quả tương đương chỉ với 50% số bước huấn luyện.

Nói cách khác, DAPO không chỉ cho kết quả tốt hơn mà còn hiệu quả hơn về mặt tính toán — một yếu tố cực kỳ quan trọng khi chi phí huấn luyện LLM ngày càng tăng.

Giám sát chỉ số trong quá trình huấn luyện

Nhóm nghiên cứu đã công bố chi tiết các chỉ số giám sát trong quá trình huấn luyện, cho thấy DAPO duy trì được sự ổn định đáng kinh ngạc:

  • Độ dài phản hồi tăng ổn định: Cho phép mô hình khám phá nhiều hơn, từ đó học được các hành vi suy luận phức tạp — yếu tố góp phần trực tiếp vào sự ổn định và hiệu suất huấn luyện.
  • Điểm thưởng (reward) ổn định: Tín hiệu thưởng tăng đều cho thấy mô hình đang khớp tốt với phân phối huấn luyện, đảm bảo quá trình học không bị dao động mạnh.
  • Xu hướng entropy và xác suất trung bình: Entropy tăng có kiểm soát sau giai đoạn giảm ban đầu giúp cân bằng giữa khám phá (exploration)khai thác (exploitation) — tránh overfitting hoặc quá ngẫu nhiên.

Chỉ số đánh giá DAPOChỉ số đánh giá DAPO

Tính tái lập: Điểm cộng lớn cho cộng đồng nghiên cứu

Điều khiến DAPO khác biệt so với nhiều công bố nghiên cứu khác là mức độ tái lập (reproducibility) cực cao. Nhóm nghiên cứu cung cấp:

  • Script huấn luyện sẵn dùng (out-of-the-box) để tái tạo kết quả
  • Hai phiên bản: một bản rút gọn (không có Token-level PG Loss & Dynamic Sampling) đạt 44 điểm AIME, và một bản đầy đủ đạt 50 điểm
  • Ghi lại toàn bộ quá trình huấn luyện trên wandb để cộng đồng có thể theo dõi từng bước
  • Hướng dẫn chi tiết về chuẩn bị dữ liệu, huấn luyện và đánh giá

Cả hai script đều đã được kiểm chứng trên phiên bản verl mới nhất, đảm bảo kết quả có thể tái lập bởi bất kỳ ai.

Cách sử dụng mô hình DAPO-Qwen-32B

Nhóm nghiên cứu cung cấp mã suy luận (inference) hoàn chỉnh sử dụng vLLM để tăng tốc:

import torch
from transformers import AutoTokenizer
from vllm import SamplingParams, LLM

model = "BytedTsinghua-SIA/DAPO-Qwen-32B"
tokenizer = AutoTokenizer.from_pretrained(model)
llm = LLM(
model=model,
dtype=torch.bfloat16,
tensor_parallel_size=8,
gpu_memory_utilization=0.95
)
sampling_params = SamplingParams(temperature=1.0, top_p=0.7, max_tokens=20480)

Mô hình yêu cầu cấu hình 8 GPU với chế độ song song tensor (tensor parallelism). Với người dùng Việt Nam quan tâm đến nghiên cứu RL, đây là cơ hội tốt để tiếp cận một hệ thống hoàn chỉnh — từ thuật toán đến hạ tầng — mà không cần xây dựng từ đầu.

Để đánh giá trên AIME 2024, nhóm nghiên cứu triển khai qua Ray Serve kết hợp vLLM:

serve run eval.llm:build_app model=BytedTsinghua-SIA/DAPO-Qwen-32B tensor-parallel-size=8
python eval/eval_aime24.py --temperature 1.0 --top_p 0.7 --max_tokens 20480 \
--model BytedTsinghua-SIA/DAPO-Qwen-32B --test_file eval/aime-2024.parquet

Ý nghĩa với cộng đồng AI Việt Nam

Việc một hệ thống RL quy mô lớn như DAPO được mở hoàn toàn — từ thuật toán, mã nguồn đến dữ liệu — có ý nghĩa đặc biệt với các nhóm nghiên cứu và kỹ sư AI tại Việt Nam.

Thứ nhất, các nhóm thiếu nguồn lực tính toán lớn vẫn có thể nghiên cứu và tinh chỉnh DAPO trên các mô hình nhỏ hơn, rút ngắn khoảng cách với các phòng thí nghiệm hàng đầu thế giới.

Thứ hai, bộ dữ liệu DAPO-Math-17k có thể được dùng làm nền tảng để xây dựng các bộ dữ liệu tiếng Việt tương tự, phục vụ việc huấn luyện mô hình suy luận toán học bằng tiếng Việt.

Thứ ba, các kỹ thuật như Token-level PG LossDynamic Sampling trong DAPO có thể được áp dụng cho nhiều bài toán RL khác ngoài toán học — từ lập trình, logic đến ra quyết định trong môi trường thực tế.

Nhóm nghiên cứu cho biết các thí nghiệm mã nguồn mở được thực hiện trên nền tảng Volcano Engine Machine Learning Platform và hứa hẹn sẽ cung cấp hướng dẫn tái lập đầy đủ trên nền tảng này trong thời gian tới.

Kết luận

DAPO đánh dấu một bước tiến quan trọng trong lĩnh vực học tăng cường cho LLM: không chỉ đạt kết quả SoTA mà còn mở hoàn toàn để cộng đồng có thể tái lập và mở rộng. Với sự tham gia của ByteDance Seed và Tsinghua AIR, đây là minh chứng cho xu hướng ngày càng rõ ràng: các phòng thí nghiệm hàng đầu đang chuyển từ công bố kết quả sang công bố toàn bộ quy trình.

Với các nhà nghiên cứu và kỹ sư AI Việt Nam, DAPO là một tài nguyên quý giá để học hỏi, thử nghiệm và xây dựng các ứng dụng RL cho các bài toán đặc thù của Việt Nam.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗