Dust: Phương pháp tiền huấn luyện transformer không cần lan truyền ngược

Công nghệ05 tháng 10, 2026·7 phút đọc

Dust là phương pháp bậc không (zeroth-order) đầu tiên có thể cạnh tranh với lan truyền ngược khi tiền huấn luyện mô hình ngôn ngữ transformer. Bằng cách nhiễu loạn activation độc lập tại từng token, Dust đạt hiệu quả cao hơn hàng nghìn lần so với các phương pháp tiến hóa chiến lược truyền thống. Đáng chú ý, các mô hình lớn hơn lại sử dụng population hiệu quả hơn, mở ra hướng đi mới cho việc huấn luyện AI trong kỷ nguyên dư thừa compute.

Dust: Phương pháp tiền huấn luyện transformer không cần lan truyền ngược

Dust: Tiền huấn luyện transformer không cần lan truyền ngược

Trong nhiều thập kỷ, lan truyền ngược (backpropagation) là thuật toán duy nhất có thể huấn luyện các mạng nơ-ron hiện đại, bao gồm cả mô hình ngôn ngữ dựa trên transformer. Toàn bộ kiến trúc, optimizer và phần cứng của deep learning đều được thiết kế xoay quanh ràng buộc này. Nhưng khi lượng compute sẵn có trên thế giới ngày càng tăng, liệu chúng ta có thể thay thế nó bằng một phương pháp tổng quát hơn, dựa nhiều vào tính toán thô và ít vào cấu trúc giải tích?

Bài nghiên cứu mới từ qlabs.sh trình bày Dust — phương pháp bậc không (zeroth-order) đầu tiên có thể cạnh tranh với lan truyền ngược trong việc tiền huấn luyện mô hình ngôn ngữ transformer. Đây là bước đi táo bạo đặt câu hỏi liệu lợi thế của backprop chỉ là đặc trưng của kỷ nguyên compute thấp, và liệu trong tương lai dư thừa compute, các phương pháp tìm kiếm brute-force có thể vượt qua nó.

Dust hoạt động như thế nào?

Điểm khác biệt cốt lõi của Dust so với các phương pháp chiến lược tiến hóa (Evolution Strategies - ES) truyền thống nằm ở không gian tìm kiếm. Thay vì nhiễu loạn trọng số (weights) như EGGROLL hay các phương pháp ES khác, Dust nhiễu loạn activation — cụ thể là đầu ra của mỗi lớp linear — một cách độc lập tại từng token.

Điều này tạo ra một khái niệm mà nhóm nghiên cứu gọi là "virtual population" (quần thể ảo). Trong khi phương pháp ES truyền thống cần một lượt forward pass cho mỗi thành viên của quần thể, Dust biến mỗi token trong câu thành một thành viên. Một chuỗi transformer có thể chứa hàng nghìn token, nghĩa là chỉ một lượt forward pass đã đánh giá được hàng nghìn thành viên song song — nhiều hơn ít nhất ba bậc độ lớn so với ES trên trọng số.

Cơ chế cụ thể gồm ba bước:

  • Thêm nhiễu Gaussian vào đầu ra của mỗi lớp linear, độc lập tại từng token
  • Chạy forward pass, tính mức giảm loss tại mỗi token để làm phần thưởng (reward) cho nhiễu đó
  • Lấy trung bình nhiễu có trọng số thưởng trên nhiều lần rút mẫu để ước lượng gradient

Với đầu ra lớp $y_t = W x_t$, gradient trọng số được tính bằng tích ngoài của sai số ước lượng tại đầu ra và đầu vào lớp — cùng công thức mà backprop sử dụng, chỉ khác ở chỗ sai số đến từ quần thể thay vì từ quy tắc chuỗi.

Minh họa phương pháp Dust với nhiễu loạn activation tại từng tokenMinh họa phương pháp Dust với nhiễu loạn activation tại từng token

Vượt qua backprop ở quy mô lớn

Kết quả thực nghiệm đáng chú ý nhất là Dust không chỉ tiệm cận mà còn vượt qua backprop trong một số cấu hình. Nhóm nghiên cứu huấn luyện transformer kiểu GPT trên tập FineWeb với ngân sách token từ 100K đến 20 triệu, quét quần thể từ 64 đến 16K.

Tại 100K và 1 triệu token, Dust kết thúc với loss thấp hơn backprop. Tại 10 triệu và 20 triệu token, khoảng cách thu hẹp dần khi quần thể tăng. Đặc biệt ở 20 triệu token, đường cong power law của Dust vẫn đang giảm ở 16K draws và ước tính giới hạn đạt 4.431 — thấp hơn con số 4.633 của backprop. Nhóm nghiên cứu thận trọng cho rằng đây là bằng chứng khoảng cách tiếp tục thu hẹp, chứ chưa phải giới hạn đo được.

So với ES trên trọng số, hiệu quả của Dust gây ấn tượng mạnh. EGGROLL với quần thể 16K vẫn không đạt được mức của Dust chỉ với 64 draws. Ước tính cho thấy Dust hiệu quả hơn EGGROLL từ $10^3$ đến $10^4$ lần kể từ mốc 1 triệu token.

Nghịch lý: Mô hình lớn hơn lại hiệu quả hơn

Một trong những phát hiện thách thức quan niệm truyền thống là các mô hình lớn hơn thường sử dụng quần thể hiệu quả hơn, không phải kém hơn. Quan điểm phổ biến cho rằng phương pháp bậc không không thể huấn luyện mạng lớn vì phương sai của ước lượng gradient tăng theo số chiều bị nhiễu loạn.

Nhóm nghiên cứu kiểm chứng điều này bằng cách huấn luyện bốn kích thước mô hình — 2M, 7M, 38M và 243M tham số, tức khoảng cách 120 lần — với cùng 10 triệu token. Kết quả:

  • Từ quần thể 256 trở lên, loss giảm dần từ 2M lên 7M rồi 38M tham số, mô hình 243M chỉ kém chút ít
  • Mô hình 243M tham số — lớn hơn 120 lần so với mô hình nhỏ nhất — đạt hiệu suất tương đương hoặc tốt hơn ở mọi mức quần thể
  • Các mô hình nhỏ bão hòa sớm, trong khi mô hình lớn tiếp tục cải thiện khi quần thể tăng

Cách hiểu mới về overparameterization: mô hình lớn hơn đồng nghĩa với không gian tìm kiếm lớn hơn và có thể có hình học loss landscape được điều kiện hóa tốt hơn — đó là lý do tìm kiếm trở nên hiệu quả hơn ngay cả ở quần thể nhỏ.

Gradient tiệm cận backprop theo cách tích cực

Nhóm nghiên cứu đo cosine similarity giữa ước lượng của Dust và gradient backprop trên cùng một batch, trên các checkpoint huấn luyện bằng backprop trải từ 10 triệu đến 1 tỷ token. Kết quả cho thấy cosine tăng theo quần thể với mọi loại lớp và mọi giai đoạn huấn luyện, tuân theo quy luật hai tham số:

$$\cos(K) = \frac{c_{\max}}{\sqrt{1 + c/K}}$$

với RMSE dưới 0.06 cho từng loại lớp. Đáng chú ý, cosine duy trì ổn định qua hai bậc độ lớn về token ở quần thể lớn — tín hiệu tích cực cho khả năng mở rộng quy mô.

Một điểm tinh tế: Dust tiệm cận gradient của backprop nhưng không hội tụ chính xác vào nó. Đây là đặc tính tốt, vì ước lượng chỉ theo hướng tương tự nhưng dẫn đến quỹ đạo tối ưu hóa khác — và trong thực nghiệm, quỹ đạo đó đôi khi tốt hơn cả backprop.

Ý nghĩa và những câu hỏi mở

Dust đánh dấu bước tiến quan trọng trong ý tưởng "bài học cay đắng" (bitter lesson) của Richard Sutton: các phương pháp tổng quát mở rộng theo compute cuối cùng sẽ thắng. Giống như AlphaGo Zero thuần self-play vượt qua phiên bản khởi tạo từ dữ liệu người khi có đủ compute, backprop có thể chỉ là inductive bias tốt trong chế độ ít compute nhưng hạn chế không gian kiến trúc trong chế độ dư thừa compute.

Ba câu hỏi mở chính mà nhóm nghiên cứu đặt ra:

  • Dust có thể tìm hướng tốt hơn gradient bậc một của backprop không? Bằng cách khám phá ngầm loss landscape và nắm bắt curvature bậc cao, Dust có thể bị hút về các vùng phẳng hơn — có dấu hiệu đúng nhưng cơ chế chưa rõ
  • Mở rộng không gian kiến trúc: Dust không cần mạng khả vi đầu-cuối, nên có thể hiệu quả ở những nơi backprop gặp khó, như tính toán hồi quy hoặc looped
  • Hiệu quả compute: Đây chưa phải trọng tâm của bài báo. Cần cải thiện nhiều bậc độ lớn trước khi Dust trở thành lựa chọn thay thế thực tế cho backprop ở mức compute hiện tại

Với cộng đồng nghiên cứu AI, Dust gợi mở một hướng đi thú vị: khi hạ tầng GPU ngày càng mạnh và rẻ, các thuật toán tận dụng brute-force có thể mở ra những khả năng mà lan truyền ngược — với ràng buộc khả vi — không thể chạm tới.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗