Beam: Mô hình AI mở 501 tỷ tham số đầu tiên của Reflection

Công nghệ05 tháng 10, 2026·6 phút đọc

Reflection vừa giới thiệu Beam, mô hình open-weight đầu tiên của họ với 501 tỷ tham số tổng và 23 tỷ tham số hoạt động, tối ưu cho lập trình, suy luận và tác vụ agentic. Mô hình được huấn luyện trên 23,8 nghìn tỷ token và trải qua quá trình học tăng cường quy mô lớn với hơn 100 triệu lần rollout trên 10.500 GPU NVIDIA GB300.

Beam: Mô hình AI mở 501 tỷ tham số đầu tiên của Reflection

Reflection vừa chính thức giới thiệu Beam, mô hình open-weight đầu tiên của công ty. Đây là một bước đi đáng chú ý trong bối cảnh cuộc đua AI mở đang ngày càng nóng, khi các phòng thí nghiệm phương Tây tìm cách thu hẹp khoảng cách với những mô hình đỉnh cao đến từ Trung Quốc.

Mô hình Beam của ReflectionMô hình Beam của Reflection

Beam là gì và có gì đặc biệt?

Beam là mô hình Mixture-of-Experts (MoE) thưa với 501 tỷ tham số tổng cộng nhưng chỉ 23 tỷ tham số hoạt động mỗi lần suy luận. Cách thiết kế này giúp mô hình đạt hiệu năng cao trong khi tiết kiệm đáng kể chi phí tính toán khi chạy thực tế.

Mô hình được tối ưu cho ba nhóm tác vụ chính:

  • Lập trình (coding): viết, sửa và hiểu mã nguồn phức tạp
  • Suy luận (reasoning): giải quyết các bài toán đòi hỏi chuỗi logic dài
  • Tác vụ agentic: tự động gọi công cụ, tìm kiếm và thao tác nhiều bước

Theo Reflection, Beam có thể cạnh tranh với các mô hình mở lớn hơn như GLM 5.2 và đang tiệm cận Qwen 3.8-Max ở các tác vụ lập trình và agentic. Điểm mạnh cốt lõi của Beam không nằm ở khả năng thô mà ở hiệu quả suy luận vượt trội.

Hiệu quả suy luận: lợi thế cạnh tranh chính

Trên các bài kiểm tra suy luận nâng cao, Beam đạt điểm tương đương GLM-5.2 nhưng chỉ dùng ít hơn 3-4 lần chi phí suy luận. Khoảng cách này còn lớn hơn khi so với các mô hình thuộc nhóm trên 2.000 tỷ tham số như Qwen 3.8-Max, vốn cần nhiều tính toán hơn đáng kể cho mỗi token.

Những kết quả này chuyển hóa thành "trí tuệ trên mỗi token" cao hơn, mang lại năng lực mạnh với chi phí thấp hơn — biến Beam thành mô hình chủ lực cho doanh nghiệp trong các tác vụ lập trình và agentic.

Đối với các doanh nghiệp Việt Nam đang cân nhắc triển khai AI nội bộ, đây là yếu tố then chốt: chi phí vận hành suy luận thường chiếm phần lớn ngân sách, và một mô hình tiết kiệm token hơn có thể giúp giảm đáng kể hóa đơn hạ tầng.

Học tăng cường quy mô lớn

Reflection đặt học tăng cường (RL) tính toán cao làm trục mở rộng trung tâm cho Beam. Công ty đã triển khai 10.500 GPU NVIDIA GB300 trong bốn tuần, tạo ra hơn 100 triệu lần rollout với độ dài ngữ cảnh tối đa 256K token.

Hạ tầng huấn luyện BeamHạ tầng huấn luyện Beam

Một số con số ấn tượng khác:

  • Khoảng 1,3 tỷ sandbox được dùng cho huấn luyện và chấm điểm
  • Gần 1 triệu môi trường chất lượng cao về lập trình, agentic và STEM
  • Duy trì trung bình 110.000 rollout đồng thời
  • Hỗ trợ tối đa 170.000 sandbox đồng thời, trải trên hơn 20 cụm, hai nền tảng cloud và bốn khu vực

Beam được huấn luyện với policy gradient bất đồng bộ. Ở quy mô lớn, hiện tượng "policy staleness" (chính sách bị lỗi thời) là nguồn gây mất ổn định nghiêm trọng. Nhóm nghiên cứu đã phát triển thuật toán mới để duy trì học ổn định ngay cả khi học từ các tương tác được tạo ra hơn một ngày trước đó — tức là chậm tới 107 phiên bản trọng số so với chính sách hiện tại.

Khả năng tổng quát hóa đáng kinh ngạc

Điều thú vị là dù không được huấn luyện tác vụ duyệt web trong hỗn hợp RL, Beam vẫn tự học được kỹ năng duyệt web và chuyển giao sang lĩnh vực mới. Khi có quyền truy cập web, mô hình tự biết cách tìm kiếm, truy vấn các mô hình ngôn ngữ lớn khác và dùng API OCR để đọc tài liệu.

Một số demo nổi bật được Reflection công bố:

  • Bản đồ tàu điện ngầm NYC trực tiếp: Beam tự tìm tài liệu, kiểm tra yêu cầu xác thực, tìm hình học tuyến tàu và xây dựng cả frontend lẫn backend để cập nhật thời gian thực
  • Trò chơi phi hành gia rơi tự do: tạo game 3D bằng p5.js dù Beam không phải mô hình đa phương thức
  • Notebook fine-tune cho Gemma-4: tăng độ chính xác của Gemma trên tập kiểm tra lên 66,5%
  • Thí nghiệm đất hay nước: tái tạo câu đố lan truyền trên X với lưới 180×90 ô, đạt 95,5% độ phủ chính xác — nằm giữa Opus 5 (92,5%) và Fable 5 (97,8%)

An toàn và căn chỉnh

Reflection huấn luyện một mô hình thứ hai từ checkpoint pretrained với pipeline SFT và RL riêng, tập trung vào các nguyên tắc an toàn. Công ty áp dụng kỹ thuật deliberative alignment để đưa chính sách an toàn trực tiếp vào quá trình suy luận của mô hình.

Các nguyên tắc được chia thành ba tầng: quy tắc không được vi phạm, phẩm chất cần duy trì (dùng đúng ngữ cảnh, thừa nhận điều chưa chắc chắn), và phong cách tương tác mặc định (trực tiếp, kỹ lưỡng, chủ động).

Dữ liệu an toàn được xây dựng theo cách đối kháng và lặp: mỗi vòng huấn luyện một mô hình, tạo prompt gây hành vi có hại hoặc từ chối quá mức, rồi đưa các đòn tấn công thành công vào hỗn hợp SFT cho vòng tiếp theo.

Lộ trình sắp tới

Reflection cho biết Beam hiện đang trong giai đoạn red-teaming và đánh giá cuối cùng. Người dùng có thể đăng ký danh sách chờ để truy cập sớm.

Lộ trình phát hành BeamLộ trình phát hành Beam

Trong tháng này, công ty sẽ phát hành:

  • Trọng số mô hình theo giấy phép Apache 2.0
  • Báo cáo kỹ thuật và model card
  • Toàn bộ stack để chạy, đánh giá và fine-tune mô hình
  • Tích hợp với nhiều thư viện và harness mã nguồn mở

Đáng chú ý, Reflection khẳng định Beam chỉ là mô hình đầu tiên trong một chuỗi sản phẩm, và họ đang huấn luyện thế hệ tiếp theo với mục tiêu "đưa biên giới mở tiến gần hơn tới biên giới của trí tuệ".

Với việc phát hành theo Apache 2.0, đây là tín hiệu tích cực cho cộng đồng mã nguồn mở và các startup AI tại Việt Nam, những đơn vị có thể tận dụng mô hình mạnh mà không phải chịu ràng buộc giấy phép hạn chế.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗