OUI-1: Mô hình AI đầu tiên trên thế giới chuyên tạo giao diện người dùng, chạy mượt trên GPU phổ thông

08 tháng 9, 2026·6 phút đọc

OUI-1 là mô hình ngôn ngữ mã nguồn mở đầu tiên được tinh chỉnh để tạo mã giao diện người dùng, đạt 71,7% trên chuẩn Generative UI Benchmark, vượt trội so với mức 13% của mô hình nền. Với kiến trúc 4B tham số hoạt động, mô hình này chạy được trên GPU tiêu dùng như RTX 5090 và hướng tới việc tạo giao diện theo thời gian thực ngay trên thiết bị.

OUI-1: Mô hình AI đầu tiên trên thế giới chuyên tạo giao diện người dùng, chạy mượt trên GPU phổ thông

OUI-1, mô hình AI đầu tiên trên thế giới dành riêng cho việc tạo sinh giao diện người dùng (Generative UI - GenUI), vừa được đội ngũ OpenUI công bố. Đây là một mô hình mã nguồn mở với 4B tham số hoạt động, chạy được trên các GPU thương mại phổ thông như RTX 5090 và tải trọng lượng về từ Hugging Face.

Điểm đáng chú ý nhất là khả năng "viết" mã giao diện một cách chính xác bằng ngôn ngữ riêng (openui-lang) với hiệu suất vượt trội. Trên chuẩn đánh giá Generative UI Benchmark, OUI-1 đạt 71,7% — một cú nhảy 5,5 lần so với mô hình gốc DiffusionGemma (13%), thậm chí đánh bại cả các mô hình lớn hơn nhiều về dung lượng tham số hoạt động.

Một trong những đích ngắm chính của OUI-1 là giải quyết bài toán "giao diện do tác tử AI (agent-driven) điều khiển" hoạt động tin cậy và nhanh như phần mềm truyền thống. Ý tưởng này được đội ngũ khám phá qua dự án AppLess trước đó.

Vì sao OUI-1 lại quan trọng?

Giao diện do AI tạo ra được xem là tương lai của phần mềm, nhưng để trở thành hiện thực, nó phải đáp ứng ba ràng buộc khắt khe:

  • Tốc độ dưới 1 giây để tạo ra một giao diện hoàn chỉnh.
  • Độ tin cậy đủ cao để dùng như phần mềm thật.
  • Kích thước đủ nhỏ để chạy tại chỗ trên phần cứng phổ thông.

AppLess trước đây sử dụng Gemma 4 chạy trên siêu máy tính Cerebras trong cloud. Muốn đưa trải nghiệm này về thiết bị cá nhân, bài toán khó là phải giữ tốc độ và chất lượng tạo giao diện với tài nguyên tính toán ít hơn đáng kể. OUI-1 là bước đi đầu tiên để giải quyết trọn vẹn bài toán này.

Vì sao chọn kiến trúc DiffusionGemma?

Các mô hình tự hồi quy (autoregressive) sinh ra một token mỗi lần và bị giới hạn bởi băng thông bộ nhớ. Ngược lại, DiffusionGemma (nền tảng của OUI-1) là mô hình khuếch tán viết một lúc cả khối 256 token từ nhiễu và cam kết (commit) từng token ngay khi nó đủ "chắc chắn".

Google công bố DiffusionGemma đạt tốc độ hơn 1.000 token/giây trên một H100 và hơn 700 token/giây trên RTX 5090. Tuy nhiên, tốc độ thôi là chưa đủ. Điều còn thiếu là độ tin cậy.

Vấn đề "điểm mù" của model nền

Để đo độ tin cậy, nhóm tác giả dùng Generative UI Benchmark. DiffusionGemma chỉ đạt 13,0% — nó có tốc độ và cấu hình phần cứng mong muốn nhưng không tạo ra được các giao diện hợp lệ.

Ngôn ngữ openui-lang khiến các lỗi này dễ nhìn thấy qua:

  • Lỗi schema: như dùng heading cấp h9 không tồn tại hoặc mô tả kiểu đường cong không có thật.
  • Lỗi kết nối (wiring): như khai báo một biến nhưng không gắn vào thành phần gốc (root).

Mục tiêu của quá trình huấn luyện OUI-1 là giảm cả hai loại lỗi này xuống tối thiểu mà không làm mất tốc độ.

Quá trình huấn luyện 3 giai đoạn

Giai đoạn 1: Supervised Fine Tuning (SFT) Đội ngũ bắt đầu với khoảng 700 ví dụ openui-lang do các mô hình lớn hơn viết, trải trên 7 thư viện thành phần (component libraries). LoRA fine-tune trên một A100 khiến điểm benchmark thậm chí còn giảm xuống, chỉ khi thu hẹp về một thư viện duy nhất thì điểm mới tăng từ 13% lên 28,8%.

Vấn đề là lỗi schema và lỗi wiring luôn biến động trái ngược nhau như hai đầu của một cái bập bênh. Khi giảm được loại này thì loại kia lại tăng. Thêm vào đó, model sau fine-tune bị chậm hơn đáng kể: từ 1,6 giây/output tăng lên 4,3 giây, khiến nó viết dài hơn và cần nhiều bước khử nhiễu hơn.

Giai đoạn 2: Self-distillation (tự chưng cất tri thức) Bước đột phá đến từ việc nhận ra openui-lang có phần thưởng xác minh được: trình phân tích cú pháp (parser) có thể cho biết chính xác lỗi nằm ở đâu.

Quy trình gồm 4 bước lặp:

  • Mô hình tự sinh vài trăm chương trình openui-lang.
  • Trình phân tích giữ lại những đoạn hợp lệ.
  • Các đoạn "gần đúng" được sửa chỉ bằng các khiếm khuyết do parser báo cáo, cấm các thao tác viết lại tự do.
  • Dùng những chương trình sống sót này để retrain mô hình trong 500 bước (1-2 giờ trên một A100).

Kết quả bất ngờ: Tốc độ quay trở lại (1,9 giây/output, thậm chí còn nhanh hơn với nội dung dài hơn 28%), và chiếc "bập bênh" lỗi dừng lại. Điểm benchmark đạt 57,1%, lỗi schema và lỗi wiring cùng lúc giảm mạnh.

Giai đoạn 3: Tổng quát hóa trên 27 thư viện thành phần Sau khi thành công với một thư viện, công thức tương tự được lặp lại trên 27 thư viện khác nhau, tạo thành OUI-1 hoàn chỉnh.

Kết quả vượt trội và mã nguồn mở

Trên Generative UI Benchmark:

  • OUI-1: 71,7% (4B tham số hoạt động)
  • Qwen3.8 27B (27B): 78,8%
  • Gemma 4 31B (31B): 46,7%
  • DiffusionGemma nền: 13%
  • Phi-4 14B: 44%

Điểm đáng nói là OUI-1 chỉ có 4B tham số hoạt động, thấp hơn rất nhiều so với Gemma 4 31B mà nó đánh bại. Không mô hình nào ở mức 4B tham số hoạt động trở xuống vượt được OUI-1; muốn đạt điểm cao hơn, bạn phải cần đến một model đậm đặc 27B.

Khả năng tổng quát hóa cũng được kiểm chứng trên thư viện AppLess: OUI-1 tạo ra 55/60 output hợp lệ trong các bài kiểm tra chưa từng thấy khi huấn luyện, trong khi DiffusionGemma chỉ làm được 23/60.

Mô hình có 26B tham số tổng nhưng chỉ kích hoạt 4B mỗi lần chạy, hoạt động ở độ chính xác FP8. Bạn có thể tải trọng lượng mô hình về từ Hugging Face.

Hướng phát triển tiếp theo

Đội ngũ OUI-1 nhấn mạnh ba hướng ưu tiên:

  • Chạy trên thiết bị cá nhân để bảo mật dữ liệu người dùng tốt hơn.
  • Phát triển OpenUI Lang 0.5 — sinh giao diện có trạng thái, truy vấn và cập nhật riêng để runtime thay model xử lý tương tác.
  • Giảm thời gian phản hồi xuống dưới 1 giây — tiến gần hơn đến trải nghiệm như phần mềm bản địa.

Với người dùng Việt Nam quan tâm đến mô hình ngôn ngữ nhỏ gọn chạy tại chỗ, OUI-1 là một mẫu hình rất đáng chú ý: nó cho thấy một mô hình mã nguồn mở nhỏ gọn có thể đạt năng lực của các mô hình lớn gấp nhiều lần, tiến thêm một bước dài trong việc đưa các tác tử AI chạy được ngay trên phòng lab hay laptop có GPU mạnh.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗