Ornith-1.5: Bước tiến mới trong tự cải thiện mô hình nền tảng

Công nghệ19 tháng 8, 2026·5 phút đọc

Ornith-1.5 là một mô hình ngôn ngữ lớn mới, mở rộng khung tự tạo khung (self-scaffolding) thành vòng lặp tự cải thiện hoàn chỉnh: mô hình tự đề xuất nhiệm vụ, tạo khung giải quyết và tạo giải pháp cho học tăng cường. Với ba phiên bản 397B, 35B và 9B, Ornith-1.5 đạt hiệu suất cạnh tranh với Claude Opus 4.8 trên các bài kiểm tra mã hóa và tác nhân, đồng thời có thể triển khai trên thiết bị di động.

Ornith-1.5: Bước tiến mới trong tự cải thiện mô hình nền tảng

Ornith-1.5: Vòng lặp tự cải thiện hoàn chỉnh cho mô hình nền tảng

Ornith.ai vừa công bố Ornith-1.5, một bước tiến lớn hướng tới việc xây dựng các mô hình nền tảng có khả năng tự cải thiện từ đầu đến cuối. Không chỉ dừng lại ở việc tối ưu khung và giải pháp, Ornith-1.5 giới thiệu một vòng lặp hoàn chỉnh nơi mô hình tự tạo nhiệm vụ, tự thiết kế khung giải quyết và tự sinh lời giải, liên tục tạo ra những trải nghiệm học tập mới. Ba phiên bản có quy mô khác nhau được ra mắt, đáp ứng từ nhu cầu hiệu năng cao đến triển khai trên thiết bị biên.

Hiệu năng vượt trội ở mọi quy mô

Ornith-1.5 bao gồm ba biến thể: 397B MoE, 35B MoE9B dense, được thiết kế cho các tác vụ lý luận, tác nhân và mã hóa. Phiên bản flagship Ornith-1.5-397B đạt 86.1 điểm trên Terminal-Bench 2.156.0 trên DeepSWE, ngang ngửa Claude Opus 4.8 (85.0 và 59.0) và vượt qua các mô hình mã nguồn mở cùng quy mô như GLM-5.2 (82.7 và 46.2) hay DeepSeek-V4-Flash-0731 (82.7 và 54.4).

Trong khi đó, Ornith-1.5-35B chỉ kích hoạt 3B tham số mỗi token nhưng vẫn đánh bại các mô hình dense lớn hơn như Gemma 4-31B và Muse Glimmer-30B trên các bài kiểm tra tác nhân mã hóa (68.5 so với 43.4 và 51.7 trên Terminal-Bench 2.1). Ở đầu còn lại, Ornith-1.5-9B đạt 47.0 trên Terminal-Bench 2.1 và 70.6 trên SWE-Bench Verified, vượt xa các mô hình lớn hơn như Qwen 3.6-35B. Phiên bản Ornith-1.5-9B-Mobile với lượng tử hóa có thể chạy trực tiếp trên iPhone và các thiết bị Android, mở ra tiềm năng ứng dụng AI mã hóa trên di động.

Sơ đồ vòng lặp tự cải thiện Ornith-1.5Sơ đồ vòng lặp tự cải thiện Ornith-1.5

Cơ chế tự cải thiện: Từ tạo nhiệm vụ đến tối ưu khung

Điểm khác biệt cốt lõi của Ornith-1.5 nằm ở việc thay thế các tập nhiệm vụ được tuyển chọn thủ công bằng một hệ thống tự động hóa ba giai đoạn. Mỗi chu kỳ huấn luyện bắt đầu với việc hệ thống đề xuất các nhiệm vụ ngày càng khó hơn, dựa trên lịch sử giải quyết vấn đề trước đó của mô hình. Điều này giúp lộ ra các khoảng trống năng lực và đẩy mạnh ranh giới huấn luyện.

Ở giai đoạn tiếp theo, mô hình tự tạo hoặc tinh chỉnh một "scaffold" cụ thể cho từng nhiệm vụ, bao gồm các hướng dẫn, công cụ và chiến lược phân chia. Cuối cùng, policy tạo ra các giải pháp và nhận phần thưởng (reward) được lan truyền qua cả ba giai đoạn. Nhờ đó, hệ thống học cách tạo nhiệm vụ hữu ích hơn, thiết kế khung hiệu quả hơn và tạo ra giải pháp chất lượng cao hơn, tạo thành một vòng lặp cải thiện liên tục.

Hàm phần thưởng nhiệm vụ được thiết kế dựa trên ba tín hiệu: tính hợp lệ (nhiệm vụ có thể giải quyết và kiểm chứng), độ khó tiệm cận (nhiệm vụ nằm gần ranh giới năng lực của mô hình) và tính mới lạ (tránh lặp lại các nhiệm vụ đã học). Công thức nhân giữa ba yếu tố này đảm bảo nhiệm vụ được tạo ra đồng thời hợp lệ, thách thức nhưng vẫn học được.

Độ khó tiệm cận được đo bằng chính các rollout của mô hình hiện tại, giúp chương trình học tự động tiến hóa theo năng lực của mô hình.

So sánh hiệu năng Ornith-1.5-397BSo sánh hiệu năng Ornith-1.5-397B

Kiến trúc phần thưởng hai lớp

Một điểm đáng chú ý khác là hệ thống phần thưởng được tách thành hai lớp. Lớp harness reward đánh giá chất lượng của môi trường đánh giá do mô hình tạo ra, dựa trên mức độ khớp với nhiệm vụ, độ trung thực của phần thưởng và khả năng chống hack phần thưởng (reward hacking). Lớp rollout reward trực tiếp chấm điểm từng giải pháp dựa trên thành công của nhiệm vụ.

Cả ba giai đoạn (tạo câu hỏi, tạo harness và tạo giải pháp) đều được tối ưu bằng thuật toán GRPO với các hàm phần thưởng riêng. Cách tiếp cận này cho phép hệ thống học được cách tạo ra các nhiệm vụ tốt hơn, xây dựng môi trường đánh giá đáng tin cậy hơn và cải thiện chất lượng giải pháp một cách đồng bộ, không phụ thuộc vào dữ liệu tĩnh hay các thiết kế tay nghề thủ công.

So sánh toàn cảnh với các mô hình hàng đầu

Trên bảng so sánh toàn diện, Ornith-1.5-397B thể hiện sức mạnh ở cả ba mảng chính: mã hóa, lý luận và tác nhân. Trên HLE (Humanity's Last Exam), mô hình đạt 44.6 điểm khi không dùng công cụ và 56.1 khi có công cụ, vượt qua DeepSeek-V4 và GLM-5.2. Điểm GPQA Diamond 92.8 cũng cho thấy khả năng lý luận khoa học vững chắc.

Ở các bài kiểm tra tác nhân như MCP-Atlas (80 điểm) hay Toolathlon-Verified (71.2 điểm), Ornith-1.5-397B cạnh tranh trực tiếp với các mô hình lớn hơn nhiều như Kimi K3. Riêng trên Frontier-Bench v0.1, mô hình đạt 13.5 điểm, vượt xa các mô hình mã nguồn mở khác cùng phân khúc (cùng lắm chỉ đạt 6.1), tuy vẫn thua xa Claude Opus 4.8.

Đánh giá Ornith-1.5-35B và 9BĐánh giá Ornith-1.5-35B và 9B

Đối với độc giả Việt Nam, những nỗ lực mở mã nguồn và tối ưu các mô hình nhỏ như Ornith-1.5-9B mở ra cơ hội lớn cho cộng đồng phát triển phần mềm và nghiên cứu AI trong nước, khi các mô hình mạnh mẽ này ngày càng dễ tiếp cận trên phần cứng giá rẻ và thiết bị di động. Việc mô hình liên tục tự cải thiện chương trình học mà không cần nhiều dữ liệu gán nhãn thủ công cũng là một hướng đi tiềm năng để giảm chi phí huấn luyện AI trong tương lai.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗