Unreal Agent: Khung điều phối bất đồng bộ giúp AI agent tiết kiệm đến 40% chi phí

Công nghệ22 tháng 9, 2026·6 phút đọc

Unreal Labs giới thiệu Unreal Agent, một khung điều phối (harness) xử lý các lệnh gọi công cụ theo cách hoàn toàn bất đồng bộ, giúp mô hình không cần chờ đợi hay thăm dò. Cách tiếp cận này giúp tiết kiệm tới 40% chi phí so với Codex và 20% so với Pi trên các bài kiểm thử agentic thực tế.

Unreal Agent: Khung điều phối bất đồng bộ giúp AI agent tiết kiệm đến 40% chi phí

Trong bối cảnh các sản phẩm AI agent ngày càng phổ biến, bài toán tối ưu chi phí vận hành đang trở thành mối quan tâm hàng đầu của các đội phát triển. Unreal Labs vừa giới thiệu Unreal Agent — một khung điều phối (harness) mới hứa hẹn giải quyết điểm nghẽn lớn nhất: thời gian và token bị tiêu tốn vào việc quản lý các lệnh gọi công cụ.

Vấn đề: Agent "đốt" token vào việc quản lý công cụ

Khi triển khai agent trong môi trường thực tế, đội ngũ Unreal Labs nhận thấy các agent dành rất nhiều thời gian và token chỉ để xử lý các lệnh gọi công cụ. Mô hình phải liên tục chờ đợi, thăm dò trạng thái (poll) và gửi tín hiệu nhịp tim (heartbeat) cho các công cụ đang chạy — những tác vụ không tạo ra giá trị trực tiếp cho người dùng nhưng lại tiêu tốn tài nguyên đáng kể.

Chính quan sát này đã thúc đẩy họ xây dựng Unreal Agent với một harness giúp giảm bớt gánh nặng quản lý công cụ cho mô hình nền tảng.

Kiến trúc bất đồng bộ: Điểm khác biệt cốt lõi

Điểm then chốt của Unreal Agent nằm ở cách nó quản lý các lệnh gọi công cụ hoàn toàn bất đồng bộ. Mỗi khi agent phát ra một lệnh gọi công cụ, hệ thống lập tức ghi vào nhật ký sự kiện rằng công cụ đã trả về ở trạng thái "đang xử lý" (in-progress), trong khi vẫn tiếp tục thực thi công cụ đó ở chế độ nền. Khi công cụ thực sự hoàn tất, kết quả mới được ghi vào nhật ký phiên làm việc và mô hình ngôn ngữ được gọi để xử lý.

Cách tiếp cận này mang lại hai lợi ích lớn:

  • Cho phép người dùng điều hướng agent ngay lập tức mà không cần chờ các lệnh gọi công cụ kết thúc. Người dùng có thể đưa ra chỉ dẫn mới bất cứ lúc nào.
  • Cho phép agent lên lịch nhiều công việc hữu ích hơn giữa các lần gọi mô hình, từ đó nâng cao hiệu quả chi phí ở mức tối ưu.

Biểu đồ so sánh hiệu quả chi phí của các agentBiểu đồ so sánh hiệu quả chi phí của các agent

Theo Unreal Labs, phiên bản hiện tại đạt mức tiết kiệm chi phí lên tới 40% so với Codex20% so với Pi trên các khối lượng công việc thực tế và các bài kiểm thử agentic.

Những hạn chế của các SDK hiện có

Đội ngũ Unreal Labs cho biết họ đã xây dựng nhiều sản phẩm agentic và rút ra những bài học về các SDK phổ biến. Các SDK hướng CLI như Agent SDK của Claude mang theo những giả định về phiên cục bộ, tiến trình con và giới hạn tài nguyên — những thứ không chuyển đổi gọn gàng sang môi trường sản xuất. Việc xử lý hoàn tất, hủy bỏ và tác vụ nền một cách đáng tin cậy thường đòi hỏi phải tự xây dựng cơ chế quản lý vòng đời riêng.

Việc hỗ trợ các nhà cung cấp khác cũng phát sinh công việc tương thích: chuyển đổi chế độ API có thể làm hỏng công cụ, trong khi nâng cấp SDK có thể thay đổi định dạng thông điệp và buộc phải viết lại phần tích hợp.

Bên cạnh đó, các cây phụ thuộc nặng nề làm tăng rủi ro bảo trì và rủi ro chuỗi cung ứng. Về bảo mật và phê duyệt, đội ngũ này cho rằng các cơ chế dựa trên hook của harness thường khó bảo trì và kém vững chắc hơn so với các ràng buộc môi trường hoặc sandbox mang tính xác định — chẳng hạn như danh sách máy chủ được phép, token truy cập chi tiết hay proxy có cổng phê duyệt.

Hiệu quả chi phí đến từ đâu?

Theo Unreal Labs, có hai yếu tố chính tạo ra mức tiết kiệm chi phí. Thứ nhất là dấu chân harness tối giản cùng việc tối ưu hóa cẩn thận cách sử dụng đầu ra công cụ. Unreal Agent có prompt đơn giản, kết quả công cụ được tối ưu token, và không dùng sub-agent hay workflow phức tạp.

Thứ hai là nhiều công việc công cụ hơn trên mỗi lượt gọi mô hình. Mô hình gọi công cụ bất đồng bộ được giải thích rõ ràng cho mô hình ngôn ngữ, cho phép nó phát ra nhiều lệnh gọi công cụ nặng mỗi lượt mà không lãng phí token vào việc thăm dò hay chờ đợi.

Kết quả trên các bài kiểm thử

Unreal Labs đã thử nghiệm Unreal Agent với GPT-6 Astra xhigh, so sánh với Codex và Pi. Trên Terminal-Bench 4.0, Unreal Agent đạt tỷ lệ vượt qua 57,9% với tổng chi phí 1.428 USD, so với 2.350 USD của Codex (baseline trên bảng xếp hạng) và 1.827 USD của Pi.

Trên SWE-Atlas Codebase QnA, Unreal Agent đạt 65,8% với chi phí 936 USD, cao hơn Codex (63,3%, 1.303 USD) và Pi (64,0%, 1.033 USD). Kết quả tương tự cũng xuất hiện trên DeepSWE 1.1 khi Unreal Agent đạt 72,4% với 1.367 USD, vượt qua Codex (69,0%, 1.633 USD) và Pi (69,6%, 1.584 USD).

Ở bài kiểm thử Agents' Last Exam · ALE-CLI, Unreal Agent đạt 30,0% tỷ lệ vượt qua hoàn toàn với điểm trung bình 59,7 và chi phí 217 USD — cao hơn Codex (29,0%) và Pi (29,0%). Đáng chú ý, lượng token đầu vào mỗi tác vụ của Unreal Agent chỉ khoảng 0,76 triệu, thấp hơn đáng kể so với Codex (1,59 triệu) và Pi (1,19 triệu).

Nhóm phát triển lưu ý rằng họ chủ yếu chạy các bài kiểm thử lập trình vì chúng có sẵn trên Harbor, giúp việc tái lập và xác minh dễ dàng hơn, nhưng harness này không phụ thuộc vào lĩnh vực cụ thể.

Bắt đầu với Unreal Agent

SDK Unreal Agent hiện cung cấp ba thành phần chính: một thư viện Go có thể tích hợp trực tiếp vào mã nguồn, một runner tương tự claude -p hoặc codex exec, và một benchmark runner tương thích với Harbor.

Đối với cộng đồng phát triển tại Việt Nam — nơi nhiều startup đang bắt đầu tích hợp AI agent vào sản phẩm — việc có thêm một lựa chọn harness tối ưu chi phí và viết bằng Go có thể là tín hiệu đáng quan tâm. Chi phí vận hành agent vẫn là rào cản lớn đối với các đội nhóm có ngân sách hạn chế, và những cải tiến như thế này có thể giúp việc triển khai AI agent trở nên khả thi hơn về mặt kinh tế.

Đội ngũ Unreal Labs nhấn mạnh rằng thiết kế harness xứng đáng được coi là một lĩnh vực nghiên cứu độc lập, với nhiều ý tưởng hứa hẹn vẫn đang chờ được khám phá và triển khai.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗