Cloudflare ra mắt Clef: Mô hình ra quyết định mã nguồn mở giúp AI agent tự chủ vận hành
Cloudflare vừa công bố Clef và Clef-flash — hai mô hình ra quyết định (decision model) được huấn luyện nội bộ, mã nguồn mở theo giấy phép Apache 2.0 và vận hành trên Workers AI. Clef trả về kết quả phân loại có cấu trúc, có xác suất kèm theo, nhanh hơn nhiều so với LLM thông thường và mở ra hướng đi mới cho các luồng công việc agentic.

Trong vài tuần trở lại đây, thị trường công nghệ liên tục bàn tán về các mô hình ra quyết định (decision model) — đặc biệt là sau khi Typesafe AI giới thiệu dòng Jev. Nếu các mô hình phân loại (classifier) đã tồn tại từ lâu, thì decision model mang đến một khái niệm mới: mô hình chỉ sinh ra các kết quả có cấu trúc, giới hạn trong một tập lựa chọn xác định, với chi phí thấp, tốc độ cao và độ ổn định cao. Những mô hình này đủ thông minh để xử lý nhiều loại đầu vào khác nhau mà không cần huấn luyện lại mỗi khi có thêm hạng mục phân loại mới.
Cloudflare hôm nay chính thức công bố hai mô hình ra quyết định do họ huấn luyện, gồm Clef và Clef-flash, được lưu trữ và vận hành trên nền tảng Workers AI.
Minh họa mô hình ra quyết định Clef của Cloudflare
Mô hình ra quyết định là gì?
Một decision model đưa ra phân loại để giúp các agent quyết định hành động, dựa trên những xác suất nhất định. Ví dụ, bạn có thể đưa vào một tin nhắn từ khách hàng gửi đến bộ phận hỗ trợ, rồi hỏi liệu nội dung này có khẩn cấp không và nên chuyển cho nhóm nào xử lý. Mô hình sẽ trả về câu trả lời có kiểu dữ liệu rõ ràng (typed output) kèm theo xác suất, để mã nguồn của bạn dùng đó mà định tuyến ticket, kích hoạt leo thang xử lý, hoặc chuyển cho nhân viên con người.
Điều này có nghĩa là không nhất thiết phải luôn có con người nằm trong vòng lặp ra quyết định nữa. Các agent có thể tự thu thập ngữ cảnh, tự đưa ra quyết định và tự hành động, hoặc chủ động chuyển sang người thật khi cần thiết.
Tại Cloudflare, nhóm Threat Intelligence đã thử nghiệm Clef để phân loại tên miền website. Sau khi đưa một tên miền vào kèm công cụ Browser Run, Clef có thể nhanh chóng xác định các hạng mục mà tên miền đó thuộc về — chẳng hạn 95% khả năng là website thời trang, 85% là thương mại điện tử, dưới 1% là lừa đảo (phishing). Toàn bộ quá trình truy xuất, kết xuất và phân loại mất 2,2 giây. Trong khi đó, mô hình LLM đa dụng nhanh nhất của họ là gpt-oss-120b mất 4,7 giây cho cùng luồng công việc, mà chỉ trả về hai kết quả phân loại.
Clef khác gì so với các mô hình ra quyết định khác?
Cloudflare cho biết Clef sở hữu vài đặc điểm riêng biệt mà họ cho là đáng để công bố rộng rãi:
- Có bộ mã hóa thị giác (vision encoder), nên có thể nhận hình ảnh và phân loại nội dung trực quan. Điểm này khác với Jev, vốn hiện chỉ xử lý văn bản.
- Cửa sổ ngữ cảnh 64k token, gấp đôi mức 32k của Jev, cho phép đưa vào nhiều ngữ cảnh hơn để phân loại.
- Độ chính xác cao, đạt điểm cạnh tranh trên nhiều bộ kiểm thử chất lượng khác nhau và tương thích hoàn toàn với API của Jev, nên việc chuyển đổi rất dễ dàng.
Trong 43 bộ kiểm thử mà Cloudflare chạy, các mô hình Clef cũng vượt trội về độ trễ so với phần lớn đối thủ. Độ trễ trung vị của Clef là 209,3 mili-giây, Clef-flash chỉ 38,8 mili-giây, trong khi Jev là 524,1 mili-giây và DiffusionGemma Jev là 84,4 mili-giây.
Bảng so sánh độ trễ và hiệu năng giữa các mô hình ra quyết định
Nhờ được lưu trữ trên hạ tầng của Cloudflare, các mô hình này tận dụng được GPU tại biên (edge), giúp giảm độ trễ mạng và ra quyết định nhanh hơn. Điều đó đồng nghĩa bạn có thể đưa Clef vào đường dẫn nóng (hot path) của agent để ra quyết định, rồi kết hợp với một LLM khác trên Workers AI để thực thi hành động.
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
-X POST \
-H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
-d '{
"model": "clef",
"state": "Checkout has been failing for every customer for the last hour.",
"questions": {
"urgent": { "type": "noul", "instructions": "Is this support request urgent?" },
"team": {
"type": "choice",
"instructions": "Which team should handle this request?",
"criteria": {
"billing": "Payments, invoices, and refunds",
"technical": "Outages, errors, and configuration",
"sales": "Plans and upgrades"
}
}
}
}'
Mô hình Clef lớn hơn thiên về độ chính xác cao, còn Clef-flash phù hợp với những quyết định đòi hỏi độ trễ cực thấp. Cả hai đều sẵn sàng cho môi trường doanh nghiệp, kèm cam kết Cloudflare không đọc, không lưu trữ và không dùng dữ liệu yêu cầu hay phản hồi của khách hàng để huấn luyện — trừ khi khách hàng tự nguyện dùng sản phẩm tinh chỉnh (fine-tuning).
Cách Cloudflare huấn luyện Clef
Clef được xây dựng dựa trên các thử nghiệm trước đó của Cloudflare với mô hình ra quyết định nội bộ, trong đó họ điều chỉnh DiffusionGemma để sinh xác suất tất định bằng cách phơi bày các giá trị logprob do LLM tạo ra. Khác biệt là Clef dùng một mô hình nền tảng khác: hiện tại là Qwen, được hậu huấn luyện để phục vụ bài toán ra quyết định.
Trong quá trình suy luận, Clef dùng Qwen cho một lượt prefill-only, sau đó tính điểm các lựa chọn hợp lệ trong schema song song với nhau. Bước ra quyết định không tự hồi quy (non-autoregressive), nên không cần sinh văn bản trung gian từng token — nhờ đó Clef nhanh hơn đáng kể so với các LLM tự hồi quy.
Về kiến trúc, mô hình dùng quy trình định tuyến chú ý hai giai đoạn (two-stage attention routing) chuyên biệt: mỗi lựa chọn hợp lệ trích xuất ngữ cảnh liên quan đến câu lệnh, cho phép các trường tham số chú ý chéo lẫn nhau và quay lại payload gốc trước khi tính điểm. Cách tiếp cận này kết hợp định tuyến bằng chứng theo từng lựa chọn, chú ý chéo liên trường và tính điểm ràng buộc theo schema.
Cloudflare đóng băng Qwen3.8-27B cho Clef và Qwen3.5-9B cho Clef-flash, đồng thời tối ưu hóa đầu định tuyến cùng các bộ chuyển đổi hạng thấp rank-256 (LoRA). Quá trình hậu huấn luyện dùng cross-entropy làm mịn nhãn cho các đầu ra schema hợp lệ, kết hợp Brier loss để tinh chỉnh hiệu chuẩn xác suất. Họ cũng phát triển phương pháp Reinforcement Learning for Calibrated Decisions (RLCD) như mục tiêu tối ưu thứ cấp, cho điểm từng phần với các lựa chọn thứ tự gần đúng, thưởng cho đầu ra chính xác tuyệt đối và áp hình phạt tham chiếu để tránh dịch chuyển phân phối.
Tinh chỉnh mở rộng năng lực cho Clef
Nhiều nhóm nội bộ tại Cloudflare cần tinh chỉnh Clef để nhúng vào luồng công việc agentic của mình. Ví dụ, họ muốn một mô hình phân loại có thể đánh giá các báo cáo về Trust & Safety, hỗ trợ phân loại yêu cầu hỗ trợ khách hàng, hoặc tích hợp vào sản phẩm Bot để quyết định một trình thu thập dữ liệu là bot tốt hay bot xấu.
Khi tinh chỉnh, mô hình có thể đánh đổi phần nào hiệu năng đa dụng để đổi lấy độ chính xác cao hơn trong một lĩnh vực cụ thể. Với hơn 15 năm dữ liệu mạng ở nhiều lĩnh vực khác nhau, Cloudflare có thể tinh chỉnh mô hình cho các trường hợp sử dụng riêng, đạt độ chính xác và tốc độ cao hơn mô hình Clef đa dụng.
Dịch vụ học tăng cường (RL) mới
Cloudflare ra mắt dịch vụ giúp khách hàng tinh chỉnh Clef cho khối lượng công việc của mình, bắt đầu bằng đội kỹ sư triển khai tiền tuyến (FDE) đồng hành trực tiếp. Từ kinh nghiệm đó, họ sẽ xây dựng một nền tảng tự phục vụ để khách hàng thu thập dữ liệu, tinh chỉnh và triển khai lại mô hình — tất cả trên Cloudflare.
Nền tảng này tận dụng những thành phần đã có sẵn của Cloudflare:
- Cloudflare AI Gateway — đưa toàn bộ lưu lượng AI qua cổng này để tự động tạo bộ dữ liệu yêu cầu theo từng trường hợp sử dụng.
- Cloudflare Workers AI — sinh các rollout dựa trên mô hình Clef gốc.
- Cloudflare Containers — sandbox học tăng cường để tính điểm và phát lại hành động của agent.
- [Mới] Trainer — cập nhật trọng số của mô hình Clef đã tinh chỉnh.
- Cloudflare Workers AI + BYO Model — triển khai lại mô hình đã tinh chỉnh trên Workers AI.
Kiến trúc nền tảng AI của Cloudflare phục vụ tinh chỉnh mô hình
Ý nghĩa với thị trường và người dùng Việt Nam
Đối với các đội phát triển sản phẩm và startup công nghệ tại Việt Nam, sự xuất hiện của các mô hình ra quyết định như Clef mở ra một hướng tiếp cận thực dụng hơn cho bài toán tự động hóa. Thay vì phải gọi một LLM lớn cho mọi bước trong luồng xử lý, các kỹ sư có thể tách riêng phần ra quyết định — dùng mô hình nhỏ, nhanh, rẻ và có kết quả ổn định — rồi chỉ dùng LLM cho phần sinh văn bản hay gọi công cụ phức tạp.
Việc Clef được mở mã nguồn theo giấy phép Apache 2.0 và có trọng số sẵn trên Hugging Face cũng có nghĩa là các nhóm kỹ thuật trong nước có thể tải về chạy thử cục bộ, đánh giá trên chính dữ liệu của mình trước khi quyết định tích hợp vào hệ thống production.
Cloudflare kỳ vọng Clef có thể thay đổi cách chúng ta sử dụng agent, phù hợp với sứ mệnh biến Cloudflare thành "đám mây dành cho agent" của công ty.
Cả hai mô hình Clef và Clef-flash hiện đã có sẵn trên Workers AI, kèm tài liệu dành cho nhà phát triển và kho mã nguồn mở trên Hugging Face để bất kỳ ai cũng có thể bắt đầu thử nghiệm.


