CLM: Mô hình ngôn ngữ đối chiếu giúp AI ra quyết định nhanh gấp 9 lần
Các nhà nghiên cứu tại Đại học Stanford và NVIDIA Research đã giới thiệu CLM (Contrastive Language Models) — một phương pháp huấn luyện mô hình ra quyết định theo cơ chế đối chiếu thay vì sinh văn bản truyền thống. CLM-8B đạt hiệu năng tương đương Jev nhưng chạy nhanh hơn tới 9 lần trong các tác vụ điều khiển máy tính, chơi game và gọi công cụ.

CLM: Mô hình ngôn ngữ đối chiếu giúp AI ra quyết định nhanh gấp 9 lần
Các nhà nghiên cứu từ Đại học Stanford và NVIDIA Research vừa công bố CLM (Contrastive Language Models) — một hướng tiếp cận mới cho bài toán ra quyết định của AI. Thay vì dùng mô hình ngôn ngữ để sinh ra hành động như văn bản, CLM huấn luyện hai bộ mã hóa đối chiếu để chấm điểm và chọn hành động tốt nhất.
Kết quả thử nghiệm cho thấy CLM-8B đạt hiệu năng ngang ngửa mô hình Jev nhưng chạy nhanh hơn tới 9 lần, đặc biệt trong các tình huống có nhiều lựa chọn hành động hoặc hành động được tái sử dụng thường xuyên.
Cơ chế hoạt động: đối chiếu thay vì sinh văn bản
Ý tưởng cốt lõi của CLM nằm ở việc tách bài toán ra quyết định thành hai phần: mã hóa trạng thái (state encoder) và mã hóa hành động (action encoder). Cả hai được huấn luyện trên một tập dữ liệu quy mô lớn với mục tiêu đối chiếu InfoNCE.
Cách huấn luyện này hoạt động như sau:
- Mỗi trạng thái được kéo lại gần hành động đúng đã được thực hiện trong thực tế
- Đồng thời bị đẩy ra xa tất cả các hành động khác
- Hai bộ mã hóa sau đó trực tiếp đóng vai trò như một bộ phân loại hành động zero-shot
Nói cách khác, mô hình không cần "viết ra" hành động — nó chỉ cần đo độ tương đồng giữa vector trạng thái và vector hành động.
Đây là điểm khác biệt căn bản so với các mô hình ngôn ngữ truyền thống vốn phải sinh từng token hành động, gây tốn kém thời gian tính toán.
Triển khai thực tế: chấm điểm và chọn hành động
Khi vận hành, CLM nhận trạng thái hiện tại cùng một tập hành động ứng viên. Với mỗi ứng viên, mô hình tính điểm dựa trên mức độ tương đồng giữa embedding của hành động đó và embedding của trạng thái. Hành động có điểm cao nhất sẽ được chọn.
Quy trình này mang lại lợi thế rõ rệt:
- Không cần sinh văn bản tuần tự — chi phí tính toán giảm mạnh
- Xử lý song song nhiều ứng viên cùng lúc
- Tái sử dụng embedding của các hành động đã gặp trước đó
Kết quả: ngang Jev nhưng nhanh hơn 9 lần
Nhóm nghiên cứu — gồm Jacky Kwok, Hangoo Kang, Tarun Suresh, Jon Saad-Falcon, Marco Pavone, Christopher Ré và Azalia Mirhoseini — đã thử nghiệm CLM trên ba nhóm tác vụ chính: điều khiển máy tính (computer-use), chơi game và gọi công cụ (tool-calling).
Kết quả nổi bật:
- CLM-8B đạt hiệu năng tương đương Jev trên cả ba nhóm tác vụ
- Tốc độ nhanh hơn tới 9 lần trong điều kiện thực tế
- Mức tăng tốc rõ nhất khi số lượng hành động ứng viên lớn — ví dụ tác vụ WikiRacing
- Cũng rất hiệu quả khi hành động được tái sử dụng nhiều lần trên các trạng thái khác nhau — ví dụ trò chơi T-Rex Game
Vì sao điều này quan trọng với AI tác tử?
Trong bối cảnh các AI agent (tác tử AI) đang trở thành xu hướng chủ đạo, tốc độ ra quyết định là yếu tố sống còn. Một tác tử điều khiển trình duyệt, thao tác phần mềm hay gọi API liên tục phải đưa ra hàng trăm quyết định mỗi phiên làm việc.
Nếu mỗi quyết định đều phải sinh văn bản tuần tự, độ trễ sẽ tích lũy và chi phí GPU tăng vọt. Cách tiếp cận của CLM — biến bài toán sinh thành bài toán so khớp vector — có thể là hướng đi giúp AI tác tử chạy nhanh, rẻ và ổn định hơn khi triển khai thực tế.
Với các đội phát triển sản phẩm AI tại Việt Nam, đây là tín hiệu đáng chú ý: khi xây dựng tác tử tự động hóa quy trình, việc cân nhắc kiến trúc đối chiếu (contrastive) thay vì chỉ dựa vào mô hình sinh có thể giúp tiết kiệm đáng kể hạ tầng suy luận.
Bạn có thể tham khảo thêm chi tiết kỹ thuật tại trang dự án CLM và thảo luận cộng đồng trên Hacker News.
Bài viết liên quan

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Hiệu sách cũ Nhật Bản tăng doanh số gấp 5 lần vì bị mua theo tấn để phục vụ AI
24 tháng 9, 2026