Magnitude: Engine suy luận tự tối ưu cho AI agent, nhanh gấp đôi llama.cpp

Công nghệ30 tháng 9, 2026·5 phút đọc

Magnitude là engine suy luận mã nguồn mở dành cho AI agent, tự động biên dịch và tinh chỉnh kernel trên chính thiết bị của bạn để đạt hiệu năng tối đa. Ra mắt từ chương trình YC S25, công cụ này chạy nhanh hơn llama.cpp tới 2 lần trên Mac, Linux và Windows, đồng thời tiết kiệm bộ nhớ đáng kể khi chạy nhiều phiên agent song song.

Magnitude: Engine suy luận tự tối ưu cho AI agent, nhanh gấp đôi llama.cpp

Magnitude: Engine suy luận tự tối ưu cho AI agent, nhanh gấp đôi llama.cpp

Magnitude là một engine suy luận mã nguồn mở dành riêng cho các AI agent, có khả năng tự tối ưu hóa để chạy nhanh nhất có thể trên phần cứng của bạn. Công cụ này hoạt động trên Mac, Linux và Windows với mọi cấu hình máy, cho tốc độ nhanh hơn llama.cpp tới 2 lần. Đây là sản phẩm của hai kỹ sư phần mềm Anders và Tom, vừa ra mắt trong chương trình Y Combinator S25.

Magnitude - tải về miễn phíMagnitude - tải về miễn phí

Vấn đề mà Magnitude giải quyết

Các engine suy luận hiện nay đều phải đánh đổi hiệu năng theo một trong ba hướng. Chúng hoặc được xây dựng cho suy luận theo lô trên phần cứng trung tâm dữ liệu (như vLLM, SGLang) với chi phí là hiệu năng một phiên bị giảm, hoặc thiết kế để tương thích rộng thay vì tối ưu cho phần cứng cụ thể (như llama.cpp, Ollama), hoặc chuyên biệt hóa cho một loại phần cứng hay mô hình nhất định nhưng thiếu tính hoàn chỉnh (như oMLX, ds4).

Điểm chung của tất cả các engine này là chúng không được thiết kế để chạy agent cục bộ. Trong khi đó, các phiên agent thường kéo dài, nhiều phiên chạy cùng lúc, và người dùng vẫn muốn dùng máy tính cho các tác vụ khác. Magnitude ra đời nhằm lấp đầy khoảng trống đó.

Cách Magnitude đạt hiệu năng vượt trội

Magnitude tiếp cận bài toán theo bốn hướng chính, tất cả đều hướng đến mục tiêu tối đa hóa hiệu năng trên chính thiết bị của người dùng.

  • Biên dịch và tinh chỉnh trên thiết bị: Các kernel được viết với tham số linh hoạt và được tinh chỉnh ngay trên máy thật trước khi mô hình chạy. Điều này mang lại khả năng tương thích phần cứng rộng rãi mà vẫn đạt mức hiệu năng tương đương kernel chuyên biệt.
  • Tập trung vào kiến trúc tốt nhất: Đội ngũ viết kernel tối ưu cho những dòng mô hình mở phổ biến nhất, nhờ đó vượt qua các engine chuyên biệt mà không phải hy sinh hiệu năng vì tối ưu quá chung chung.
  • Cấp phát bộ nhớ động: Magnitude chỉ giữ đủ bộ nhớ để chứa trọng số mô hình lúc khởi đầu. Khi các phiên agent phát triển, vùng nhớ heap tự động tăng lên và giải phóng khi agent dừng, cho phép bạn dùng máy cho việc khác trong lúc agent đang chạy.
  • Attention phân trang lai: Lấy cảm hứng từ SGLang, các phiên chạy song song có thể chia sẻ bộ đệm tiền tố, nhưng được tối ưu vị trí để không làm giảm hiệu năng của từng phiên đơn lẻ.

Magnitude lấy cảm hứng từ những đổi mới tốt nhất trong giới nghiên cứu suy luận như FlashAttention, FlashInfer, TurboQuant, cùng các kỹ thuật từ engine khác như radix attention của SGLang.

Hiệu năng thực tế so với llama.cpp

Kết quả đo đạc với mô hình Qwen 3.6 35B A3B (lượng tử hóa 4 bit), ngữ cảnh 64k, không dùng giải mã suy đoán cho thấy mức cải thiện rõ rệt.

Trên Metal (Mac M4 Pro 48 GB):

  • Giải mã nhanh hơn 92% (từ 30 lên 57 token/giây)
  • Tiền xử lý nhanh hơn 9% (từ 466 lên 507 token/giây)
  • Tiết kiệm 28% bộ nhớ cho mỗi agent

Trên CUDA (DGX Spark):

  • Giải mã nhanh hơn 19% (từ 49 lên 58 token/giây)
  • Tiền xử lý nhanh hơn 23% (từ 2.033 lên 2.507 token/giây)
  • Tiết kiệm 27% bộ nhớ cho mỗi agent

Tài liệu MagnitudeTài liệu Magnitude

Cài đặt và sử dụng

Magnitude được đóng gói dưới dạng ứng dụng desktop, giúp bạn kết nối dễ dàng với bất kỳ agent nào đang dùng như Pi, OpenCode, Hermes, Codex, Claude Code, Cline và nhiều công cụ khác. Ứng dụng tự động chạy mô hình khi agent thực sự cần và tắt chúng sau một thời gian không hoạt động.

Quy trình bắt đầu rất đơn giản:

  • Tải Magnitude, cài đặt và mở ứng dụng
  • Chọn một mô hình được đề xuất trong mục Discover và tải về
  • Kết nối agent của bạn trong mục Connections và bắt đầu sử dụng

Ứng dụng desktop đã bao gồm sẵn magnitude CLI, không cần cài đặt riêng. Magnitude chạy được trên mọi GPU Apple Silicon, NVIDIA, AMD, hoặc thậm chí chỉ với CPU. Không có yêu cầu cấu hình tối thiểu cố định — máy nhỏ hơn chạy mô hình nhỏ hơn, nhiều bộ nhớ hơn cho phép chạy mô hình lớn hơn.

Điểm đáng chú ý với người dùng Việt Nam là toàn bộ quá trình chạy diễn ra cục bộ. Prompt, tệp tin và mô hình đều ở lại trên máy bạn, không cần kết nối internet sau khi đã tải mô hình về, và không phát sinh chi phí token.

Hướng phát triển sắp tới

Đội ngũ Magnitude cho biết họ đang tập trung vào ba hướng nâng cấp chính. Thứ nhất là truyền phát chuyên gia (expert streaming), lưu các chuyên gia trên RAM hoặc ổ đĩa và nạp đúng lúc, cho phép chạy mô hình lớn hơn cả dung lượng GPU. Thứ hai là trình biên dịch kernel chuyên dụng, tự động quyết định cách hợp nhất kernel và triển khai phù hợp nhất với phần cứng. Thứ ba là tận dụng đa thiết bị, sử dụng tối ưu CPU, GPU, RAM và ổ đĩa trên cùng một hệ thống.

Magnitude phát hành theo giấy phép Apache 2.0, hoàn toàn mã nguồn mở và miễn phí. Bạn có thể theo dõi và tham gia cộng đồng qua các kênh chính thức của dự án.

Cộng đồng Magnitude trên DiscordCộng đồng Magnitude trên Discord

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗