Meta Muse Spark 1.3: Hiệu năng 'frontier' nhưng điểm mạnh nhất vẫn chưa thể triển khai rộng rãi
Meta vừa ra mắt Muse Spark 1.3, mô hình AI mới nhất được Mark Zuckerberg ca ngợi là 'gần như rẻ đến mức không cần đo đếm', với cải tiến vượt bậc về tốc độ và hiệu năng lập trình. Tuy nhiên, điểm số benchmark ấn tượng nhất lại đến từ phiên bản 'max' còn đang trong quá trình kiểm tra an toàn, trong khi bản phát hành rộng rãi (xhigh) có hiệu năng thấp hơn đôi chút. Bài viết phân tích sâu về chiến lược giá, cuộc đua với Google Gemini và lộ trình open-weight đang trở nên mơ hồ của Meta.

Meta vừa chính thức trình làng Muse Spark 1.3, mô hình AI thế hệ mới nhất của hãng, được giới thiệu là nhanh hơn và mạnh hơn đáng kể so với phiên bản tiền nhiệm trên các bảng xếp hạng độc lập. Dù vậy, điều khiến giới công nghệ chú ý không chỉ nằm ở con số benchmark, mà còn ở một sự thật quan trọng: những kết quả tốt nhất của mô hình này lại đến từ một phiên bản cấu hình đặc biệt mà các nhà phát triển thông thường chưa thể truy cập.
"Hiệu năng frontier gần như rẻ đến mức không cần đo đếm"?
Phát biểu trên mạng xã hội X, CEO Meta Mark Zuckerberg đã không tiếc lời khen ngợi sản phẩm mới:
"Muse Spark 1.3 đang được triển khai hôm nay với hiệu năng frontier gần như rẻ đến mức không cần đo đếm, đánh dấu bước nhảy vọt lớn nhất của Meta trong lĩnh vực lập trình và công việc agentic."
Tuyên bố này có phần đúng với sự thật. So với bản 1.2 ra mắt hồi tháng trước, Muse Spark 1.3 đã có những cải thiện vượt bậc, đặc biệt là trong các tác vụ agent dài hơi. Tuy nhiên, một chi tiết quan trọng mà Meta không nhấn mạnh ở phần đầu là: điểm số benchmark tốt nhất mà họ công bố thuộc về cấu hình "max" — phiên bản sử dụng nhiều sức mạnh suy luận nhất.
Meta xác nhận rằng phiên bản max này vẫn đang trải qua các bài kiểm tra an toàn bổ sung và sẽ được phát hành "ngay sau đó". Tổ chức đánh giá độc lập Artificial Analysis cho biết họ chỉ được đánh giá phiên bản max trong một chương trình xem trước giới hạn cho đối tác, và hiện tại không có bất kỳ nhà cung cấp API nào có thể phục vụ cấu hình này.
Phiên bản được phát hành rộng rãi trong tuần này thông qua công cụ Muse Code và Meta Model API sử dụng các cấu hình suy luận có sẵn trước đó, bao gồm cả xhigh. Điều này đặt ra một câu hỏi quan trọng cho doanh nghiệp: không phải liệu Muse Spark 1.3 có thể đạt tới vùng "frontier" hay không, mà là phiên bản họ thực sự có thể triển khai hôm nay đạt tới mức nào và với chi phí thực tế ra sao.
Phiên bản phát hành rất tốt, nhưng chưa phải là nhà vô địch benchmark
Meta hoàn toàn công khai kết quả của cả hai cấu hình trong báo cáo đánh giá chi tiết. Tuy nhiên, các tài liệu ra mắt của họ luôn nêu bật phiên bản max và những điểm số lớn nhất đều thuộc về cấu hình này.
Cụ thể, Meta báo cáo điểm GDPval-AA v2 lần lượt là 1.754 Elo (max) so với 1.709 (xhigh); OSWorld 2.0 đạt 66,9 so với 57,2; và JobBench đạt 64,9 so với 61,2. Ở một số bài kiểm tra khác, sự khác biệt gần như không đáng kể hoặc thậm chí đảo chiều: DeepSearchQA đồng hạng ở mức 89,4, trong khi xhigh lại đạt 89,2 trên Terminal-Bench 2.1 so với 88,8 của max.
Theo đánh giá từ Artificial Analysis, Muse Spark 1.3 max đạt 62 điểm trên Chỉ số Trí tuệ (Intelligence Index) trong khi phiên bản xhigh đang phát hành đạt 61 điểm. Con số này giúp xhigh ngang hàng với GPT-5.6 Sol max, Grok 4.6 high và Claude Opus 5 high. Dù vậy, vị trí dẫn đầu vẫn thuộc về Anthropic khi Claude Fable 5.1 đạt tới 66 điểm ở cấu hình max và 65 ở xhigh.
Nói cách khác, Muse Spark 1.3 xhigh được xếp vào nhóm các mô hình có hiệu năng dẫn đầu, nhưng chưa phải là mô hình đang thiết lập giới hạn mới cho ngành.
Tuy nhiên, đây vẫn là một bước tiến đáng kể so với Muse Spark 1.2. Vào tháng trước, VentureBeat nhận định Meta đang có một thách thức lập trình đáng tin cậy nhưng vẫn thường xuyên xếp sau các mô hình tốt nhất của Anthropic. Muse Spark 1.2 chỉ đạt 82,9% trên Terminal-Bench 2.1 trong khi Opus 5 đạt 86,7%. Với 1.3, Meta không chỉ tham gia cuộc đua nữa mà đang trực tiếp cạnh tranh sòng phẳng với OpenAI và Anthropic trên nhiều bài đánh giá.
Meta cũng tuyên bố mô hình này dễ vận hành hơn đáng kể. Muse Spark 1.3 được huấn luyện để duy trì nhiều luồng công việc trong một phiên dài, chủ động thu thập ngữ cảnh từ các công cụ, phát hiện các khoảng trống trong kế hoạch của chính nó, hỏi người dùng để làm rõ khi cần thiết và xác nhận trước các hành động quan trọng. Trong các so sánh nội bộ của kỹ sư Meta, mô hình mới sử dụng ít hơn khoảng 20% số lần gọi công cụ và 25% số token so với 1.2 trong các tác vụ lập trình.
"Rẻ đến mức không cần đo đếm" không có nghĩa là Meta giảm giá
Muse Spark 1.3 không nhận được bất kỳ đợt giảm giá API nào. Meta vẫn giữ nguyên mức giá tiêu chuẩn như 1.2: 1,25 USD cho mỗi triệu token đầu vào, 4,25 USD cho mỗi triệu token đầu ra và 0,15 USD cho mỗi triệu token đầu vào được lưu trong bộ nhớ đệm.
Câu nói của Zuckerberg vì vậy không nhằm khẳng định giá token rẻ hơn mà là về những gì Meta tin rằng các nhà phát triển có thể hoàn thành với số token đó.
Dữ liệu từ Artificial Analysis cung cấp bằng chứng cho lập luận này, nhưng cũng bộc lộ một nghịch lý thú vị. Theo đó, Muse Spark 1.3 xhigh đạt tốc độ 235,2 token đầu ra mỗi giây, với chi phí ước tính khoảng 0,55 USD cho mỗi tác vụ trên Intelligence Index. Với 61 điểm, đây là mô hình có chi phí thấp nhất cho mỗi tác vụ trong số các mô hình ở cùng mức độ thông minh. Trong khi đó, Muse Spark 1.2 chỉ tốn 0,40 USD cho mỗi tác vụ nhưng chỉ đạt 57 điểm.
Điều này đồng nghĩa với việc dù giá mỗi token không đổi, chi phí hoàn thành một tác vụ trung bình theo đánh giá độc lập đã tăng lên giữa các thế hệ. Artificial Analysis lý giải sự gia tăng này chủ yếu đến từ việc mô hình tiêu thụ nhiều token đầu vào hơn trong các bài đánh giá agentic. Điều này không hẳn mâu thuẫn với tuyên bố của Meta về việc giảm 25% lượng token sử dụng — Meta đang mô tả trên các quy trình lập trình nội bộ của họ, trong khi Artificial Analysis đánh giá trên một bộ bài kiểm tra suy luận và agentic rộng hơn. Tuy nhiên, nó cho thấy khái niệm "rẻ" trở nên khó định lượng khi các mô hình hoạt động như các agent độc lập.
Ngoài ra, Meta vẫn giữ gói Contributor với giá cực rẻ — 0,10 USD mỗi triệu token đầu vào và 0,20 USD mỗi triệu token đầu ra — đổi lại quyền được sử dụng dữ liệu đầu vào và đầu ra để huấn luyện. Mức giá này có thể hấp dẫn cho việc thử nghiệm ý tưởng, nhưng lại tạo ra những rủi ro lớn về quyền riêng tư dữ liệu cho các doanh nghiệp đang làm việc với mã nguồn độc quyền hoặc thông tin nội bộ nhạy cảm.
Màn khẩu chiến 'Gemini who?' và cuộc đua sít sao
Giám đốc AI của Meta, Alexandr Wang, đã có màn ăn mừng đầy khiêu khích trên X sau khi Artificial Analysis công bố kết quả:
"Tôi thực sự ghét phải nói điều này, nhưng… Gemini ai cơ? 😱💨"
Màn khẩu chiến này càng gay cấn hơn khi Google cũng tung ra Gemini 3.8 Flash vào cùng ngày, nhắm vào đúng phân khúc khối lượng công việc: kỹ thuật phần mềm dài hơi, agent tự động và các tác vụ suy luận chuyên nghiệp đa bước. Google quảng cáo đây là mô hình Flash tốt nhất về suy luận và lập trình từ trước đến nay.
Số liệu độc lập ủng hộ một phần tuyên bố của Wang nhưng không phải là một cú knock-out. Artificial Analysis cho Muse Spark 1.3 xhigh 61 điểm với chi phí 0,55 USD mỗi tác vụ, trong khi Gemini 3.8 Flash ở cấu hình suy luận cao chỉ đạt 59 điểm với chi phí 0,58 USD. Meta nhỉnh hơn cả về trí tuệ lẫn chi phí.
Tuy nhiên, Google lại thắng áp đảo về thông lượng. Gemini 3.8 Flash đạt tốc độ khoảng 305 token đầu ra mỗi giây, cao hơn khoảng 30% so với con số 235 của Muse Spark. Google cũng đang có mức giá API thấp hơn trong giai đoạn khuyến mãi: 0,75 USD cho mỗi triệu token đầu vào và 3,75 USD cho mỗi triệu token đầu ra, so với 1,25 USD và 4,25 USD của Meta. Tuy nhiên, mức giá khuyến mãi này của Google sẽ hết hạn vào ngày 31/12, sau đó tăng lên 1,50 USD và 7,50 USD tương ứng.
Cuộc so sánh này cho thấy nền kinh tế mô hình AI biên giới đang cạnh tranh khốc liệt đến mức nào. Meta đang thắng trong cuộc so sánh độc lập này với 2 điểm chỉ số và 3 cent cho mỗi tác vụ benchmark; Google lại cung cấp thông lượng đầu ra cao hơn đáng kể và token thô rẻ hơn trong thời gian khuyến mãi. Với các kiến trúc sư doanh nghiệp, câu trả lời cho câu hỏi "Gemini ai cơ?" có lẽ là: Gemini là lựa chọn nhanh hơn, còn Muse là agent mạnh hơn một chút theo đánh giá độc lập này.
Thay đổi chiến lược về trọng số mở (open weights)
Vấn đề hệ trọng hơn, gây lo ngại cho không ít nhà phát triển, lại không liên quan đến cuộc đua benchmark hiện tại.
Khi Meta ra mắt Muse Code và Muse Spark 1.2 vào tháng 8, giới quan sát đã chỉ ra sự thay đổi chóng mặt của hãng so với chiến lược open-source đã làm nên tên tuổi của các mô hình Llama. Cả hai sản phẩm này đều là các mô hình độc quyền, chỉ phục vụ qua API — một sự đảo chiều gây sốc với một công ty từng nhiều năm khẳng định AI mở là con đường đúng đắn.
Chỉ 5 ngày sau đó, Meta lại đổi hướng. Ngày 10/8, họ phát hành mô hình Muse Glimmer 30 tỷ tham số theo giấy phép Apache 2.0. Zuckerberg cũng cam kết: "Trong những tuần tới, chúng tôi sẽ mở trọng số cho Muse Spark 1.2".
Giờ đây, thay vì mở trọng số Spark 1.2, Meta lại phát hành tiếp một mô hình độc quyền khác là Muse Spark 1.3. Thông báo mới nhất không còn nhắc đến Muse Spark 1.2 nữa mà chỉ mơ hồ đề cập đến "bản phát hành trọng số mở Muse Spark" trong lộ trình, không xác định rõ phiên bản, ngày phát hành, kích thước hay giấy phép.
Với các đội ngũ đã chuẩn hóa quy trình theo hệ sinh thái Llama — nơi việc tải trọng số về đồng nghĩa với việc tự triển khai, tùy chỉnh và kiểm soát chi phí suy luận — sự mơ hồ này có thể còn đáng lo ngại hơn cả việc mô hình có thêm vài điểm benchmark hay không.
Muse Spark 1.3 chứng minh Meta có thể phát triển các mô hình độc quyền với tốc độ đáng kinh ngạc. Phiên bản xhigh đang phát hành nhanh, có giá cạnh tranh và gần đỉnh bảng xếp hạng hơn nhiều so với các thế hệ trước. Tuy nhiên, bài kiểm tra tiếp theo của Meta không nằm ở tốc độ phát hành, mà là liệu họ có thể biến tốc độ đó thành một lộ trình rõ ràng để doanh nghiệp có thể lên kế hoạch — bao gồm việc đưa các tính năng tốt nhất vào triển khai rộng rãi và thực sự tung ra mô hình Spark với trọng số mở như đã hứa.