Mercury 2.5 ra mắt: Mô hình ngôn ngữ khuếch tán lớn nhất, tốc độ 1.107 token/giây

Công nghệ08 tháng 9, 2026·5 phút đọc

Inception Labs vừa phát hành Mercury 2.5, mô hình ngôn ngữ khuếch tán (diffusion LLM) lớn nhất từng được huấn luyện, hứa hẹn mang lại chất lượng vượt trội với chi phí thấp. Mô hình này đạt tốc độ xử lý ấn tượng 1.107 token mỗi giây, đặc biệt phù hợp với các tác vụ yêu cầu độ trễ thấp như tìm kiếm, giọng nói và lập trình. Đi kèm với đó là các bản xem trước Mercury Voice và Mercury Router, mở rộng hệ sinh thái cho các ứng dụng AI agent.

Mercury 2.5 ra mắt: Mô hình ngôn ngữ khuếch tán lớn nhất, tốc độ 1.107 token/giây

Mercury 2.5: Mô hình AI khuếch tán nhanh nhất thế giới vừa chính thức ra mắt

Inception Labs vừa công bố Mercury 2.5, thế hệ mô hình ngôn ngữ khuếch tán (diffusion LLM) mạnh mẽ nhất của họ, được quảng bá là mô hình khuếch tán lớn nhất từng được huấn luyện. Với chất lượng tăng 40% so với phiên bản tiền nhiệm, tốc độ vượt trội 1.107 token mỗi giây và mức giá cực kỳ cạnh tranh, Mercury 2.5 hứa hẹn sẽ là một "làn gió mới" cho làng AI toàn cầu, đặc biệt là trong các ứng dụng đòi hỏi độ trễ cực thấp như tìm kiếm, trợ lý giọng nói và tác nhân lập trình.

Mô hình Mercury 2.5 có tốc độ xử lý ấn tượngMô hình Mercury 2.5 có tốc độ xử lý ấn tượng

Bước tiến vượt bậc từ phản hồi thực tế

Khác với cách phát triển dựa thuần trên benchmark, Inception Labs đã sử dụng phản hồi từ hàng nghìn nhà phát triển và các ca thất bại trong sản xuất để tinh chỉnh mô hình. Chính quy trình này đã giúp Mercury 2.5 đạt chất lượng "thông minh" tăng 40% so với Mercury 2, ngang ngửa với các mô hình tối ưu chi phí hàng đầu hiện nay như GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite hay Claude Haiku 4.5.

Hiệu năng ấn tượng với chi phí cực rẻ

Điểm nhấn lớn nhất của Mercury 2.5 nằm ở tốc độ và chi phí:

  • Tốc độ: Xử lý 1.107 token mỗi giây trên các GPU NVIDIA phổ biến, giúp các tác vụ phức tạp diễn ra gần như tức thời.
  • Giá cả: Chỉ 0,20 USD cho mỗi triệu token đầu vào và 0,75 USD cho mỗi triệu token đầu ra. Đặc biệt, trong dịp ra mắt, mức giá được giảm 80% xuống còn 0,04 USD và 0,15 USD tương ứng.

Giá rẻ và tốc độ nhanh này giúp Mercury 2.5 trở thành lựa chọn lý tưởng cho các tác vụ lặp đi lặp lại trong một luồng xử lý duy nhất, chẳng hạn như một chuỗi tìm kiếm có thể kích hoạt hàng chục lần gọi mô hình. Mô hình còn hỗ trợ các tính năng như lập luận có thể điều chỉnh, gọi công cụ song song và tạo JSON theo cấu trúc, giúp các nhà phát triển dễ dàng tích hợp vào hệ thống hiện tại.

"Cú hích" cho tác nhân AI trong lập trình và tổng đài

Sức mạnh của Mercury 2.5 đã được chứng minh qua các đối tác thực tế. Điển hình, OpenCall - công ty xây dựng tác nhân AI thay người trực tổng đài, cho biết độ trễ phản hồi trung bình đã giảm xuống còn khoảng 170 mili giây. Trong khi đó, Augment Code - một nền tảng lập trình, đã cắt giảm 82% độ trễ và 90% chi phí khi chuyển sang sử dụng Mercury cho các tác vụ nén ngữ cảnh.

Sau khi chuyển sang Mercury, thời gian phản hồi P99 của chúng tôi đã giảm từ vài phút xuống chỉ còn một giây, và P50 giảm từ 0,4 giây xuống dưới 0,2 — nhanh hơn đáng kể so với mọi nhà cung cấp khác mà chúng tôi từng thấy, bao gồm cả các mô hình lập luận.

— Oliver Silverstein, Đồng sáng lập kiêm CEO của OpenCall.

Nhà phát triển có thể xem mô hình này tự động tạo ra một ứng dụng web khám phá nhạc hoàn chỉnh chỉ từ vài câu lệnh đơn giản, cho thấy tiềm năng to lớn trong việc tăng tốc quy trình phát triển phần mềm.

Mở rộng hệ sinh thái với Mercury Voice và Mercury Router

Không dừng lại ở mô hình ngôn ngữ, Inception Labs còn công bố bản xem trước của hai sản phẩm mới:

  • Mercury Voice: Mô hình ngôn ngữ khuếch tán được tối ưu cho các tác nhân giọng nói, với thời gian đến token đầu tiên (TTFT) dưới 170 mili giây.
  • Mercury Router: Công cụ định tuyến thông minh, sử dụng dLLM để hiểu yêu cầu đến và tự động chọn mô hình tốt nhất (cả mã nguồn mở và đóng) nhằm tối ưu sự kết hợp giữa chất lượng, tốc độ và chi phí.

Cách dùng thử và triển khai

Mercury 2.5 hiện đã có sẵn thông qua API của Inception, Baseten và OpenRouter. Các doanh nghiệp có thể sử dụng các tùy chọn triển khai chuyên dụng với khả năng tự mở rộng quy mô, kiểm soát tuân thủ và cấu hình lưu trữ dữ liệu linh hoạt.

Giao diện trò chuyện với Mercury 2.5Giao diện trò chuyện với Mercury 2.5

Đối với cộng đồng khởi nghiệp, các công ty thuộc Y Combinator có thể nhận được 500.000 USD lợi ích triển khai, và các nhà phát triển có thể dùng thử miễn phí lên đến 100 triệu token.

Tương lai: Mô hình lớn hơn, mạnh hơn

Inception Labs cho biết họ đã bắt đầu huấn luyện mô hình tiếp theo — mô hình lớn nhất từ trước đến nay của họ, dự kiến ra mắt trong vài tháng tới. Mục tiêu là tạo ra một bước nhảy vọt về khả năng mà không đánh đổi tốc độ và hiệu quả token đặc trưng của kiến trúc khuếch tán. Với sự phát triển thần tốc này, Mercury đang ngày càng khẳng định vị thế của mình trong cuộc đua AI toàn cầu, mang đến cho các nhà phát triển Việt Nam cũng như quốc tế một công cụ mạnh mẽ và tiết kiệm hơn để xây dựng các ứng dụng AI thế hệ mới.

Video demo Mercury 2.5 tạo ứng dụng webVideo demo Mercury 2.5 tạo ứng dụng web

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗