Mercury 2.5 đạt tốc độ 770 token mỗi giây, nhanh thứ hai trong bảng xếp hạng LLM

Công nghệ23 tháng 9, 2026·4 phút đọc

Mô hình Mercury 2.5 của Inception vừa gây chú ý khi đạt tốc độ sinh văn bản lên tới 770,4 token mỗi giây, xếp thứ hai trong bảng xếp hạng của Artificial Analysis. Tuy nhiên, chỉ số thông minh của mô hình chỉ đạt 12 điểm, thấp hơn mức trung bình so với các mô hình cùng phân khúc giá.

Mercury 2.5 đạt tốc độ 770 token mỗi giây, nhanh thứ hai trong bảng xếp hạng LLM

Trong cuộc đua mô hình ngôn ngữ lớn (LLM) ngày càng khốc liệt, tốc độ sinh văn bản đang trở thành một trong những tiêu chí cạnh tranh quan trọng bên cạnh độ thông minh và chi phí. Mercury 2.5 của Inception vừa ghi dấu ấn khi đạt tốc độ 770,4 token mỗi giây — con số đưa mô hình này lên vị trí thứ hai trong bảng xếp hạng của Artificial Analysis.

Tốc độ vượt trội, trí tuệ ở mức trung bình

Theo dữ liệu từ Artificial Analysis, Mercury 2.5 đạt 770,4 token mỗi giây khi sinh văn bản, cao hơn rất nhiều so với mức trung vị 108,6 token/giây của các mô hình suy luận cùng phân khúc giá. Đây là điểm mạnh nổi bật nhất của mô hình, phù hợp với các ứng dụng cần phản hồi nhanh như chatbot thời gian thực, trợ lý ảo hoặc các tác vụ tự động hóa quy mô lớn.

Tuy nhiên, ở khía cạnh trí tuệ, Mercury 2.5 chỉ đạt 12 điểm trên chỉ số Intelligence Index của Artificial Analysis, thấp hơn mức trung vị 13 điểm của các mô hình cùng phân khúc. Điều này cho thấy mô hình chưa thực sự nổi bật về khả năng suy luận phức tạp hay xử lý các bài toán khó.

Mercury 2.5 được đánh giá là "dưới mức trung bình về trí tuệ, nhưng có giá tốt so với các mô hình tương đương, đặc biệt nhanh và khá súc tích."

Chi phí hợp lý, tiết kiệm token đáng kể

Một điểm cộng đáng chú ý của Mercury 2.5 là mức giá cạnh tranh:

  • 0,25 USD cho mỗi 1 triệu token đầu vào
  • 0,75 USD cho mỗi 1 triệu token đầu ra
  • Chiết khấu bộ nhớ đệm (cache) lên tới 90%, chỉ còn 0,06 USD
  • Chi phí trung bình khoảng 0,06 USD mỗi tác vụ khi đánh giá trên Intelligence Index

Bên cạnh đó, mô hình này còn được đánh giá là súc tích khi chỉ sinh 35 triệu token trong quá trình đánh giá, so với mức trung vị lên tới 85 triệu token của các mô hình khác. Điều này có nghĩa là doanh nghiệp có thể tiết kiệm đáng kể chi phí vận hành nhờ ít token tiêu thụ hơn.

Thông số kỹ thuật và khả năng hỗ trợ

Mercury 2.5 là mô hình độc quyền (proprietary) do Inception phát triển, ra mắt vào tháng 9 năm 2026. Mô hình có các đặc điểm sau:

  • Cửa sổ ngữ cảnh: 260.000 token, tương đương khoảng 390 trang A4
  • Đầu vào/đầu ra: Chỉ hỗ trợ văn bản, không xử lý hình ảnh
  • Khả năng suy luận: Có hỗ trợ chain-of-thought (suy luận theo chuỗi)
  • Thời gian phản hồi token đầu tiên (TTFT): 2,91 giây, cao hơn mức trung vị 2,22 giây
  • Trọng số mô hình: Không công khai, không phải mã nguồn mở

Việc không hỗ trợ đầu vào đa phương thức (multimodal) là một hạn chế đáng kể trong bối cảnh nhiều mô hình hiện nay đã có thể xử lý hình ảnh, âm thanh và video.

Ý nghĩa với thị trường AI Việt Nam

Đối với các doanh nghiệp và lập trình viên Việt Nam đang tìm kiếm giải pháp AI tích hợp vào sản phẩm, Mercury 2.5 là một lựa chọn đáng cân nhắc nhờ tốc độ vượt trội và chi phí hợp lý. Các ứng dụng như chatbot chăm sóc khách hàng, hệ thống gợi ý sản phẩm hay công cụ soạn thảo văn bản tự động có thể hưởng lợi từ tốc độ phản hồi nhanh mà không phải trả chi phí quá cao.

Tuy nhiên, với chỉ số thông minh ở mức trung bình, mô hình này có thể không phù hợp với những tác vụ đòi hỏi suy luận phức tạp như phân tích tài chính chuyên sâu, nghiên cứu khoa học hay xử lý hợp đồng pháp lý phức tạp. Trong những trường hợp đó, người dùng có thể cần cân nhắc các mô hình mạnh hơn về trí tuệ dù tốc độ chậm hơn.

Xu hướng phân hóa mô hình AI

Sự xuất hiện của Mercury 2.5 phản ánh một xu hướng rõ ràng trong ngành: phân hóa mô hình theo mục đích sử dụng. Thay vì cố gắng tạo ra một mô hình "vạn năng" vừa thông minh vừa nhanh vừa rẻ, các nhà phát triển đang tập trung tối ưu hóa từng khía cạnh riêng biệt.

Với các doanh nghiệp, điều này đồng nghĩa với việc cần đánh giá kỹ nhu cầu thực tế để chọn mô hình phù hợp, thay vì chạy theo những mô hình có điểm số cao nhất trên các bảng xếp hạng. Đôi khi, một mô hình có tốc độ nhanh và chi phí thấp như Mercury 2.5 lại mang lại giá trị thực tiễn cao hơn cho bài toán cụ thể của họ.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗