Ember-1: Mô hình AI giúp cắt giảm 40% token mà vẫn giữ nguyên chất lượng
Fireworks Research vừa ra mắt Ember-1, một mô hình chuyên biệt được xây dựng dựa trên Kimi K3, có khả năng giảm 40% lượng token sinh ra mà không làm suy giảm chất lượng. Đây là bước tiến quan trọng giúp giảm chi phí đáng kể cho các tác vụ lập trình tự động và workload agentic.

Ember-1: Mô hình AI giúp cắt giảm 40% token mà vẫn giữ nguyên chất lượng
Fireworks Research vừa công bố Ember-1, một mô hình chuyên biệt mới được xây dựng dựa trên Kimi K3, có khả năng đạt chất lượng tương đương nhưng chỉ sử dụng ít hơn 40% token. Đây được xem là bước đột phá trong việc tối ưu hóa chi phí vận hành các mô hình suy luận (reasoning model) — vốn là bài toán đau đầu của nhiều doanh nghiệp đang triển khai AI ở quy mô lớn.
Mô hình này ra mắt trong bối cảnh các mô hình suy luận như Kimi K3 đang ngày càng phổ biến, nhưng chi phí token lại trở thành rào cản lớn, đặc biệt với các tác vụ agentic đa lượt (multi-turn) — nơi mỗi lượt hội thoại đều phải "đọc lại" toàn bộ lịch sử suy luận trước đó, khiến chi phí tăng gần như theo cấp số nhân.
Mô hình Ember-1 ra mắt với khả năng tiết kiệm token vượt trội
Vấn đề: Suy luận quá dài làm chi phí bùng nổ
Các mô hình suy luận như Kimi K3 thường dành phần lớn token sinh ra — có khi hơn 90% — cho quá trình suy luận nội bộ thay vì câu trả lời cuối cùng. Trên một yêu cầu đơn lẻ, điều này đã tốn kém, nhưng trong các tác vụ agentic nhiều bước, chi phí còn tệ hơn gấp nhiều lần.
Lý do rất đơn giản: mỗi lượt hội thoại, toàn bộ suy luận của các lượt trước đều được nạp lại vào ngữ cảnh (context). Điều này khiến ngữ cảnh tăng trưởng gần như theo bình phương số lượt, đồng nghĩa với việc doanh nghiệp phải trả tiền cho những đoạn suy luận cũ được đọc lại và tính phí nhiều lần.
Trước đây, cách xử lý phổ biến là giảm mức độ suy luận (reasoning effort) của mô hình. Tuy nhiên, Fireworks cho biết cách này khiến chất lượng sụt giảm quá nhiều — doanh nghiệp buộc phải đánh đổi giữa chi phí và độ chính xác.
Cách tiếp cận: Dạy mô hình suy luận hiệu quả hơn
Thay vì cắt giảm suy luận một cách thô bạo, nhóm nghiên cứu của Fireworks chọn hướng đi khó hơn: huấn luyện mô hình học cách suy luận hiệu quả hơn. Họ nhận thấy phần lớn suy luận của Kimi K3 là dư thừa và có thể loại bỏ mà không ảnh hưởng đến kết quả cuối cùng.
Điểm mấu chốt là phải phân biệt được đâu là suy luận dư thừa và đâu là suy luận hữu ích. Một phần suy luận của K3 mang tính tự phản tư (self-reflection) — chẳng hạn như xem xét lại một giả định, phản hồi với góp ý, hay truy vết một kết quả về quyết định trước đó. Những phần này thực sự giúp mô hình sửa sai và cần được giữ lại.
"Cơ hội nằm ở việc bảo toàn khả năng tự phản tư này trong khi giảm thiểu suy luận không cần thiết và thoát khỏi các vòng lặp vô ích."
Để làm được điều này, nhóm nghiên cứu đã thực hiện hơn 50 thí nghiệm huấn luyện và hơn 200 lần đánh giá, đồng thời phát triển các thuật toán huấn luyện mới nhằm rút ngắn suy luận mà không mất độ chính xác. Toàn bộ quá trình được thực hiện trên Fireworks Serverless Training — nền tảng không cần tự cấp phát hay quản lý GPU, giúp rút ngắn đáng kể thời gian từ nghiên cứu đến ra mắt.
Quy trình huấn luyện và đánh giá Ember-1 trên nhiều loại tác vụ
Kết quả: Chất lượng giữ nguyên, chi phí giảm một nửa
Ember-1 đã được kiểm chứng trên nhiều cấp độ khác nhau, từ benchmark công khai đến A/B testing trực tiếp trên lưu lượng sản phẩm thực tế của khách hàng.
Trên 7 benchmark công khai và lưu lượng sản xuất của 2 khách hàng, suy luận của Kimi K3 có thể được rút ngắn từ 35–50% mà không làm giảm độ chính xác. Đáng chú ý, mô hình còn cho thấy khả năng tiết chế token ngay cả trong các lần thử thất bại — giảm tình trạng suy luận dài dòng nhưng không đi đến đâu.
Trên chỉ số Specialized Intelligence Index (SII) vừa được Fireworks giới thiệu, Ember-1 đã thiết lập một đường biên Pareto mới cho benchmark Bedside Bench (gồm 500 ca lâm sàng do bác sĩ kiểm chứng) — vượt qua cả các mô hình đóng như GPT-5.6 Sol, GPT-6 Astra và Claude Opus 5 về tỷ lệ chi phí trên mỗi tác vụ.
Khi so sánh trên đường biên chất lượng - chi phí, Ember-1 liên tục nằm trên hoặc gần đường biên Pareto: đạt chất lượng tương đương K3 ở mức suy luận tối đa nhưng chỉ với một phần chi phí, đồng thời vượt trội hoàn toàn so với K3 ở mức suy luận thấp.
Ember-1 trên đường biên Pareto về chất lượng và chi phí
Thử nghiệm thực tế: Khi "không có tin gì" lại là tin tốt
Điểm đáng chú ý nhất trong quá trình thử nghiệm Ember-1 là kết quả từ các bài kiểm tra A/B trực tiếp với khách hàng và nội bộ Fireworks.
Với hai khách hàng chạy thử trên workload lập trình thực tế, Ember-1 giúp tiết kiệm khoảng 35% token mỗi tác vụ với chất lượng tương đương. Hầu hết các chỉ số sản phẩm như tỷ lệ hoàn thành tác vụ, điểm thành công và tỷ lệ thất bại đều giữ nguyên hoặc cải thiện. Sau thử nghiệm, một khách hàng đã chuyển sang chạy Ember-1 trong môi trường sản xuất thực tế, với kế hoạch mở rộng để thay thế hoàn toàn mô hình gốc.
Đáng chú ý hơn, Fireworks đã âm thầm triển khai Ember-1 cho chính đội ngũ lập trình nội bộ của mình trước khi khách hàng biết đến. Kết quả: không ai nhận ra sự thay đổi. Các lập trình viên vẫn làm việc bình thường, trong khi lượng token tiêu thụ giảm đáng kể.
"Không có tin gì chính là tin tốt. Với một mô hình mà toàn bộ giá trị nằm ở việc 'cùng câu trả lời, ít token hơn', một cuộc triển khai vô hình trên lưu lượng nội bộ là tín hiệu mạnh mẽ nhất có thể."
Ý nghĩa với thị trường AI và doanh nghiệp Việt Nam
Sự ra đời của Ember-1 phản ánh một xu hướng đang định hình lại thị trường AI: hiệu quả token đang trở thành yếu tố cạnh tranh cốt lõi, không chỉ là chất lượng mô hình.
Với các doanh nghiệp Việt Nam đang triển khai AI cho lập trình tự động, chăm sóc khách hàng hay các tác vụ agentic, chi phí token là một trong những rào cản lớn nhất khi mở rộng quy mô. Việc có một mô hình đạt chất lượng tương đương nhưng chỉ tốn khoảng một nửa chi phí có thể giúp nhiều dự án AI trở nên khả thi về mặt kinh tế hơn.
Fireworks cho biết Ember-1 sẽ được phát hành dưới dạng Research Preview trên nền tảng Serverless, cung cấp quyền truy cập miễn phí trong hai tuần và có thể trở thành lựa chọn lâu dài tùy theo nhu cầu của cộng đồng. Ngoài ra, công ty cũng ra mắt hỗ trợ huấn luyện cho Ember-1, cho phép doanh nghiệp xây dựng các mô hình tùy chỉnh, tiết kiệm token dựa trên dữ liệu riêng của mình.
Đây rõ ràng là tín hiệu cho thấy tương lai của các mô hình mở không chỉ nằm ở việc mô hình thông minh hơn, mà còn ở việc chúng thông minh hiệu quả hơn.

