Giải pháp mới nhất của Nvidia cho chi phí AI doanh nghiệp tăng vọt là... một bộ định tuyến?
Nvidia vừa ra mắt NeMo Switchyard, một nền tảng phần mềm hoạt động như bộ định tuyến thông minh để phân phối yêu cầu AI đến các mô hình khác nhau nhằm tối ưu chi phí, độ trễ và chất lượng. Nền tảng này hứa hẹn cắt giảm tới 74% chi phí hoàn thành công việc bằng cách kết hợp các mô hình lớn đắt tiền với các mô hình nhỏ, chuyên biệt hoặc mã nguồn mở chạy cục bộ.

Giải pháp mới nhất của Nvidia cho chi phí AI doanh nghiệp tăng vọt là... một bộ định tuyến?
Việc chi phí hạ tầng AI tăng cao cùng mức giá mô hình leo thang đang khiến nhiều doanh nghiệp chùn bước trước bài toán hoàn vốn đầu tư. Nhằm giúp chi tiêu AI trở nên dễ quản lý hơn, Nvidia vừa ra mắt NeMo Switchyard — một nền tảng hoạt động như "bộ định tuyến" thông minh, đưa kỹ thuật định tuyến mô hình kiểu GPT-5 đến với đại chúng doanh nghiệp.
Nền tảng này hứa hẹn cắt giảm tới 74% chi phí hoàn thành công việc so với việc chỉ sử dụng mô hình Claude Opus 4.8, dù có chấp nhận đánh đổi khoảng 6 điểm phần trăm độ chính xác.
NeMo Switchyard là gì?
Thông báo này được công bố cùng với Nemotron 3.5-30B-A3B-Lightning, mô hình mã nguồn mở mới nhất của Nvidia. Về bản chất, NeMo Switchyard là một proxy nằm giữa API endpoint của hệ thống suy luận và các mô hình AI. Thay vì gửi mọi yêu cầu đến cùng một mô hình, Switchyard có thể được cấu hình để định tuyến các prompt đến các mô hình khác nhau nhằm tối ưu chi phí, độ trễ hoặc chất lượng đầu ra.
Theo Nvidia, bằng cách chuyển một số yêu cầu sang các mô hình nhỏ hơn, rẻ hơn và có thể chạy cục bộ, doanh nghiệp có thể giảm đáng kể hóa đơn API.
Công cụ phù hợp cho từng công việc
Điểm mấu chốt trong bài toán này là chi phí hoàn thành công việc (completion cost) chứ không phải giá mỗi token. Một mô hình có thể rẻ hơn 10 lần so với mô hình hàng đầu của OpenAI hay Anthropic, nhưng nếu nó cần gấp 10 lần số token để hoàn thành yêu cầu thì thực chất không hề rẻ hơn.
Một số tác vụ AI có thể được hưởng lợi từ mô hình lớn và thông minh hơn, nhưng không phải tất cả. Ví dụ, dùng Claude Opus để tạo tiêu đề trang web hay tóm tắt nội dung là một sự lãng phí — nó có thể chạy tốt bằng Haiku hoặc một mô hình chạy cục bộ được tinh chỉnh riêng cho mục đích đó.
"Càng ít token bạn tiêu tốn cho mô hình lớn thông minh, hóa đơn API của bạn càng thấp."
Đội ngũ phần mềm của Nvidia đã phát triển nhiều mô hình chuyên biệt cho việc này. Mô hình Nemotron Parse (1 tỷ tham số) là một ví dụ:
- Chuyên xử lý PDF, trích xuất nội dung từ biểu đồ, bảng biểu
- Nhiều mô hình tiên tiến hiện nay xử lý PDF kém vì định dạng này được thiết kế cho con người
- Giúp cải thiện độ chính xác và giảm chi phí cho doanh nghiệp
Xu hướng định tuyến mô hình không mới
Đây không phải lần đầu tiên các bộ định tuyến mô hình được sử dụng như biện pháp tiết kiệm chi phí. Khi OpenAI ra mắt GPT-5, ChatGPT đã tự động chuyển hướng các prompt đến các phiên bản khác nhau dựa trên độ phức tạp.
Theo báo cáo từ The Wall Street Journal, AT&T cũng đã triển khai "bộ định tuyến thông minh" riêng. Nhờ chuyển từ mô hình độc quyền sang mô hình mã nguồn mở, gã khổng lồ viễn thông này đã tiết kiệm từ 80 đến 90% chi phí trong một số ứng dụng nhất định. Hiện khoảng 25% khối lượng công việc AI của AT&T chạy trên mô hình mở, và họ kỳ vọng con số này sẽ đạt 70-80% trong vài năm tới.
Thách thức triển khai
Mặc dù ý tưởng chuyển các yêu cầu đơn giản sang mô hình nhỏ hơn nghe có vẻ trực quan, việc thực hiện không hề dễ dàng. Với các tác vụ như tạo tiêu đề hay tóm tắt web, việc triển khai khá đơn giản. Tuy nhiên, không phải lúc nào cũng rõ ràng khi nào và ở đâu nên sử dụng mô hình tác vụ.
Switchyard là nỗ lực mới nhất của Nvidia nhằm đơn giản hóa quá trình này bằng cách tự động định tuyến yêu cầu đến đúng mô hình. Nhưng đây không phải hướng tiếp cận duy nhất. Các AI agent và trợ lý mã nguồn có khả năng tự tạo "kỹ năng" — về cơ bản là các quy trình vận hành chuẩn — để ghi lại quy trình xử lý cho các lần tham chiếu sau.
"Chúng ta đang bắt đầu thấy các tín hiệu của kiểu workflow agent và subagent. Một mô hình tiên tiến có thể đóng vai trò điều phối viên, giao việc cho các mô hình nhỏ hơn, nhanh hơn và chuyên biệt hơn." — Joey Conway, Giám đốc cấp cao mảng AI software và models tại Nvidia
Qua quá trình lặp đi lặp lại, các agent có thể tự học khi nào có thể dùng mô hình nhỏ, rẻ hơn và khi nào cần mô hình lớn hơn. Mô hình này phản ánh cách tổ chức doanh nghiệp — các chuyên gia và người điều phối.
Ngoài ra, các agent còn có thể tạo dữ liệu huấn luyện ngay trong quá trình hoạt động, sau đó dùng để tinh chỉnh mô hình hoạt động hiệu quả hơn. Bất kể hướng tiếp cận nào chiến thắng, bất cứ điều gì thúc đẩy việc áp dụng AI trong doanh nghiệp đều là chiến thắng cho Nvidia.



