Khi các công ty công nghệ bắt đầu ưa chuộng các mô hình AI giá rẻ hơn

Công nghệ09 tháng 6, 2026·5 phút đọc

Ngành công nghiệp AI đang đứng trước một bước ngoặt lớn khi xu hướng chuyển dịch từ các mô hình khổng lồ sang các phiên bản nhỏ hơn và rẻ hơn đang hình thành. Nếu các tác vụ AI có thể được xử lý mà không làm giảm chất lượng, điều này sẽ thay đổi hoàn toàn nền kinh tế của AI, gây áp lực tài chính lên các phòng thí nghiệm lớn như OpenAI hay Anthropic.

Khi các công ty công nghệ bắt đầu ưa chuộng các mô hình AI giá rẻ hơn

Sự bùng nổ của AI được xây dựng dựa trên một giả định cơ bản: Mô hình càng lớn thì càng mạnh mẽ, và mô hình mạnh mẽ nhất sẽ chiến thắng. Tuy nhiên, ngành công nghiệp này đang chuẩn bị học bài học về việc điều gì sẽ xảy ra khi giả định đó bắt đầu lung lay.

Chi phí ngày càng tăng đã gây áp lực buộc người dùng phải xem xét lại các mô hình nhỏ hơn và rẻ hơn. Việc mua sắm mô hình dựa trên tính tối ưu chi phí này còn khá mới mẻ và chưa rõ tác động cụ thể, nhưng khả năng cao là nó sẽ mang lại những thay đổi lớn.

Một dự đoán, được đưa ra rõ ràng nhất bởi đồng sáng lập Coinbase Brian Armstrong, là kết quả sẽ là phần lớn các tác vụ chuyển sang các mô hình rẻ hơn.

"Nhu cầu về trí tuệ là gần như vô hạn, nhưng 80% khối lượng công việc sẽ chạy trên các mô hình rẻ hơn 99% trong vòng 12-18 tháng tới," Armstrong viết trên X. "20% khối lượng công việc vẫn sẽ chạy trên các mô hình thế hệ mới nhất nơi việc tối đa hóa chỉ số IQ là quan trọng."

Sự thay đổi này sẽ cực kỳ quan trọng đối với ngành công nghiệp AI nếu dự đoán của Armstrong thành hiện thực.

Trước đây, hầu hết các công ty AI cạnh tranh về chất lượng, điều này đồng nghĩa với việc mặc định sử dụng mô hình tiên tiến nhất có sẵn. Nếu những công việc tương tự có thể được xử lý bởi các mô hình rẻ hơn mà không ảnh hưởng đến chất lượng, đó sẽ là một sự thay đổi lớn về kinh tế của AI. Và quan trọng hơn, phần lớn khoản tiết kiệm được sẽ lấy ra khỏi túi của các phòng lab lớn, gây thiệt hại tài chính cho OpenAI và Anthropic ngay khi họ đang hướng tới các đợt IPO.

Đây là một sự thay đổi tiềm năng mang tính địa chấn trong ngành, dựa trên một câu hỏi cơ bản: Các công ty có sẵn sàng chuyển sang các mô hình nhỏ hơn không?

Các thử nghiệm ban đầu cho thấy rằng, khi hệ thống được sắp xếp đúng cách, các mô hình rẻ hơn có thể thay thế mà không hy sinh chất lượng. Trong một thử nghiệm gần đây của công cụ pháp lý AI Harvey, công ty đã giảm được 3 lần chi phí suy luận (inference) mà không làm giảm chất lượng. Thử nghiệm này, thực hiện cùng với nền tảng suy luận Fireworks AI, đã kết hợp Claude Opus và GLM 5.1 của Fireworks, và chuyển sang Opus cho các tác vụ phức tạp nhất. Kết quả là giảm đáng kể tải máy chủ và tổng chi phí.

"Chất lượng là trên hết, và trong lĩnh vực pháp lý thì luôn luôn như vậy," Gabe Pereyra, đồng sáng lập Harvey, chia sẻ với TechCrunch, nói về dịch vụ pháp lý AI mà startup của ông cung cấp. "Tuy nhiên, định nghĩa về chất lượng đang thay đổi từ việc đơn thuần sử dụng mô hình mạnh nhất cho mọi thứ, sang việc sử dụng mô hình tốt nhất có thể đưa ra câu trả lời đúng một cách hiệu quả nhất."

Xu hướng này thường được nhìn nhận dưới góc độ các phòng lab lớn đối đầu với các mô hình Trung Quốc hoặc các mô hình mã nguồn mở (open-weight), nhưng điều đó bỏ qua điểm quan trọng hơn. Sự phân chia thực sự không phải giữa các mô hình độc quyền và mã nguồn mở; mà là giữa các mô hình lớn và mô hình nhỏ. Bạn có thể tiết kiệm tiền bằng cách chuyển từ GPT-5.5 sang DeepSeek V4 Flash, nhưng chuyển sang GPT-5.4-mini cũng mang lại hiệu quả tương tự.

Hiện đang có cuộc chiến về giá diễn ra sôi nổi giữa việc suy luận nội bộ của các phòng lab lớn và các mô hình mã nguồn mở được phục vụ độc lập. Đối với câu hỏi lớn hơn về mô hình nhỏ so với mô hình lớn, việc loại hình mô hình nhỏ nào chiến thắng thực sự không quá quan trọng.

Tất cả những điều này có vẻ hiển nhiên — tất nhiên là bạn không nên sử dụng nhiều sức mạnh tính toán hơn mức cần thiết — nhưng nó đi ngược lại cách tiếp cận "tăng quy mô trước" (scaling-first) đã thống trị ngành cho đến nay. Bị thúc đẩy bởi "bài học đắt giá", các phòng lab đã dồn lực vào việc đào tạo các mô hình tốn kém nhất có thể, mở rộng giới hạn của những gì AI có thể làm. Với giá cả được trợ cấp mạnh mẽ bởi các nhà đầu tư, khách hàng không có lý do gì để chọn bất kỳ lựa chọn nào khác ngoài tùy chọn tiên tiến nhất.

Khi giá token tăng và trợ cấp chậm lại, người dùng đang đối mặt với áp lực chi phí lần đầu tiên. Chúng ta chưa biết liệu áp lực chi phí mới này có thực sự thúc đẩy người dùng doanh nghiệp chuyển sang các mô hình nhỏ hơn hay không. Họ cũng có thể dễ dàng tiết kiệm bằng cách thực hiện ít lệnh gọi hơn, sử dụng ít ngữ cảnh hơn, hoặc đơn giản là từ bỏ các triển khai ít triển vọng nhất.

Nhưng nếu kết quả là hầu hết các triển khai có thể chạy tốt trên các mô hình nhỏ hơn, điều này có thể làm giảm nhu cầu đang tăng về suy luận — và đặt ra câu hỏi mới về cách biện minh cho chi phí đào tạo một mô hình tiên tiến (frontier model).

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗