Khi Chi Phí Trí Tuệ Nhân Tạo Giảm 100 Lần: Điều Gì Sẽ Xảy Ra?
Bài viết phân tích xu hướng giảm giá mạnh mẽ của các mô hình AI, khi chi phí cho một mức năng lực nhất định đã giảm 56 lần chỉ trong chưa đầy sáu tháng và có thể chạm mốc 100 lần trong khoảng một năm. Sự sụt giảm này không chỉ giúp các tác vụ hiện tại rẻ hơn mà còn mở ra một loạt ứng dụng mới nhờ vào khả năng triển khai ở quy mô lớn. Tác giả cũng dự đoán về tương lai khi 'đọc tất cả' trở thành mặc định và các kiến trúc phần mềm cần phải thích ứng.

Khi Chi Phí Trí Tuệ Nhân Tạo Giảm 100 Lần: Điều Gì Sẽ Thay Đổi?
Sự tiến bộ của các mô hình ngôn ngữ lớn (LLM) thường được đo bằng việc mô hình tốt nhất có thể làm được điều gì mới. Nhưng có một hướng tiến bộ ít được chú ý hơn, đó là chi phí để mua một mức năng lực nhất định đang giảm xuống chóng mặt. Một phân tích mới đây cho thấy mức trí tuệ từng có giá 1,22 USD mỗi tác vụ vào tháng 2 giờ chỉ còn 0,022 USD, tương đương mức giảm 56 lần trong chưa đầy sáu tháng, và tốc độ này đang tăng tốc.
Bài viết trên blog CatalystNeuro của Ben Dichter đã thu hút sự chú ý của cộng đồng công nghệ khi phân tích kỹ lưỡng về sự dịch chuyển của "đường biên Pareto" (Pareto frontier) trong lĩnh vực AI. Đường biên này biểu thị mối quan hệ giữa năng lực của mô hình và chi phí vận hành. Nghiên cứu chỉ ra rằng một mức năng lực cụ thể sẽ trải qua chu kỳ: ra mắt với giá cao, sau đó nhanh chóng được thương mại hóa với giá rẻ, và cuối cùng bị chiếm lĩnh bởi các mô hình nhỏ hơn với chi phí chỉ bằng vài phần trăm so với ban đầu.
Minh họa đường biên Pareto của các mô hình AI
Hai Hướng Tiến Bộ Của AI
Sự phát triển của AI thường được nhắc đến qua hai hướng. Hướng thứ nhất là "trần" (ceiling) — mức năng lực cao nhất mà mô hình tốt nhất có thể đạt được. Hướng thứ hai là "sàn" (floor) — chi phí để mua một mức năng lực nhất định. Trong khi trần nhà tạo ra những khả năng hoàn toàn mới, thì sàn thấp lại cho phép triển khai ở quy mô lớn.
Một khối lượng lớn công việc hữu ích không đòi hỏi mô hình thông minh nhất, mà cần một mô hình đủ tốt, được áp dụng hàng nghìn lần.
Ví dụ điển hình là việc đọc toàn bộ các bài báo khoa học về một chủ đề, kiểm tra mọi hợp đồng trong kho lưu trữ, hoặc tóm tắt toàn bộ các luồng thảo luận trong một diễn đàn lớn. Với những tác vụ này, câu hỏi không phải là liệu có mô hình nào làm được không, mà là liệu nó có thể làm việc đó mười nghìn lần trong một ngân sách nhất định hay không.
Tốc Độ Giảm Chi Phí Đang Tăng Tốc
Dữ liệu từ Artificial Analysis Intelligence Index cho thấy sự dịch chuyển ngoạn mục của đường biên Pareto. Chỉ trong vòng một năm, mức trí tuệ từng có giá 1,22 USD mỗi tác vụ vào tháng 2 năm 2026 (Claude Sonnet 4.6) giờ đây chỉ còn 0,022 USD với GPT-5.6 Luna (medium). Con số này tương đương mức giảm 56 lần chỉ trong chưa đầy sáu tháng, và nếu tính cả việc Luna được giảm giá 80% vào ngày 30 tháng 7, mức giảm có thể lên tới hàng trăm lần so với thời điểm ra mắt ban đầu.
Các mức năng lực khác nhau đều có tốc độ giảm giá đáng kinh ngạc:
- Mức Index ≥ 30: Giảm 29 lần, thời gian để chi phí giảm một nửa là khoảng 73 ngày
- Mức Index ≥ 40: Giảm 56 lần, thời gian giảm một nửa chỉ còn 28 ngày
- Mức Index ≥ 50: Giảm 35 lần, thời gian giảm một nửa khoảng 29 ngày
- Mức Index ≥ 60: Mới giảm 3,8 lần, nhưng theo quy luật, sẽ sớm giảm mạnh
Nghịch Lý Jevons Trong Kỷ Nguyên AI
Một góc nhìn tự nhiên từ các biểu đồ này là chi tiêu cho LLM sẽ giảm xuống. Nhưng thực tế đang diễn ra ngược lại. Đây chính là nghịch lý Jevons, một khái niệm kinh tế ra đời từ năm 1865 khi quan sát thấy động cơ hơi nước hiệu quả hơn (dùng ít than hơn) lại làm tăng tổng lượng than tiêu thụ của nước Anh, vì chi phí rẻ hơn đã tạo ra nhiều ứng dụng hơn.
So sánh các mô hình AI ở mức năng lực khác nhau
Khi chi phí cho một đơn vị trí tuệ giảm 30 lần, công việc đang được thực hiện sẽ rẻ hơn, nhưng hiệu ứng lớn hơn nhiều là những công việc trước đây không được thực hiện vì không vượt qua ngưỡng chi phí. Nghiên cứu của CatalystNeuro là một ví dụ nhỏ: với giá của năm ngoái, họ chỉ có thể chạy phân tích trên một mẫu dữ liệu, nhưng với giá hiện tại, họ chạy trên toàn bộ kho dữ liệu, lặp lại khi quy trình thay đổi, và lên kế hoạch chạy mỗi kết quả ba lần để giảm nhiễu. Chi phí mỗi bài báo giảm hơn một bậc độ lớn, nhưng tổng chi tiêu cho dự án lại tăng lên.
Kiến Trúc Phần Mềm Cần Thích Ứng
Nếu một năng lực tồn tại ở bất kỳ mức giá nào hôm nay, giả định lập kế hoạch hợp lý là nó sẽ có giá bình dân trong vòng vài tháng. Điều này đặt ra yêu cầu cho việc thiết kế hệ thống: mô hình nên là một thành phần có thể thay thế, và việc định tuyến giữa các mức năng lực cần phải rõ ràng.
Việc hardcode tên một mô hình vào ứng dụng đã trở thành cách nhanh nhất để trả quá nhiều tiền.
Các bộ định tuyến mô hình (model routers) đang xuất hiện trên thị trường là dấu hiệu cho thấy xu hướng này đang được vận hành hóa. OpenRouter hiện cung cấp bộ định tuyến có khả năng nhận điểm năng lực tối thiểu và tự động gửi mỗi yêu cầu đến mô hình rẻ nhất trên đường biên Pareto đáp ứng yêu cầu đó, giúp hệ thống tự động hưởng lợi từ sự dịch chuyển của đường biên.
Điều Gì Xảy Ra Khi Chi Phí Giảm 100 Lần?
Nếu tốc độ của năm qua được duy trì, khả năng có giá 1 USD mỗi tác vụ vào đầu năm 2026 sẽ chỉ còn 1 xu vào cuối năm. Hệ quả trực tiếp từ những con số này:
Đọc tất cả trở thành mặc định. Ở mức 1 xu mỗi tài liệu, một mô hình có thể đọc mọi bài báo trong một lĩnh vực, mọi bản ghi trong kho lưu trữ, mọi email, hay mọi tin nhắn trong hàng đợi hỗ trợ. Câu hỏi chuyển từ "xem xét tài liệu nào" sang "đặt câu hỏi gì cho tất cả chúng".
Mô hình AI tạo hình ảnh theo yêu cầu ở mức năng lực cao
Quy trình đa bước trở thành chuẩn mực. Chạy một tác vụ ba lần và lấy kết quả đồng thuận giờ đây rẻ hơn so với chạy một lần vài tháng trước. Lợi ích về độ chính xác từ phương pháp này là rất lớn.
Các mức năng lực không còn ý nghĩa để mô tả hệ thống. Một pipeline sẽ định tuyến mỗi bước đến mức trí tuệ cần thiết với chi phí phù hợp vào tuần đó. Tài nguyên khan hiếm trong thế giới này không còn là trí tuệ, mà là khả năng phán đoán nên tập trung vào việc gì, dữ liệu gốc để kiểm chứng, và hệ thống để vận hành ở quy mô lớn. Đó là những phần công việc không trở nên rẻ hơn.
Về tác giả: Ben Dichter, PhD là Nhà sáng lập CatalystNeuro, một nhà tư vấn khoa học dữ liệu cho các phòng thí nghiệm khoa học thần kinh, tập trung vào việc xây dựng hệ thống chia sẻ dữ liệu và phân tích.
Bài viết liên quan

Công nghệ
RAG cho bảng dữ liệu: Truy xuất từng dòng thay vì toàn bộ bảng
21 tháng 8, 2026

Công nghệ
Con ruồi desktop biết 'ngửi' mã nguồn: Khi connectome ruồi giấm gặp vibe coding
21 tháng 8, 2026

Công nghệ
Hệ điều hành B-right/V R2: Tầm nhìn tiên phong về môi trường đa ngôn ngữ từ dự án TRON của Nhật Bản
21 tháng 8, 2026