Lỗi Codex trên AWS Bedrock khiến chi phí tăng gấp 10 lần

21 tháng 8, 2026·4 phút đọc

Một lỗi trong Codex CLI của OpenAI khi chạy trên AWS Bedrock đã khiến người dùng phải trả chi phí cao bất thường do thiếu khả năng kiểm soát bộ nhớ đệm (prompt caching). Cụ thể, các yêu cầu tới mô hình GPT-5.6 Sol đã tạo ra một lượng lớn token ghi cache, chiếm tới 85% tổng chi phí ước tính, đẩy hóa đơn lên gấp nhiều lần so với dự kiến. Sự cố này đang được cộng đồng quan tâm và yêu cầu OpenAI bổ sung các tùy chọn cấu hình để khắc phục.

Lỗi Codex trên AWS Bedrock khiến chi phí tăng gấp 10 lần

Lỗi Codex trên AWS Bedrock khiến chi phí tăng gấp 10 lần

Một sự cố nghiêm trọng vừa được báo cáo trên kho lưu trữ chính thức của OpenAI, cho thấy Codex CLI (phiên bản 0.147.0) khi kết nối với Amazon Bedrock không thể tận dụng tối ưu cơ chế lưu trữ bộ nhớ đệm (prompt caching) của mô hình GPT-5.6 Sol. Hậu quả là người dùng phải chịu chi phí "khủng" do token ghi cache (cache-write) tăng đột biến, lên đến gấp 10 lần so với mức thông thường.

Vấn đề nằm ở đâu?

Theo báo cáo chi tiết từ người dùng có tên apexethdev trên GitHub, toàn bộ yêu cầu từ Codex tới API Responses của Bedrock Mantle đều thiếu các trường cấu hình quan trọng như prompt_cache_optionsprompt_cache_breakpoint. Điều này khiến mô hình không thể tái sử dụng phần đầu của prompt (thường là các hướng dẫn và định nghĩa công cụ ổn định), dẫn đến việc phải ghi lại từ đầu mỗi lần thực hiện tác vụ lập trình.

Cụ thể, số liệu thống kê trong 4 ngày (từ 5/8 đến 8/8) cho thấy:

  • Tổng số yêu cầu: 3.656
  • Token ghi cache: 171,94 triệu
  • Chi phí ước tính cho ghi cache: 1.182,09 USD
  • Tổng chi phí ước tính: 1.386,46 USD

Như vậy, chi phí ghi cache chiếm tới 85% tổng hóa đơn. Trong một phiên chạy thử nghiệm cục bộ, người dùng cũng ghi nhận trung bình khoảng 88.000 token ghi cache cho mỗi yêu cầu, trong khi số token đọc cache (cached_input_tokens) bằng 0, cho thấy cơ chế lưu trữ hoàn toàn không được kích hoạt.

Tác động và nguyên nhân sâu xa

Vấn đề không chỉ dừng lại ở việc tăng chi phí. Nó cho thấy một thiếu sót trong thiết kế của Codex CLI khi sử dụng nhà cung cấp Bedrock:

  • Codex có phát ra một khóa gọi là prompt_cache_key ở cấp độ phiên, nhưng các yêu cầu HTTP và WebSocket đều không truyền tải các tham số tùy chọn cho việc lưu trữ cache.
  • Cấu hình mặc định trong config.toml chỉ bao gồm các thiết lập về giao thức và xác thực, không cho phép người dùng can thiệp vào cấu trúc request body.
  • Tài liệu AWS có đề cập đến chế độ cache riêng cho GPT-5.6 trên Bedrock, vốn được thiết kế cho các quy trình agentic với chuỗi hướng dẫn dài và ổn định – đúng với workload mà Codex thường xử lý.

Yêu cầu và phản hồi từ cộng đồng

Người báo cáo đã đưa ra một số đề xuất cụ thể cho nhóm phát triển OpenAI:

  1. Bổ sung khả năng tuần tự hóa prompt_cache_options cho các nhà cung cấp hỗ trợ GPT-5.6.
  2. Thêm trường prompt_cache_breakpoint vào các khối nội dung đầu vào.
  3. Cung cấp cơ chế kiểm soát để đặt điểm dừng cache một cách an toàn, phù hợp với tiền tố hướng dẫn của Codex.
  4. Hiển thị số liệu đọc/ghi cache trong telemetry sử dụng hằng ngày để người dùng tự chẩn đoán chi phí.

Báo cáo cũng khéo léo chỉ ra rằng, không phải mọi thao tác ghi cache đều là lỗi. Các phiên khởi động nguội, prompt khác biệt, hoặc việc nén (compaction) đều có thể dẫn đến ghi mới. Vấn đề cốt lõi là Codex hiện không có cách nào để tận dụng cơ chế cache rõ ràng mà AWS đã hỗ trợ, dẫn đến việc trả tiền mà không nhận được lợi ích tương ứng.

Bài học cho người dùng Việt Nam

Đối với các lập trình viên và doanh nghiệp tại Việt Nam đang sử dụng Codex CLI kết hợp với AWS Bedrock, đây là một lời cảnh báo quan trọng. Trước khi triển khai vào sản xuất, bạn nên:

  • Theo dõi sát sao chi phí trên AWS Cost Explorer để phát hiện sớm các bất thường.
  • Kiểm tra phiên bản Codex CLI và cập nhật thường xuyên để nhận được các bản vá sửa lỗi.
  • Cân nhắc sử dụng các nhà cung cấp API trực tiếp của OpenAI thay vì Bedrock nếu chưa cần thiết đến mức chi phí tăng cao.

Sự cố này vẫn đang được xử lý trên GitHub và chưa có phản hồi chính thức từ OpenAI. Tuy nhiên, với mức độ ảnh hưởng lớn đến chi phí, nhiều khả năng bản vá sẽ sớm được phát hành trong các phiên bản tiếp theo của Codex CLI.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗