Strands Harness chính thức ra mắt: Bộ khung agent đa năng tiết kiệm 28% chi phí so với Claude Code và Codex

Công nghệ23 tháng 9, 2026·6 phút đọc

Strands vừa phát hành Strands Harness — bộ khung agent hoàn chỉnh, chạy được cả cục bộ lẫn trên cloud, chỉ cần một dòng Python hoặc TypeScript để khởi tạo. Theo nhóm phát triển, giải pháp này tiết kiệm 28% chi phí khi dùng cùng mô hình Claude hoặc GPT trên sáu bộ kiểm thử, đồng thời đạt độ chính xác tương đương các harness phổ biến khác. Sản phẩm phát hành theo giấy phép Apache 2.0.

Strands Harness chính thức ra mắt: Bộ khung agent đa năng tiết kiệm 28% chi phí so với Claude Code và Codex

Strands vừa chính thức giới thiệu Strands Harness — một bộ khung agent (agent harness) đã được lắp ráp hoàn chỉnh, cho phép lập trình viên chạy thử cục bộ hoặc triển khai lên nhà cung cấp cloud yêu thích chỉ với một dòng mã Python hoặc TypeScript. Điểm đáng chú ý: theo nhóm phát triển, giải pháp này tiết kiệm tới 28% chi phí khi dùng cùng các mô hình Claude hay GPT trên sáu bộ kiểm thử chuẩn, mà vẫn giữ độ chính xác ngang bằng hoặc tốt hơn.

Vì sao lại cần một bộ khung agent mới?

Nhóm phát triển cho biết họ nhận thấy nhiều lập trình viên mong muốn thiết lập Claude Code hoặc Codex của mình chạy trên cloud, bởi vì khi chạy cục bộ, ý tưởng về agent của họ "chạy được ngay" với những harness đó.

"Nhưng khoảnh khắc bạn tự xây dựng agent cho riêng mình, bạn phải tự lo mọi thứ. Việc kết nối các nguyên hàm (primitive) sao cho vừa đủ khớp với cảm giác 'chạy được ngay' ấy thực sự rất khó."

Strands Harness ra đời để lấp khoảng trống đó. Đây là một harness đa năng (general-purpose) chứ không chỉ chuyên cho lập trình. Người dùng chỉ cần chọn mô hình theo tên — Amazon Bedrock, Anthropic, OpenAI, Google, Ollama hay LiteLLM — là có thể bắt đầu.

Hiệu quả chi phí và độ chính xác

Theo công bố của Strands, khi dùng cùng mô hình Claude hoặc GPT trên sáu bộ kiểm thử, Strands Harness có chi phí thấp hơn 28%. Nhóm nghiên cứu ghi nhận harness này có hiệu suất token tốt hơn và điểm kiểm thử gần như tương đương Claude Code, Codex cùng các harness phổ biến khác.

Đáng chú ý, Deepseek Harness được đánh giá là tiết kiệm token nhất trong số các harness, nhưng thường có điểm chính xác thấp nhất. Điều này cho thấy bài toán tối ưu chi phí mà không đánh đổi độ chính xác vẫn là thách thức lớn.

Với Fable 5, Strands Harness có chi phí thấp hơn 77% so với Claude Code và đạt điểm cao hơn trên Terminal Bench 2.1.

Thiết lập kiểm thử được thực hiện theo phương pháp đo lường phân tán trên EC2 với Harbor. Nhóm phát triển cho biết sẽ công bố một bài báo khoa học tiếp theo về các kết quả benchmark này.

Bí quyết nằm ở quản lý ngữ cảnh

Strands Harness được xây dựng trên Strands Harness SDK, tích hợp sẵn các thiết lập mặc định cho bộ nhớ đệm prompt (prompt caching)quản lý ngữ cảnh (context management).

Cơ chế quản lý ngữ cảnh mặc định gồm ba điểm chính:

  • Kết quả công cụ dài hơn ~1500 token sẽ bị cắt ngắn
  • Quá trình tóm tắt (compaction) kích hoạt khi cửa sổ ngữ cảnh vượt 85%
  • Phục hồi ngữ cảnh chạy trong vòng lặp nếu xảy ra tràn ngữ cảnh

Theo nhóm phát triển, chính cơ chế này đóng góp phần lớn vào hiệu suất token và độ chính xác của harness.

Bắt đầu chỉ với một dòng lệnh

Strands Harness hỗ trợ các mô hình mới nhất trên Amazon Bedrock, Anthropic, OpenAI và Google, hoặc trỏ tới mô hình Ollama chạy cục bộ. Ví dụ với Python:

from strands_harness import create_harness

agent = create_harness(model="anthropic/claude-opus-5")
agent("Research the top three vector databases, compare pricing and limits, and write it up in comparison.md")

Hoặc với TypeScript:

import { createHarness } from "@strands-agents/harness";

const agent = await createHarness({ model: "anthropic/claude-opus-5" });
await agent("Research the top three vector databases, compare pricing and limits, and write it up in comparison.md");

Hàm create_harness() trả về một agent có sẵn nhiều khả năng:

  • Chạy trên mô hình suy luận hiện hành thuộc Bedrock, Anthropic, OpenAI, Google, Ollama hoặc LiteLLM
  • Trang bị sẵn công cụ shell, file (đọc/ghi/sửa) và web — những nguyên hàm mà mô hình đã biết cách dùng, thay vì công cụ riêng cho từng tác vụ
  • Tự quản lý cửa sổ ngữ cảnh: chuyển kết quả công cụ cồng kềnh ra file và đệm phần dùng lại của mỗi yêu cầu để tiết kiệm thời gian lẫn chi phí
  • Duy trì bộ nhớ dài hạn xuyên suốt các lần chạy, và khôi phục cuộc hội thoại cũ nếu cung cấp session ID
  • Ủy thác các tác vụ con mở cho một agent trợ giúp tích hợp, đồng thời theo dõi công việc nhiều bước bằng checklist
  • Tự động nạp các skill nếu tồn tại

Triển khai linh hoạt trên mọi nền tảng

Strands Harness có thể triển khai trên bất kỳ nhà cung cấp nào hỗ trợ container Linux, bao gồm Modal, Cloudflare Containers, Azure Container Apps, Google Cloud Run, Amazon ECS và Amazon Bedrock AgentCore.

Nhóm phát triển cũng cung cấp Strands CLI cho phép tạo nguyên mẫu agent bằng ngôn ngữ tự nhiên. Sau khi kết nối nhà cung cấp mô hình và thêm prompt cùng công cụ, người dùng có thể chạy lệnh /export để lấy mã nguồn TypeScript hoặc Python — một cách thuận tiện để tiếp tục tinh chỉnh với coding agent quen thuộc.

Trong video minh họa, nhóm phát triển yêu cầu agent "thêm Playwright MCP" rồi đo độ trễ khi tải video trên một bài blog. Sau khi xác nhận các công cụ MCP hoạt động chính xác, họ chỉ cần chạy /export để lấy mã Strands Harness.

Có thể xây dựng gì từ Strands Harness?

Bản thân Strands CLI được xây dựng trên Strands Harness. Nhóm phát triển cho biết chính khả năng tạo nguyên mẫu dễ dàng đã mở ra nhiều ý tưởng tham vọng. Gần đây, kỹ sư Gautam Sirdeshmukh — lấy cảm hứng từ các nền tảng agent như Grokbot và Muse — đã xây dựng một ứng dụng desktop khởi chạy Strands Harness từ xa.

Khi cần đi sâu hơn, Strands Harness cho phép tùy biến hoàn toàn: ghi đè mọi giá trị mặc định, hoán đổi mô hình, thêm công cụ, hoặc thay thế dần từng thành phần xuống tận Strands Harness SDK. Mã nguồn hoàn toàn thuộc về người dùng.

Cách cài đặt

  • Python: pip install strands-harness
  • TypeScript: npm install @strands-agents/harness
  • Trải nghiệm tương tác với CLI: npm install -g @strands-agents/cli

Với lập trình viên Việt Nam đang tìm hiểu về AI agent, đây là một lựa chọn đáng cân nhắc: mã nguồn mở theo giấy phép Apache 2.0, chi phí vận hành thấp hơn, và quan trọng nhất là có thể chạy cục bộ qua Ollama — phù hợp với những ai muốn thử nghiệm mà không phụ thuộc hoàn toàn vào API trả phí nước ngoài.

"Chúng tôi tin rằng việc tạo nguyên mẫu nhanh chóng với một harness 'đầy đủ pin' sẽ tạo ra nhiều agent hữu ích hơn."

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗