Claude Sonnet 5.5 ra mắt: Nhanh hơn 30%, rẻ hơn 30% và lần đầu vượt qua Pokémon Red
Anthropic vừa giới thiệu Claude Sonnet 5.5, mẫu model thứ hai trong dòng Claude 5.5, với tốc độ nhanh hơn 30% và chi phí thấp hơn tới 30% so với thế hệ trước. Đây là model Sonnet đầu tiên đánh bại Pokémon Red chỉ dựa trên ảnh chụp màn hình, đồng thời đạt 70,6% trên Terminal-Bench 4.0 — một bước nhảy vọt so với mức 10,3% của Sonnet 5.

Anthropic vừa chính thức trình làng Claude Sonnet 5.5, mẫu model thứ hai trong dòng Claude 5.5. Đây được xem là bản nâng cấp rõ rệt so với Claude Sonnet 5, với tốc độ nhanh hơn hơn 30% và chi phí cho hầu hết công việc giảm tới 30%. Điểm đáng chú ý là Sonnet 5.5 giữ nguyên mức giá nhưng tiêu tốn ít token hơn hẳn để hoàn thành cùng một khối lượng công việc.
Claude Sonnet 5.5 - mẫu model thứ hai trong dòng Claude 5.5
Vị trí của Sonnet 5.5 trong dòng Claude 5.5
Theo Anthropic, Sonnet 5.5 là phiên bản bổ trợ nhanh hơn và rẻ hơn cho Claude Opus 5.5. Nếu Opus 5.5 được thiết kế cho những công việc phức tạp đòi hỏi khả năng phán đoán cẩn trọng, thì Sonnet 5.5 lại mạnh nhất ở các tác vụ thường ngày có phạm vi rõ ràng, sửa lỗi, và tạo ra các tài liệu, slide, bảng tính chỉn chu. Model này cũng được đánh giá có "con mắt" thẩm mỹ về thiết kế khá tinh tế.
Trong những tuần tới, Claude Haiku 5.5 — dòng model dành cho các ứng dụng khối lượng lớn và nhạy cảm về chi phí — sẽ gia nhập gia đình Claude 5.5.
Hiệu năng: Bước nhảy vọt ấn tượng
Mức cải thiện của Sonnet 5.5 so với Sonnet 5 là rất lớn, đặc biệt ở mảng lập trình tác tử (agentic coding). Cụ thể:
- Terminal-Bench 4.0: Sonnet 5.5 đạt 70,6%, so với vỏn vẹn 10,3% của Sonnet 5
- GDPval-AA (bài kiểm tra công việc thực tế ở nhiều ngành nghề): Sonnet 5.5 chỉ kém Opus 5.5 khoảng 2 điểm
- FrontierCode 1.1 (Main): 46,2% ở mức Max, so với 42,4% của Sonnet 5
- CursorBench 4.0: 55,5%, so với 34,1% của Sonnet 5 và 57,8% của Opus 5.5
- OSWorld 2.1 (điều khiển máy tính): 80,1% (một phần), so với 57,0% của Sonnet 5
- Chartography (đọc hiểu biểu đồ): 61,6% không dùng công cụ, so với 15,6% của Sonnet 5
Đáng chú ý, Sonnet 5.5 là model Sonnet đầu tiên đánh bại Pokémon Red khi chỉ làm việc dựa trên ảnh chụp màn hình — minh chứng cho khả năng xử lý tác vụ dài hạn và hiểu hình ảnh được nâng cấp mạnh mẽ.
Hiệu năng Claude Sonnet 5.5 so với các model cùng dòng
Chi phí và tốc độ: Điểm mạnh cạnh tranh
Sonnet 5.5 giữ nguyên bảng giá của Sonnet 5:
- Token đầu vào: 2 USD / 1 triệu token
- Token đầu ra: 10 USD / 1 triệu token
- Đọc cache: 0,20 USD / 1 triệu token
- Ghi cache: 2,50 USD / 1 triệu token
Tuy nhiên, vì cần ít token hơn để hoàn thành cùng một tác vụ, chi phí thực tế mỗi tác vụ giảm tới 30% trong thử nghiệm của Anthropic. Đây là điểm hấp dẫn với các đội ngũ phát triển tại Việt Nam đang tối ưu hóa chi phí vận hành các tính năng AI trong sản phẩm.
Trên một số benchmark, Sonnet 5.5 ở mức effort Low hoặc Medium đã vượt qua điểm số tốt nhất của Sonnet 5 với chi phí chỉ bằng một phần mười. Trên FrontierCode ở mức High, model này đạt điểm tương đương GPT-6 Sol với chi phí chỉ bằng khoảng một phần năm.
Tốc độ sinh đầu ra của Sonnet 5.5 nhanh hơn hơn 30% so với Sonnet 5, biến nó thành model Sonnet nhanh nhất từ trước tới nay. Mức effort có thể điều chỉnh linh hoạt: Claude Code và các ứng dụng của Anthropic mặc định ở mức Medium, còn Claude Platform mặc định ở mức High.
Công việc tri thức: Từ thiết kế đến slide
Trong các bài kiểm tra về công việc tri thức, Sonnet 5.5 ghi điểm gần bằng Opus 5.5 trên GDPval-AA (bài test trên 44 ngành nghề và 9 lĩnh vực chính), cao hơn Sonnet 5 khoảng 400 điểm. Model này còn thể hiện khả năng tạo slide ấn tượng: trong một thử nghiệm nội bộ, khi được cung cấp tài liệu tài chính quý và biên bản hội nghị của một công ty đại chúng cùng template slide, Sonnet 5.5 đã tạo ra 10 slide đánh giá hoạt động mà hai chuyên gia đánh giá là có thể gửi đi ngay.
Các đối tác thử nghiệm sớm cũng ghi nhận nhiều cải thiện:
"Trong thử nghiệm ban đầu tại Epic, Claude Sonnet 5.5 đã vượt qua cùng tiêu chuẩn chất lượng mà bạn kỳ vọng từ một model cao cấp hơn, trụ vững trong một cuộc kiểm toán thiết kế hệ thống và rà soát luồng dữ liệu." — Daniel Vogel, COO của Epic Games
"Trên bộ 2.441 tác vụ tài chính riêng của chúng tôi, Claude Sonnet 5.5 đạt điểm cao hơn Sonnet 5 và chỉ dùng khoảng 121k token mỗi câu trả lời, trong khi Sonnet 5 dùng tới 497k." — Joe Poirier, Kỹ sư AI cao cấp tại Balyasny Asset Management
"Tại Unity, chúng tôi có tiêu chuẩn cao cho việc hoàn thành tác vụ. Phần lớn công việc của Claude Sonnet 5.5 đã vượt qua kiểm tra đó, và nó hoàn thành 90% tác vụ trong benchmark đa bước của chúng tôi." — Sam Zhang, Chuyên gia công nghệ sáng tạo tại Unity
An toàn và các biện pháp bảo vệ
Sonnet 5.5 không đẩy xa giới hạn năng lực của các model Anthropic, nên đánh giá căn chỉnh tập trung vào các rủi ro nhắm mục tiêu cụ thể. Trên bài kiểm toán hành vi tự động với khoảng 1.850 tình huống, Sonnet 5.5 cải thiện hoặc ngang bằng Sonnet 5 ở hầu hết các thước đo về căn chỉnh, khả năng chống lạm dụng và tính trung thực. Đáng chú ý, đây là model ít có khả năng thăm dò giới hạn container nhất trong số các model của Anthropic.
Vì năng lực an ninh mạng của Sonnet 5.5 đã tương đương Opus 5, đây là model Sonnet đầu tiên ra mắt với các biện pháp bảo vệ an ninh mạng và cơ chế dự phòng giống như những gì được phát triển cho các model mạnh nhất. Các tác vụ phát triển phần mềm thông thường vẫn không bị ảnh hưởng, nhưng các tác vụ an ninh mạng rủi ro cao sẽ tự động chuyển về Sonnet 5.
Về sinh học, Sonnet 5.5 dùng cùng bộ biện pháp bảo vệ như Sonnet 5. Với các cuộc tấn công chưng cất (distillation attack) — khi kẻ tấn công dùng hàng nghìn tài khoản giả để trích xuất năng lực model ở quy mô công nghiệp — Sonnet 5.5 là model Sonnet đầu tiên ra mắt với bộ phân loại an toàn ngăn chặn trích xuất lý luận.
Biểu đồ hiệu năng so với chi phí của Claude Sonnet 5.5
Cách bắt đầu sử dụng
Claude Sonnet 5.5 hiện đã có mặt trên tất cả các nền tảng, bao gồm Amazon Web Services, Google Cloud và Microsoft Azure. Các nhà phát triển có thể bắt đầu trên Claude Platform với định danh claude-sonnet-5-5.
Lưu ý quan trọng cho các nhà phát triển: nếu bạn đang chạy Sonnet với tính năng thinking tắt, bạn sẽ cần chuyển sang thiết lập between_tools mới — vốn giữ tính năng suy luận trước (up-front thinking) ở trạng thái tắt — trước khi nâng cấp lên Sonnet 5.5. Hướng dẫn chuyển đổi chi tiết đã được Anthropic công bố.
Với mức giá cạnh tranh, tốc độ vượt trội và khả năng xử lý tác vụ lập trình ngày càng tốt, Sonnet 5.5 hứa hẹn sẽ là lựa chọn hấp dẫn cho các startup và đội ngũ phát triển tại Việt Nam đang tìm kiếm sự cân bằng giữa chất lượng và chi phí khi tích hợp AI vào quy trình sản xuất.


