Claude Fable 5.1 vẽ chú bồ nông đi xe đạp đẹp đến mức nào?
Anthropic vừa phát hành Claude Fable 5.1, mô hình mới được quảng cáo là vượt trội về lập trình và giải quyết vấn đề dài hạn, đặc biệt là benchmark khoa học mới. Nhà phát triển Simon Willison đã thử nghiệm khả năng tạo SVG của mô hình ở 5 mức suy luận khác nhau và nhận được kết quả ấn tượng, từ cơ bản đến một chú bồ nông hoạt hình hoàn chỉnh với mũ xanh và giỏ cá.

Claude Fable 5.1 vẽ chú bồ nông đi xe đạp đẹp đến mức nào?
Ngày hôm nay là ngày ra mắt của Claude Fable (và Mythos) 5.1 từ Anthropic. Hãng này tuyên bố Fable 5.1 “thiết lập tiêu chuẩn mới cho việc lập trình, công việc tri thức và các tác vụ giải quyết vấn đề dài hạn”. Điểm nhấn đáng chú ý nhất nằm ở lĩnh vực nghiên cứu khoa học khi mô hình đạt 52,6% trên benchmark mới mang tên Terminal-Bench-Science 0.1, tăng mạnh so với mức 24,7% của Fable 5 hay 22,4% của GPT-5.6 Sol.
Từ tháng 7, tôi từng bày tỏ sự hoài nghi về benchmark “chú bồ nông” — vì mối liên hệ giữa nó với chất lượng tổng thể của mô hình không còn chặt chẽ như hồi năm 2025. Tuy nhiên, điều thú vị nhất hiện tại là so sánh trong cùng một dòng mô hình, đặc biệt là khi chạy cùng một prompt ở các mức suy luận khác nhau. Fable 5.1 có 5 mức suy luận: low, medium, high, xhigh và max, và không có tùy chọn tắt hoàn toàn.
Chú bồ nông mức low
Sau khi sửa một lỗi trong llm-anthropic để ghi lại đúng các trace suy luận, tôi đã chạy thử nghiệm với prompt “Generate an SVG of a pelican riding a bicycle”. Kết quả ở mức low không có bất kỳ token suy luận nào, chỉ gồm 1.998 token đầu ra, mất 23,8 giây và tốn 10 cent. Điều kỳ lạ là mức medium thậm chí còn dùng ít hơn 21 token và rẻ hơn một chút, cho thấy mô hình dường như bỏ qua bước suy luận ở cả hai mức này.
Ở mức high, mô hình bắt đầu có một chút lý luận khi lên kế hoạch bố cục: bầu trời, mặt đất, xe đạp hai bánh và con bồ nông trắng với chiếc mỏ cam. Kết quả không khác nhiều so với hai mức thấp hơn, nhưng đến xhigh thì mọi thứ thay đổi hoàn toàn: 36.767 token đầu ra, mất 7 phút 51 giây và tốn tới 1,83 USD. Trace suy luận dài dằng dặc với các chi tiết như thêm mắt, cánh vươn tới tay lái và cân nhắc việc giữ kích thước chú bồ nông cố ý quá khổ để tăng tính hài hước.
Chú bồ nông mức high và xhigh
Tuy nhiên, mức max mới thực sự là một bước nhảy vọt. Với 65.927 token đầu ra, mất 13 phút 54 giây và chi phí 3,30 USD, đây là chú bồ nông đẹp nhất mà tôi từng thấy từ bất kỳ mô hình nào của Anthropic. Nền hài hòa, hai chân đặt rõ ràng hai bên khung xe, bàn chân đạp pedal, cánh vươn lên ghi đông, và chú bồ nông còn đội một chiếc mũ xanh dễ thương cùng giỏ cá phía sau.
Điều đáng kinh ngạc là quá trình lý luận của mô hình ở mức này: nó tự phê bình bản vẽ, quyết định đội mũ bảo hiểm hay giữ nguyên mào để nhận diện, điều chỉnh đường cong của phuộc xe cho đúng góc, và thậm chí từ chối thêm chuông xe hay điểm nhấn lốp vì “không cần thiết”.
Chú bồ nông mức max hoạt hình
Một thành viên trên Hacker News tên swalsh nhận xét: “Giờ benchmark này đã xong, anh có thể làm thêm bản hoạt hình được không?”. Tôi không muốn tốn thêm 3 USD nữa nên đã lấy SVG từ mức max và chuyển tiếp vào mức suy luận High mặc định, chi phí 1,37 USD. Kết quả là một chú bồ nông hoạt hình với bánh xe quay (dù bị đảo chiều khi chuyển sang MP4, nhưng trong SVG gốc thì quay đúng hướng). Dù vẫn chưa bắt mắt bằng Gemini 3.7 Flash, nhưng khi tôi chỉ cần một file SVG chứ không phải sự sáng tạo, thì Fable 5.1 đã làm rất tốt. Bài viết được đăng ngày 1 tháng 9 năm 2026 bởi Simon Willison.


