Warp xây dựng agent tự cải thiện trên nền tảng Claude
Warp, công ty phát triển terminal AI, đã thiết kế một mô hình agent tự cải thiện dựa trên nền tảng Claude của Anthropic. Thay vì xử lý phản hồi người dùng một cách thủ công, Warp sử dụng hai kỹ năng (skills) dạng tệp để tạo vòng lặp phản hồi liên tục, giúp agent ngày càng thông minh hơn. Mô hình này không chỉ giải quyết bài toán chất lượng đầu ra mà còn có thể áp dụng rộng rãi trong nhiều ngữ cảnh phát triển phần mềm.

Warp hé lộ bí quyết xây dựng agent tự cải thiện trên nền tảng Claude
Trong kỷ nguyên AI tạo sinh, việc xây dựng một agent đáp ứng đúng nhu cầu người dùng ngay từ lần chạy đầu tiên gần như là bất khả thi. Warp, startup nổi tiếng với sản phẩm terminal AI và môi trường phát triển agentic, đã tìm ra một giải pháp đột phá: tạo ra vòng lặp tự cải thiện giúp agent "học hỏi" từ chính phản hồi của con người.
Không dừng lại ở việc vá lỗi tạm thời, Warp đã phát triển một kiến trúc hai lớp kỹ năng (skills) đơn giản nhưng hiệu quả, biến những phản hồi rời rạc thành nguồn dữ liệu quý giá để liên tục nâng cấp chất lượng output. Hãy cùng Lehuy.net phân tích chi tiết mô hình này.
Bài toán "trải nghiệm ồn ào" và giải pháp từ nền tảng Claude
Warp, với hơn 800.000 nhà phát triển sử dụng hàng tháng và 56% Fortune 500 là khách hàng, đã sớm nhận ra một vấn đề nan giải: các agent của họ, dù được tối ưu prompt kỹ lưỡng, vẫn thường xuyên tạo ra những phản hồi thiếu chính xác hoặc gây khó chịu. Điều này đặc biệt rõ rệt ở agent rà soát mã nguồn nội bộ, khi các kỹ sư phàn nàn về những nhận xét vô bổ và chất lượng đầu ra kém.
Các giải pháp trước mắt như viết lại prompt thủ công hay cải thiện tệp ngữ cảnh AGENTS.md chỉ mang tính chắp vá, không thể mở rộng quy mô.
Sau nhiều phân tích, đội ngũ Warp nhận ra nguyên nhân cốt lõi: phản hồi của người dùng dành cho agent gần như biến mất khi phiên làm việc kết thúc, khiến agent không có cơ hội học hỏi từ sai lầm.
Kiến trúc tự cải thiện với hai lớp kỹ năng
Trung tâm của giải pháp này là vòng lặp tự cải thiện (self-improvement loop) được xây dựng trên nền tảng Agent Skills của Claude, vốn là các tệp mã hóa kiến thức giúp giữ hướng dẫn không bị nhồi nhét vào prompt thô. Mô hình gồm hai kỹ năng chính:
- Kỹ năng nền tảng (inner/base skill): Chứa kiến thức và hướng dẫn chuyên môn cho một tác vụ cụ thể. Ví dụ, khi một Pull Request (PR) được mở, agent code của Warp sẽ thực thi dựa trên kỹ năng này để tạo ra bản đánh giá.
- Kỹ năng cải thiện (outer/improver skill): Đóng vai trò như một "agent quan sát viên", chạy theo lịch trình thay vì theo từng tác vụ. Nó thu thập phản hồi tích lũy của con người, so sánh với đầu ra của agent, rồi đề xuất một bản chỉnh sửa nhỏ và tập trung cho kỹ năng nền tảng.
Điểm mấu chốt nằm ở khâu phản hồi của con người ở giữa hai vòng lặp này. Zach Lloyd, nhà sáng lập Warp, nhấn mạnh:
"Phản hồi chi tiết như 'bạn đề xuất đổi tên biến này, nhưng quy ước codebase của chúng tôi là biến toàn cục kiểu này phải dùng ngữ cảnh đặt tên cụ thể' sẽ cho agent biết chính xác cách làm đúng vào lần sau."
Vì các kỹ năng (skills) là các tệp văn bản thuần túy, agent rất giỏi trong việc tự cập nhật chúng. Những bản cập nhật này hoàn toàn có thể xem xét, phê duyệt và hợp nhất (merge) thông qua quy trình PR/ code review thông thường. Warp hiện đã áp dụng mô hình này cho toàn bộ kho mã nguồn mở, với các agent chuyên viết spec, rà soát và phân loại, mỗi agent đều có vòng lặp tự cải thiện riêng.
Minh họa vòng lặp tự cải thiện của agent
Bí quyết viết kỹ năng tự cải thiện hiệu quả
Đội ngũ Warp đã đúc kết những bài học kinh nghiệm quý báu cho các nhà phát triển muốn áp dụng mô hình tương tự:
- Viết nguyên tắc, không viết luật: Hãy hướng dẫn agent như đang chỉ dẫn một người thông minh, không phải lập trình cho một cỗ máy. Thay vì liệt kê chi tiết quy tắc đặt tên biến, hãy nói "Tìm kiếm mã lặp lại" để agent tự suy luận.
- Giải thích lý do: Cung cấp lý do đằng sau mỗi quy tắc giúp agent tư duy tốt hơn thay vì tuân thủ mù quáng, từ đó khái quát hóa hiệu quả hơn.
- Giảm ma sát khi phản hồi: Thu thập phản hồi ngay tại nơi mọi người làm việc, ví dụ như comment trực tiếp trên PR hoặc issue. Zach Lloyd chia sẻ: "Độ ma sát thấp chính là yếu tố duy trì luồng tín hiệu. Nếu làm quá khó, bạn sẽ không nhận được phản hồi."
- Giữ kỹ năng nhỏ và sử dụng progressive disclosure: Một tệp kỹ năng tốt không nên quá lớn, thay vào đó nó tham chiếu đến các tệp tài nguyên và script để tránh nhồi nhét toàn bộ ngữ cảnh cùng một lúc.
- Chất lượng phản hồi quan trọng hơn số lượng: Một phản hồi chi tiết từ kỹ sư cấp cao có giá trị hơn nhiều lượt đánh giá bằng biểu tượng cảm xúc vì nó nêu rõ lý do. Tuy nhiên, khối lượng tín hiệu chất lượng lớn vẫn luôn được hoan nghênh.
- Đầu tư thêm cho kỹ năng cải thiện: Kỹ năng này có tính tái sử dụng cao. "Ngoài thành phần kiến thức chuyên môn, kỹ năng cải thiện cho agent code review không khác nhiều so với kỹ năng cải thiện cho bất kỳ agent nào khác", Zach cho biết.
Case study thực tế: Agent phân loại issue của Warp
Để minh họa rõ hơn, hãy xem cách Warp áp dụng mô hình này cho agent phân loại issue trên GitHub.
Khi một issue mới được tạo, một GitHub Action sẽ kích hoạt agent phân tích độ phức tạp và khả thi, gán nhãn và đề xuất hướng xử lý. Agent này chạy dựa trên một kỹ năng nền tảng chứa kiến thức về ý nghĩa của từng nhãn.
Trong một lần chạy, agent đã bỏ sót nhãn "ready to spec" (sẵn sàng để viết spec). Một maintainer của Warp đã bắt được lỗi này và để lại phản hồi trực tiếp trên issue, giải thích rõ điều anh mong đợi và lý do tại sao — một phản hồi hành động được.
Sau đó, kỹ năng cải thiện sẽ chạy theo lịch trình trong hệ thống điều phối agent nội bộ tên là Oz. Nó xác thực vào GitHub, chạy một script Python đi kèm để kéo các issue có phản hồi, tóm tắt thành tệp JSON và đọc lại vào ngữ cảnh. Từ đó, agent đề xuất một bản chỉnh sửa tối thiểu cho kỹ năng nền tảng: tự động gán nhãn "ready to spec" khi issue mô tả một vấn đề thực tế, dù giao diện UX chưa được xác định.
Minh họa quy trình cập nhật kỹ năng
Bản cập nhật này, do là một tệp kỹ năng, sẽ đi qua quy trình code review thông thường với mô tả chi tiết về tín hiệu nào đã kích hoạt thay đổi. Người phê duyệt cuối cùng vẫn là con người, đảm bảo kiểm soát về những gì sẽ thay đổi, đồng thời đóng vòng lặp hoàn chỉnh.
Những câu hỏi quan trọng cần cân nhắc
Warp cũng đưa ra một loạt câu hỏi giúp các đội ngũ tự đánh giá khi triển khai mô hình:
- Bạn có đang nhầm lẫn giữa kỹ năng và bộ nhớ không? Kỹ năng mang tính thủ tục, ổn định và được thay đổi có chủ đích. Bộ nhớ là thứ agent tự ghi vào lúc suy luận và không ngừng thay đổi.
- Cần một vòng lặp cải thiện chung hay mỗi agent một vòng? Hãy tìm điểm cân bằng: sử dụng một vòng lặp mẫu cho các phần trùng nhau giữa các agent, với các trọng số chuyên môn riêng được xếp chồng lên. Vài agent có thể mỗi agent một vòng, nhưng hàng trăm agent thì nên dùng chung.
- Xử lý phản hồi sai thế nào? Hãy giả định rằng chúng sẽ tồn tại. Đừng để agent tiếp nhận phản hồi một cách mù quáng. Hãy cung cấp ngữ cảnh để kiểm tra độ hợp lý, lọc nguồn đóng góp, và luôn giữ con người trong vòng lặp ở khâu lọc hoặc đánh giá cuối.
- Lĩnh vực của bạn có thể xác minh tự động không? Nếu có, hãy xây dựng bộ kiểm thử trước, sau đó để agent tinh chỉnh dựa trên đó. Nếu không, hãy dựa vào các bài kiểm thử xác định so với đầu ra chuẩn và hạn chế phản hồi từ các chuyên gia trong lĩnh vực.
- Làm sao biết cả hệ thống đang cải thiện? Theo dõi các chỉ số toàn cục mà con người đã quan sát sẵn như thời gian merge, số lượng contributor, chi phí và đưa chúng trở lại vào agent cải thiện. Hãy triển khai theo hướng từ crawl đến walk rồi mới run.
Kết luận
Mô hình agent tự cải thiện của Warp là một minh chứng rõ ràng cho thấy sức mạnh của việc kết hợp phản hồi con người với các kỹ năng dạng tệp của Claude. Điểm đơn giản và thanh lịch của kiến trúc này nằm ở chỗ: có kỹ năng chuyên môn và có kỹ năng cải thiện kỹ năng chuyên môn đó. Nó tạo ra một vòng lặp đóng, giúp mọi agent, bất kể nhiệm vụ gì, đều trở nên tốt hơn theo thời gian, biến chúng từ những công cụ trợ giúp đơn lẻ thành các hệ thống năng lực bền vững cho toàn tổ chức.
Minh họa sự phát triển kỹ năng của agent