Prompt không phải là thứ thật sự quan trọng trong hệ thống AI agent

Công nghệ20 tháng 9, 2026·8 phút đọc

Một kỹ sư với 25 năm kinh nghiệm chia sẻ góc nhìn gây tranh cãi: prompt chỉ là phương tiện tạm thời, còn giá trị thật nằm ở vòng lặp đo lường và tối ưu tự động. Bài viết phân tích cách xây dựng agent đáng tin cậy trong môi trường production thông qua kiểm thử pass^k, LLM judge và tối ưu prompt bằng thuật toán.

Prompt không phải là thứ thật sự quan trọng trong hệ thống AI agent

Prompt không phải là thứ thật sự quan trọng trong hệ thống AI agent

Minh họa hệ thống AI agent tự tối ưuMinh họa hệ thống AI agent tự tối ưu

Một kỹ sư phần mềm kỳ cựu tại Los Angeles vừa chia sẻ những trải nghiệm thực tế về việc đưa AI agent vào vận hành production. Thông điệp trung tâm khá gây sốc: prompt không phải là thứ quan trọng — ít nhất là không theo cách mà nhiều người vẫn nghĩ. Điều thực sự tạo nên sự khác biệt chính là vòng lặp đo lường, kiểm thử và tối ưu tự động.

Sự phấn khích trở lại của một kỹ sư kỳ cựu

Tác giả tự nhận mình đã làm kỹ thuật khoảng 25 năm và trải qua nhiều giai đoạn thăng trầm. Thời điểm 22 tuổi, được trả tiền để viết Visual Basic đã khiến ông cảm thấy phấn khích. Năm 2007, làm việc tại một startup ở Brooklyn mang lại cảm giác như "một vị thần vàng". Nhưng hơn một thập kỷ sau đó là chuỗi ngày mệt mỏi, đến mức ông không nghĩ mình còn đủ đam mê.

Điều bất ngờ là làn sóng AI agent đã mang niềm vui lập trình trở lại. Ông mô tả cảm giác này như "một chú chó trong bể bóng" — vừa kỳ diệu vừa gây nghiện. Tuy nhiên, ông cũng thẳng thắn cảnh báo rằng ranh giới giữa kỹ thuật xuất sắc và sự sụp đổ tâm lý chưa bao giờ mong manh đến thế.

Vấn đề thực tế: LLM không tuân thủ hướng dẫn một cách đáng tin cậy

Theo tác giả, tất cả chúng ta đều hiểu về mặt lý thuyết rằng LLM không thể tuân thủ hướng dẫn, nói sự thật hoặc thực hiện nhiệm vụ một cách đáng tin cậy. Nhưng trong công việc hàng ngày, chúng vẫn khiến chúng ta tin rằng chúng khá ổn định.

Ảo tưởng này sụp đổ ngay lập tức khi bạn vận hành một agent mà người dùng thật sự sử dụng. Các lỗi xuất hiện theo những cách tinh vi, nhưng cũng có những lỗi cực kỳ đơn giản.

Một ví dụ điển hình: bạn yêu cầu model trả về tiêu đề dài tối đa 80 ký tự bằng structured output. Hầu hết các lần nó đều làm đúng. Nhưng đôi khi nó "phá hoại" hoàn toàn, làm tràn ngập trường dữ liệu bằng những nội dung vô nghĩa cho đến khi hệ thống nổ tung.

Điều thú vị là giải pháp cho vấn đề này lại hoàn toàn phi lý: đổi tên trường từ "title" thành "heading" lại khiến nó hoạt động trở lại.

Kiểm thử và đo lường hành vi AI agentKiểm thử và đo lường hành vi AI agent

Kiểm thử pass^k: cách đo lường hành vi thực tế

Để kiểm soát hành vi của LLM, bạn phải đo lường nó. Một cách tiếp cận được ngành công nghiệp sử dụng là pass^k (đọc là "pass power k") — chạy cùng một bài kiểm thử nhiều lần để xem tần suất thành công thực tế.

Điều quan trọng cần kết luận là: prompt không quan trọng theo cách nhiều người tưởng. Các công ty có rất nhiều mối lo ngại khi triển khai phần mềm AI có thể nói những điều điên rồ. Bạn thường không muốn agent trả lời câu hỏi về cách nó hoạt động, không muốn nó bỏ qua mọi quy tắc khi người dùng tự xưng là người có thẩm quyền, và bạn muốn nó nói theo giọng điệu thương hiệu cụ thể.

Cách tiếp cận tự nhiên ban đầu là để chuyên gia có nhiều kiến thức chuyên môn viết prompt rồi chuyển cho nhóm xây dựng agent. Tuy nhiên, mô hình "nhóm phụ trách giọng nói sở hữu prompt giọng nói" là sai lầm khi bạn cố gắng mở rộng quy mô.

Tại sao prompt không phải là một "thứ" cụ thể

Tác giả giải thích: thêm một prompt mới vào agent tương đương với việc ném nó vào một vũ trụ ngữ cảnh hoàn toàn khác so với nơi nó được kiểm thử. Tổng trọng lượng của tất cả các hướng dẫn khác mà agent đã có chắc chắn sẽ ảnh hưởng đến cách prompt mới hoạt động — thường là theo hướng tiêu cực.

Hơn nữa, agent sẽ thay đổi theo thời gian, và các model cũng có thể bắt đầu hành xử khác đi vì những lý do mờ ám mà chúng ta sẽ không bao giờ hiểu hết.

Giải pháp của tác giả: cho Claude đọc kỹ năng, sau đó yêu cầu nó tạo ra hàng loạt kịch bản đối kháng — nghĩ về những cách mà kẻ xấu có thể lật ngược prompt, cũng như những tình huống lành tính có thể bị phá vỡ bởi prompt mới. Tất cả được biểu diễn dưới dạng bài kiểm thử pass^k.

Tối ưu hóa prompt bằng thuật toán di truyền

Khi đã có bộ kiểm thử pass^k, bạn có thước đo lặp lại được để đánh giá prompt hoạt động tốt đến đâu. Điều này đủ để kết nối prompt với một bộ tối ưu hóa, ví dụ như genetic pareto (GEPA).

Ý tưởng là một thuật toán có LLM bên trong có thể suy ngẫm về lý do prompt hoạt động tốt hay kém trên bộ kiểm thử, rồi thử sửa đổi prompt một cách tự động, không cần can thiệp thủ công. Quá trình này lặp lại cho đến khi hội tụ về cách viết prompt tối ưu.

Prompt cuối cùng có thể trông rất khác so với ban đầu. Tác giả nhấn mạnh: chẳng ai quan tâm bên trong có gì. Bạn có phép đo, nên không cần lo lắng về nội dung văn bản. Bạn biết nó "điên rồ" bên trong, nhưng điều đó không quan trọng.

Vòng lặp tự cải thiện của hệ thống AI agentVòng lặp tự cải thiện của hệ thống AI agent

LLM judge: khi việc đánh giá cũng là một bài toán khó

Một số hành vi có thể kiểm tra mang tính xác định hoàn toàn. Ví dụ, nếu người dùng nói một loại câu cụ thể, bạn muốn agent gọi một công cụ cụ thể — chỉ cần khẳng định công cụ đã được gọi.

Nhưng có những hành vi dùng ngôn ngữ tự nhiên không quá chủ quan, như "không muốn agent nói về cách nó hoạt động" — có thể dùng một prompt LLM đơn giản để đánh giá.

Vấn đề nảy sinh khi khẳng định về hành vi của agent tự nó là một bài toán phức tạp. Việc khiến agent nói theo giọng điệu thương hiệu cụ thể là một phán đoán phức tạp, không thể giải quyết bằng một prompt ngắn.

Chúng tôi nghe rằng bạn thích bài toán tối ưu, nên chúng tôi đặt một bài toán tối ưu prompt bên trong bài toán tối ưu prompt của bạn để bạn có thể tối ưu trong lúc tối ưu.

Cách tiếp cận là xây dựng bộ dữ liệu vàng gồm các phản hồi tốt và xấu đã được dán nhãn, rồi dùng nó để tối ưu tập prompt đánh giá giọng điệu thương hiệu gần với cách chuyên gia con người đánh giá.

Vòng lặp phản hồi tự cải thiện

Khi các hệ thống này được xây dựng, bạn có thể kết hợp chúng với giám sát production để tạo ra hệ thống tự duy trì và tự cải thiện. Bạn chạy kiểm thử pass^k khi triển khai, chạy LLM judge trên các cuộc hội thoại production được lấy mẫu, tìm ra nơi agent làm kém, biến chúng thành các ca kiểm thử khó, và chạy lại bộ tối ưu hóa cho đến khi vượt qua.

Prompt không phải là thứ quan trọng. Prompt là những vector mà nội dung văn bản của chúng hoàn toàn không quan trọng. Vòng lặp phản hồi tự cải thiện mới chính là thứ thật sự quan trọng.

Các chuyên gia lĩnh vực nên tập trung vào việc xây dựng bộ tài liệu cần thiết: dữ liệu phản hồi tốt và xấu tạo thành bộ kiểm thử và các phép đo chất lượng khác. Họ không nên dành thời gian để chăm chút prompt.

Lời cảnh báo về "chứng loạn thần AI"

Tác giả kết luận bằng một cảnh báo mạnh mẽ: việc đưa cho ai đó một prompt mà không có phép đo là một dạng chứng loạn thần AI. Nhiều người đã xây dựng những cỗ máy mong manh từ que kem và prompt mà không hề quan tâm đến đánh giá.

Thế giới agent đầy cơ hội, nhưng cũng đầy những vực thẳm mà chúng ta có thể lao đầu xuống và không bao giờ trồi lên. Đo lường thì khó, nhưng con đường thay thế trông còn tệ hơn.

Prompt là tạm thời. Có thể dùng rồi bỏ. Thậm chí có thể không có ý nghĩa gì. Chỉ những hệ thống tự sửa chữa mới có thể tiến hóa và hy vọng tồn tại lâu dài.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗