DoGBench: Chuẩn đánh giá đầu tiên về tạo tài liệu cho người dùng, không AI nào vượt 50%

01 tháng 10, 2026·6 phút đọc

DoGBench là chuẩn đánh giá đầu tiên đo lường khả năng của các tác tử AI trong việc viết và cập nhật tài liệu phần mềm hướng tới người dùng. Qua 292 tác vụ thực tế từ các dự án mã nguồn mở, kết quả cho thấy điểm cao nhất chỉ đạt 54,8/100, phản ánh khoảng cách lớn giữa văn phong bóng bẩy và khả năng giúp người đọc hoàn thành nhiệm vụ.

DoGBench: Chuẩn đánh giá đầu tiên về tạo tài liệu cho người dùng, không AI nào vượt 50%

Các tác tử AI (AI agent) ngày nay có thể viết tài liệu trông rất chuyên nghiệp, nhưng chúng thường bỏ sót đúng những gì người đọc cần để hoàn thành một tác vụ cụ thể. DoGBench ra đời nhằm trả lời câu hỏi: liệu các tác tử AI có thể đạt chuẩn của chuyên gia khi viết và bảo trì tài liệu phần mềm hướng tới người dùng hay không?

DoGBench là gì?

DoGBench là chuẩn đánh giá đầu tiên tập trung vào tài liệu hướng tới người dùng cuối. Thay vì chỉ kiểm tra văn phong hay độ trôi chảy, chuẩn này đánh giá các tác tử AI trong việc viết và bảo trì tài liệu dựa trên các sự kiện thực tế trong kho mã nguồn và những khoảng trống tài liệu được báo cáo.

Mỗi bản vá (patch) do AI tạo ra được chấm điểm bằng bộ tiêu chí (rubric) đã được xác thực cùng các maintainer của dự án. Điểm số đo lường mức độ tiến gần tới chuẩn chuyên gia, chứ không phải so sánh trực tiếp với một chuyên gia con người.

Bộ dữ liệu bao gồm 292 tác vụ rút ra từ các dự án mã nguồn mở thực tế như Helm, PostHog, Mautic và Doc Detective. Trong đó:

  • 205 tác vụ yêu cầu thay đổi tài liệu
  • 87 tác vụ yêu cầu giữ nguyên tài liệu

Đánh giá chính sử dụng tập kiểm tra giữ lại (held-out) gồm 117 mục, trong đó 82 mục cần cập nhật và 35 mục cần giữ nguyên.

Kết quả: Không mô hình nào vượt 50%

Con số đáng chú ý nhất: điểm tổng hợp cao nhất chỉ đạt 54,8/100, thuộc về một tác tử trên nền tảng đám mây. Trong số bảy làn mô hình được báo cáo trong bài nghiên cứu, điểm cao nhất trên tập 117 mục là 47,3/100, do Qwen3.8 Max kết hợp với OpenCode đạt được.

Điều này cho thấy một thực tế: dù AI tạo ra văn bản mượt mà, nó vẫn chưa thể thay thế được sự đánh giá của chuyên gia con người trong lĩnh vực tài liệu kỹ thuật.

Vấn đề cốt lõi: AI không biết khi nào cần cập nhật tài liệu

Công việc viết tài liệu bắt đầu bằng một phán đoán: thay đổi này có ảnh hưởng tới người dùng không, và họ có cần hướng dẫn mới không? Theo DoGBench, các tác tử AI mắc lỗi ở cả hai hướng:

  • Một số viết tài liệu cho những thay đổi nội bộ như refactor hay tối ưu hiệu năng — vốn không cần hướng dẫn cho người dùng.
  • Số khác lại bỏ qua những cập nhật cần thiết vì không tìm thấy trang tài liệu hiện có về tính năng đó — trong khi chính việc thiếu trang đó là vấn đề cần giải quyết.

Nói cách khác, tác tử AI thường đưa ra quyết định sai về việc liệu tài liệu có cần được cập nhật hay không.

Văn phong bóng bẩy vẫn có thể khiến người đọc bế tắc

Một bản vá có thể nghe rõ ràng, chứa thông tin chính xác, nhưng vẫn thiếu điều kiện tiên quyết, điểm quyết định hoặc bước thiết yếu. Nó cũng có thể nằm ở trang mà người đọc khó tìm thấy, hoặc mâu thuẫn với hướng dẫn ở nơi khác.

Một cuộc kiểm tra rộng hơn trên 1.267 bản nộp đã phát hiện:

  • 45,5% có khoảng trống hoàn thành tác vụ — thiếu điều kiện tiên quyết, bước thủ tục, bước xác minh hoặc đường phục hồi khi lỗi.
  • 36,6% chứa thông tin kỹ thuật không chính xác.
  • 32,5% bỏ sót một phần khái niệm cốt lõi hoặc thông tin tham chiếu.

Các nhóm lỗi này chồng lấn lên nhau. Nội dung bịa đặt — như class, flag hay endpoint không tồn tại — xuất hiện trong 6,1% số bản nộp.

Với các tác tử tiên tiến, ảo giác (hallucination) cũng có thể mang dạng tinh vi hơn: bóp méo chức năng thật bằng cách mở rộng phạm vi của nó, mô tả sai giá trị mặc định, hoặc trình bày một hành vi chỉ đúng trong điều kiện cụ thể như thể nó luôn đúng.

Phân tích quỹ đạo còn cho thấy các tác tử thường bỏ qua bằng chứng quyết định hoặc dừng điều tra ngay khi tìm thấy trang đầu tiên có vẻ hợp lý để sửa.

Đánh giá của chuyên gia vẫn là bắt buộc

Một bản vá được coi là P0-clean khi không có lỗi nghiêm trọng nào theo bộ tiêu chí. Tỷ lệ giao bản vá P0-clean cao nhất trong bảy làn của bài nghiên cứu chỉ đạt 39,0%. GPT-5.6 Sol kết hợp với Codex giao được bản vá P0-clean cho 32 trong số 82 tác vụ cần cập nhật.

Chủ sở hữu tài liệu nắm giữ bối cảnh mà chỉ một thay đổi mã nguồn khó có thể tiết lộ: người đọc là ai, họ đang cố gắng làm gì, và thay đổi ảnh hưởng thế nào đến quy trình làm việc của họ. Bối cảnh đó giúp xác định liệu có cần cập nhật hay không và cần bao quát những gì.

DoGBench khuyến nghị quy trình đánh giá gồm: kiểm tra bản nháp của AI dựa trên quy trình làm việc thực tế, đảm bảo người đọc có thể tìm thấy hướng dẫn, hoàn thành các bước và xác minh kết quả; đồng thời kiểm tra các điều kiện đằng sau mỗi tuyên bố kỹ thuật và đối chiếu các trang liên quan để phát hiện mâu thuẫn hoặc hướng dẫn lỗi thời.

Cách DoGBench chấm điểm

Mỗi tác tử nhận được kho mã nguồn ở trạng thái trước thay đổi, cùng một tín hiệu kích hoạt như pull request mã nguồn hoặc báo cáo khoảng trống tài liệu. Tài liệu đã được hợp nhất bị giữ kín.

Điểm số được báo cáo tách biệt thành hai phần:

  • Chất lượng bản vá giao nộp: trung bình chất lượng trên cả 82 tác vụ cần cập nhật. Bản vá bị bỏ sót hoặc rỗng nhận điểm không.
  • Khả năng kiềm chế đúng: đo tần suất tác tử giữ nguyên tài liệu trên 35 tác vụ không cần cập nhật.

Điểm tổng hợp sử dụng trung bình điều hòa của hai chỉ số trên: 2DN / (D + N). Nhờ đó, mạnh ở một mặt không thể bù đắp hoàn toàn cho yếu kém ở mặt còn lại.

Một điểm đáng chú ý: bất kỳ lỗi P0 nào cũng giới hạn điểm bản vá ở mức tối đa 60/100. Các tiêu chí có trọng số ngang nhau, nhưng lỗi nghiêm trọng không thể bị "trung bình hóa" bởi các điểm mạnh ở tiêu chí phụ.

Ý nghĩa đối với ngành tài liệu kỹ thuật

DoGBench gửi đi một thông điệp rõ ràng: AI writing nghe có vẻ tiện lợi, nhưng trong lĩnh vực tài liệu kỹ thuật, khoảng cách giữa văn bản trôi chảy và tài liệu hữu dụng vẫn còn rất lớn. Với các đội ngũ phát triển phần mềm đang cân nhắc ứng dụng AI vào quy trình tài liệu, nghiên cứu này là lời nhắc rằng con người — người nắm bối cảnh người đọc và quy trình làm việc — vẫn giữ vai trò không thể thay thế.

Bài nghiên cứu đầy đủ có sẵn tại dogbench.ai/paper.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗