Anthropic tiết lộ chi tiết cách hoạt động của watermark mới trên Claude

15 tháng 8, 2026·4 phút đọc

Anthropic vừa công bố bài viết giải thích chi tiết về cơ chế watermark (dấu chìm) trên văn bản do chatbot Claude tạo ra, nhằm tuân thủ Đạo luật AI của EU. Hệ thống này sử dụng phương pháp SynthID-Text từ Google DeepMind, không ảnh hưởng đến chất lượng đầu ra và đi kèm API phát hiện. Công ty cũng làm rõ các câu hỏi về khả năng ẩn watermark khi chỉnh sửa văn bản và tác động của nó đối với mã code.

Anthropic tiết lộ chi tiết cách hoạt động của watermark mới trên Claude

Anthropic hé lộ chi tiết về cơ chế watermark trên Claude: Điều người dùng cần biết

Anthropic vừa đăng tải bài viết giải đáp những câu hỏi cơ bản về cách watermark (dấu chìm) văn bản do chatbot Claude tạo ra, sau khi công bố kế hoạch này hồi đầu tuần để tuân thủ Bộ Quy tắc Minh bạch của Đạo luật AI châu Âu (EU AI Act). Hệ thống sử dụng phương pháp SynthID-Text của Google DeepMind, hứa hẹn không làm giảm chất lượng đầu ra và sẽ đi kèm API phát hiện riêng.

Động thái này đang gây tranh cãi trong cộng đồng người dùng Claude. Trên Reddit, có người gọi đây là "âm mưu chống lại người dùng vô tội", trong khi người khác lập luận: "Lý do duy nhất khiến bạn không muốn điều này là vì bạn muốn lừa dối người khác." Business Insider cũng đưa tin "hàng chục" người dùng trên X (Twitter) đã tuyên bố hủy đăng ký Claude vì quyết định này.

Cơ chế watermark hoạt động như thế nào?

Theo giải thích của Anthropic, khi Claude đưa ra những lựa chọn "ít rủi ro" — ví dụ chọn giữa từ "overcast" và "grey" để mô tả thời tiết — mô hình có thể tạo ra một khuôn mẫu trong phản hồi "không thể phát hiện bằng mắt thường, nhưng lại có thể nhận diện được với bất kỳ ai có chìa khóa giải mã."

"Watermark không ảnh hưởng đến chất lượng đầu ra của Claude. Đối với người đọc, phản hồi có watermark không thể phân biệt được với phản hồi không có watermark."

Cụ thể hơn, Anthropic cho biết sẽ sử dụng phương pháp SynthID-Text mà nhóm Google DeepMind công bố vào năm 2024, đồng thời có kế hoạch phát hành API phát hiện watermark dành cho các bên cần kiểm tra. Điều quan trọng cần lưu ý: watermark khác hoàn toàn với các công cụ phát hiện AI thông thường (như dịch vụ của Pangram) — những công cụ này tìm kiếm các "dấu hiệu" trong văn phong như cấu trúc "this isn't [X], it's [Y]". Anthropic nhấn mạnh: "Phát hiện các khuôn mẫu này về bản chất khác hẳn việc kiểm tra watermark."

Có thể xóa watermark bằng cách chỉnh sửa không?

Đây là câu hỏi được nhiều người quan tâm nhất. Anthropic thừa nhận khả năng này tồn tại, nhưng với điều kiện khá khắt khe:

  • Chỉnh sửa nhẹ (light editing) "không thể xóa hoàn toàn watermark"
  • Viết lại hoàn toàn — nơi mọi từ đều được thay thế — mới có thể loại bỏ được watermark
  • Tuy nhiên, công ty đặt câu hỏi ngược lại: "Trong trường hợp sau, liệu văn bản đó còn có thể gọi là do AI tạo ra hay không?"

Đối với văn bản được con người viết rồi nhờ Claude soát lỗi hoặc chỉnh sửa, mức độ phát hiện watermark sẽ phụ thuộc vào "độ dài văn bản và mức độ chỉnh sửa của Claude." Nếu chỉ chỉnh sửa nhẹ, "gần như toàn bộ từ ngữ vẫn do tác giả con người viết" — do đó "có rất ít (nếu có) chỗ để watermark bám vào."

Ảnh hưởng đến mã code

Một điểm đáng chú ý: mã code sẽ có watermark ít hơn so với văn bản thông thường. Lý do là Claude cần tạo ra code chạy được, nên không có sự tự do để lựa chọn giữa nhiều phương án tương đương nhau. Anthropic giải thích:

"Tuy nhiên, trong những phần có sự lựa chọn tùy ý giữa các từ hoặc thuật ngữ cụ thể trong code — như phần bình luận (comments) — watermark có thể được áp dụng. Nhưng theo định nghĩa, nó sẽ có tác động không đáng kể đến code thực tế."

Bối cảnh rộng hơn

Anthropic cũng cho biết Claude sẽ không phải là chatbot duy nhất áp dụng watermark: "Các nhà phát triển mô hình lớn khác đã ký cùng Bộ Quy tắc Ứng xử và sẽ triển khai watermark riêng của họ." Điều này đồng nghĩa với việc watermark sẽ dần trở thành chuẩn mực chung cho toàn ngành AI, đặc biệt tại thị trường EU.

Với người dùng Việt Nam, việc theo dõi xu hướng này là cần thiết — đặc biệt với các lập trình viên, nhà báo, và nhà sáng tạo nội dung thường xuyên sử dụng AI. Khi watermark trở nên phổ biến, khả năng xác minh nguồn gốc nội dung sẽ đóng vai trò quan trọng trong việc đảm bảo minh bạch và trách nhiệm giải trình trong sản xuất nội dung số.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗