Anthropic hé lộ kỹ thuật đánh dấu văn bản AI bằng cách thay đổi từ ngữ "vô thưởng vô phạt"

15 tháng 8, 2026·4 phút đọc

Anthropic vừa công bố kế hoạch áp dụng kỹ thuật đánh dấu văn bản (watermarking) cho các mô hình Claude, nhằm tuân thủ Đạo luật AI của EU. Phương pháp này dựa trên việc thay đổi các lựa chọn từ ngữ không quan trọng trong câu, tạo ra một "dấu hiệu thống kê" có thể phát hiện bằng khóa số, mà không làm ảnh hưởng đến nội dung hay chất lượng văn bản. Tuy nhiên, kỹ thuật này được đánh giá là chỉ có hiệu quả một phần, vì việc chỉnh sửa hoặc viết lại hoàn toàn có thể xóa dấu vết.

Anthropic hé lộ kỹ thuật đánh dấu văn bản AI bằng cách thay đổi từ ngữ "vô thưởng vô phạt"

Anthropic tiết lộ phương pháp đánh dấu văn bản AI: Thay đổi những từ ngữ "không quan trọng"

Trong nỗ lực "đánh dấu" văn bản do Claude tạo ra và tuân thủ Đạo luật AI của Liên minh châu Âu (EU AI Act), Anthropic hôm thứ Sáu đã công bố kế hoạch điều chỉnh cách chọn từ của các chatbot, tạo ra một đặc điểm có thể nhận diện là sản phẩm của AI. Phương pháp này được giới thiệu dựa trên kỹ thuật từ bài nghiên cứu SynthID-Text của Google DeepMind.

Ý tưởng cốt lõi: Tận dụng sự "dư thừa" của ngôn ngữ

Theo cách giải thích đơn giản, các mô hình ngôn ngữ lớn (LLM) hoạt động như một công cụ tự động hoàn thành văn bản, dự đoán từ tiếp theo trong một chuỗi từ. Anthropic lấy ví dụ: khi viết câu "Thời tiết hôm nay thật lạnh và…", mô hình như Claude có thể chọn từ "lạnh giá" hoặc "xám xịt" để hoàn thành, nhưng sẽ gần như không bao giờ chọn một từ như "ngọt ngào".

Kỹ thuật đánh dấu hoạt động bằng cách cố tình làm sai lệch dự đoán này. Thay vì chọn từ có xác suất cao nhất, mô hình sẽ sử dụng một nguồn ngẫu nhiên khác để chọn một từ ít phổ biến hơn nhưng vẫn phù hợp về mặt ngữ nghĩa. Điều này tạo ra một "chữ ký thống kê" riêng biệt trong văn bản, và chữ ký này có thể được phát hiện bằng một khóa số (digital key).

"Generative watermarking hoạt động bằng cách tinh chỉnh quy trình lấy mẫu token tiếp theo, để đưa vào các biến đổi ngữ cảnh tinh tế trong phân bố văn bản được tạo ra. Những biến đổi này tạo ra một dấu hiệu thống kê; trong quá trình phát hiện, dấu hiệu có thể được đo lường để xác định liệu văn bản có thực sự được tạo bởi LLM có đánh dấu hay không", các nhà nghiên cứu Google DeepMind giải thích.

Cam kết không ảnh hưởng đến chất lượng

Anthropic khẳng định việc đánh dấu chỉ được thực hiện ở những đoạn văn bản "ít quan trọng", nơi việc thay đổi từ ngữ không làm thay đổi ý nghĩa. Công ty tuyên bố: "Trong các thử nghiệm nội bộ, chúng tôi không thấy bất kỳ tác động nào của việc đánh dấu lên nội dung, mức độ sáng tạo, hay khả năng đọc của văn bản Claude". Một nghiên cứu có kiểm soát với người đánh giá cũng cho thấy không có sự khác biệt về chất lượng giữa các câu trả lời có và không có đánh dấu.

Tuy nhiên, điều này cũng có nghĩa là kỹ thuật này không thể áp dụng cho các đoạn văn bản mang tính thực tế cao hoặc mã nguồn lập trình. Như Anthropic thừa nhận: "Việc đánh dấu sẽ thưa thớt hơn trên các đoạn văn bản thực tế, nơi có ít sự lựa chọn từ ngữ mà không làm giảm độ chính xác". Ví dụ, thuật toán sẽ không thể hoán đổi tên các hàm trong code.

Hiệu quả chỉ mang tính tương đối

Điểm trừ lớn nhất của phương pháp này là nó không thực sự "không thể xóa bỏ". Trong phần FAQ, Anthropic thừa nhận rằng việc chỉnh sửa nhẹ có thể không loại bỏ hoàn toàn dấu vết, nhưng một sự viết lại toàn bộ sẽ làm được điều đó.

Dù vậy, có vẻ như Anthropic không quá bận tâm đến việc kỹ thuật này có thể bị vô hiệu hóa. Mục đích chính của họ là chứng minh nỗ lực tuân thủ các quy định pháp lý, mà cụ thể là EU AI Act. Điều này có thể được thấy qua việc họ chọn giải pháp không làm tăng chi phí vận hành.

"Watermarking có tác động không đáng kể đến tốc độ của mô hình, và vì nó không tạo thêm token nào, chi phí phục vụ và sử dụng mô hình không thay đổi", công ty cho biết.

Phương pháp này cũng không xâm phạm quyền riêng tư khi không chứa bất kỳ thông tin nhận dạng cá nhân nào, chỉ đơn thuần cho thấy Claude có thể đã tham gia vào quá trình tạo ra văn bản.

Một câu hỏi lớn được đặt ra: Liệu việc thay đổi từ ngữ "vô thưởng vô phạt" có thực sự là một bước tiến trong việc quản lý nội dung AI, hay chỉ là một hành động mang tính hình thức để đối phó với các quy định mới? Với việc các công ty lớn khác cũng có khả năng áp dụng phương pháp tương tự, tương lai của việc nhận diện văn bản AI vẫn còn là một vấn đề đầy thách thức.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗