Anthropic hé lộ cơ chế hoạt động của watermark vô hình trên văn bản Claude
Anthropic vừa công bố chi tiết cách thức áp dụng watermark vô hình lên văn bản do Claude tạo ra, nhằm tuân thủ luật AI của châu Âu. Công nghệ này dựa trên hệ thống SynthID-Text mã nguồn mở từ Google DeepMind, giúp tạo ra các mẫu nhận diện thông qua xác suất lựa chọn từ ngữ, đồng thời không ảnh hưởng đến chất lượng hay chi phí nội dung.

Anthropic tiết lộ cách watermark vô hình trên văn bản Claude sẽ hoạt động
Anthropic vừa làm rõ kế hoạch áp dụng watermark vô hình lên văn bản do Claude tạo ra, để tương thích với quy định minh bạch AI của châu Âu. Trong thông báo hôm thứ Sáu, hãng này xác nhận hệ thống đánh dấu văn bản của Claude là "một phiên bản của phương pháp SynthID-Text" — một công nghệ watermark mã nguồn mở do Google DeepMind phát triển, tạo ra các mẫu nhận diện dựa trên xác suất chọn từ.
Vì sao Anthropic cần watermark văn bản?
Tính năng watermark này, cùng với hỗ trợ C2PA cho hình ảnh do Claude xử lý, được giới thiệu nhằm đáp ứng nghĩa vụ theo Đạo luật AI của Liên minh châu Âu (EU). Đạo luật này yêu cầu các nội dung âm thanh, hình ảnh, video và văn bản tổng hợp phải có dấu hiệu đọc được bằng máy, giúp nhận diện nội dung do AI tạo ra hoặc thao túng.
Anthropic khẳng định watermark văn bản sẽ không làm tăng chi phí sử dụng Claude, cũng như "không gây bất kỳ ảnh hưởng thực tế nào đến chất lượng hoặc nội dung đầu ra của Claude".
Cơ chế hoạt động của SynthID-Text
Công nghệ này hoạt động dựa trên nguyên tắc: trong một câu văn, có những từ xuất hiện với xác suất rất thấp, nhưng cũng có những từ có khả năng cao. Ví dụ, với câu "Thời tiết hôm nay lạnh và…", từ "có đường" rất khó xuất hiện, nhưng "âm u" hay "xám xịt" lại rất hợp lý.
Trong phần lớn trường hợp, việc lựa chọn từ nào không quan trọng với người đọc vì ý nghĩa câu văn gần như giống nhau. Khi đó, lựa chọn này được quyết định bằng một số ngẫu nhiên. Watermark tận dụng các quyết định này — diễn ra rất nhiều lần trong một văn bản — để tạo ra một mẫu hình có hệ thống trong phản hồi của Claude.
Mẫu hình này không thể nhận thấy bằng mắt thường, nhưng có thể được phát hiện bởi những người sở hữu khóa mã hóa tương ứng. Khi bật watermark, quá trình chọn từ vẫn ngẫu nhiên nhưng nguồn ngẫu nhiên được thay đổi: thay vì dùng bộ sinh số ngẫu nhiên thông thường, hệ thống dùng khóa và một vài từ phía trước để quyết định từ tiếp theo.
Bối cảnh rộng hơn
Như Anthropic nhận định, yêu cầu minh bạch AI của EU cũng tác động đến các nhà phát triển AI lớn khác, vì vậy Claude không phải là mô hình duy nhất áp dụng watermark văn bản. Trợ lý ảo Gemini của Google đã hỗ trợ SynthID Text từ năm 2024. Trong khi đó, OpenAI vẫn chưa công bố kế hoạch watermark cụ thể cho ChatGPT trong lộ trình tuân thủ AI Act, dù hãng này cũng chịu sự điều chỉnh của luật.
Với người dùng tại Việt Nam, nếu đang sử dụng Claude để tạo nội dung phục vụ học tập, làm việc hay sáng tạo, các watermark này sẽ không gây ảnh hưởng gì đến trải nghiệm. Tuy nhiên, điều này mở ra hướng minh bạch hóa nội dung AI trong bối cảnh các quy định về AI ngày càng được siết chặt trên toàn cầu.
Hình minh họa cơ chế watermark văn bản của Claude