OpenAI bắt đầu gắn watermark vào văn bản ChatGPT tại EU
OpenAI sẽ gắn watermark vô hình vào văn bản do ChatGPT và Codex tạo ra tại Liên minh châu Âu nhằm tuân thủ Đạo luật AI của EU. Công ty thừa nhận việc chỉnh sửa có thể khiến các dấu vết vô hình này khó bị phát hiện hơn.

OpenAI sẽ bắt đầu gắn watermark vô hình vào văn bản do ChatGPT và Codex tạo ra tại Liên minh châu Âu (EU) nhằm tuân thủ Đạo luật AI của EU. Thông tin được công ty đưa ra hôm thứ Hai trong một bài đăng trên blog.
Các quy định về tính minh bạch của Đạo luật AI EU, có hiệu lực từ ngày 2 tháng 8, yêu cầu các công ty AI phải đánh dấu nội dung do AI tạo ra theo cách mà các hệ thống khác có thể nhận diện được.
Watermark hoạt động như thế nào?
Theo OpenAI, watermark sẽ được triển khai trong vài tuần tới cho người dùng ChatGPT và Codex đủ điều kiện trên tất cả các gói dịch vụ, nhưng chỉ ở EU. Các nhà phát triển sử dụng API của OpenAI ở bất kỳ đâu trên thế giới có thể bật tính năng này cho một số mô hình nhất định bắt đầu từ hôm nay; mặc định tính năng này đang tắt. OpenAI cho biết họ chưa đặt watermark văn bản làm mặc định toàn cầu ngay từ khi ra mắt.
Watermark không phải là một ký hiệu thực tế, mà hoạt động bằng cách tinh chỉnh nhẹ nhàng lựa chọn từ ngữ của mô hình, để lại một mẫu mà người đọc không nhìn thấy nhưng máy dò có thể phát hiện. Vì nó nằm trong chính các từ ngữ, nó đi theo văn bản khi được sao chép và dán. OpenAI khẳng định watermark không nhận diện người dùng và họ không thấy thay đổi đáng kể nào về hiệu suất của mô hình khi bật tính năng này.
OpenAI cũng đã công bố một báo cáo kỹ thuật cho phương pháp của mình, có tên textGrain, cùng với thông báo trên. Báo cáo được đồng soạn thảo với các nhà nghiên cứu từ Đại học Pennsylvania và Yale, trình bày ví dụ về việc sử dụng một khóa bí mật để sắp xếp các dự đoán từ tiếp theo nhằm hoàn thành câu. Khi cộng dồn hàng trăm thao tác điều chỉnh nhỏ như vậy, máy dò có thể phát hiện nội dung do AI tạo ra chỉ bằng văn bản và khóa.
Chỉnh sửa có xóa được watermark?
Các thử nghiệm của OpenAI cho thấy câu trả lời là có. Trong một thử nghiệm, việc thay thế 10% số từ bằng từ đồng nghĩa đã làm giảm khả năng phát hiện từ khoảng 92% xuống còn 66%. Công ty cũng cho biết các đoạn văn ngắn, câu trả lời toán học và văn bản dịch khó bị phát hiện hơn.
"Những hạn chế này góp phần vào quyết định của chúng tôi khi chỉ cấp quyền truy cập máy dò ban đầu cho các nhà nghiên cứu và tổ chức chuyên gia đã được phê duyệt, những người có thể giúp chúng tôi đánh giá độ tin cậy và các mục đích sử dụng có trách nhiệm", công ty cho biết.
OpenAI cũng cảnh báo rằng việc thiếu watermark "không chứng minh được tác giả là con người". Văn bản có thể quá ngắn hoặc bị chỉnh sửa quá nhiều, hoặc có thể đến từ AI của một công ty khác.
"[Watermark] có thể chỉ ra rằng một hệ thống của OpenAI đã tạo ra hoặc xử lý một phần đoạn văn, nhưng không cho biết bao nhiêu phán đoán, chỉnh sửa hay sáng tạo của con người đã đóng góp vào đó", công ty nói.
Bối cảnh cạnh tranh và lo ngại
Thông báo này được đưa ra hai tháng sau khi Anthropic tuyên bố sẽ gắn watermark vào văn bản do Claude tạo ra, động thái mà hãng áp dụng trên toàn cầu. Quyết định đó đã vấp phải phản ứng trái chiều từ một số người dùng Claude, những người lập luận rằng họ đã cung cấp "hướng dẫn, ngữ cảnh, quyết định" trong khi Claude chỉ là "công cụ".
Trước đó, OpenAI từng xây dựng một watermark văn bản nhưng đã trì hoãn việc phát hành, một phần vì lo ngại người dùng sẽ chuyển sang các đối thủ không gắn watermark. Theo báo cáo của The Wall Street Journal năm 2024, đây là một trong những lý do khiến công ty chần chừ.
Anthropic, Google, Meta, Microsoft và OpenAI nằm trong số các công ty đã cam kết tuân theo quy tắc thực hành của EU về nội dung do AI tạo ra.
Ý nghĩa với người dùng Việt Nam
Dù watermark hiện chỉ áp dụng trong phạm vi EU, động thái này phản ánh xu hướng toàn cầu về việc minh bạch hóa nội dung do AI tạo ra. Với các nhà phát triển và doanh nghiệp Việt Nam sử dụng API của OpenAI, việc có thể bật tính năng watermark cho một số mô hình là điểm cần lưu ý khi xây dựng sản phẩm, đặc biệt nếu họ hướng tới thị trường châu Âu hoặc cần chứng minh nguồn gốc nội dung.
Việc watermark có thể bị vô hiệu hóa phần nào bằng chỉnh sửa cũng đặt ra câu hỏi về giới hạn của các giải pháp kỹ thuật trong việc xác minh nội dung AI — một vấn đề ngày càng quan trọng khi AI tạo sinh trở nên phổ biến trong công việc và học tập.
Giao diện ChatGPT


