Từ các phiên bản Claude sắp ra mắt, mỗi văn bản do AI này tạo ra sẽ mang một watermark (chữ ký ẩn kỹ thuật số) không thể nhìn thấy bằng mắt thường. Người đọc không nhận ra bất kỳ sự khác biệt nào, nhưng bất kỳ ai nắm khóa giải mã đều có thể kiểm tra xác suất Claude đã viết đoạn văn đó. Anthropic công bố chi tiết kỹ thuật vào ngày 15/8/2026, giải đáp ba câu hỏi cốt lõi: cơ chế hoạt động, mức độ ảnh hưởng đến chất lượng đầu ra, và điều gì xảy ra khi văn bản bị chỉnh sửa.
Watermark ẩn của Claude hoạt động như thế nào?
Watermark khai thác những khoảnh khắc mà Claude có nhiều lựa chọn từ ngữ ngang nhau về mặt ý nghĩa. Khi hoàn thành câu “Hôm nay thời tiết lạnh và…”, cả “u ám” lẫn “xám xịt” đều truyền tải ý nghĩa gần như giống nhau. Thông thường, lựa chọn cuối cùng được quyết định bởi một số ngẫu nhiên. Khi watermark hoạt động, lựa chọn đó được dẫn dắt bởi một khóa mật mã (mã bí mật dùng để tạo và sau đó xác minh dấu vết) thay vì số ngẫu nhiên thông thường. Qua nhiều lựa chọn như vậy trong một phản hồi, một mẫu thống kê có thể phát hiện được dần hình thành.
Theo blog của Anthropic công bố tháng 8/2026, phương pháp được chọn là SynthID-Text, do nhóm Google DeepMind công bố trên tạp chí Nature năm 2024, dựa trên đề xuất của Scott Aaronson từ năm 2022. Bất kỳ ai nắm khóa đều có thể kiểm tra chuỗi từ trong văn bản, xem liệu nó có nhất quán với cách Claude sẽ chọn từ khi dùng khóa đó không, từ đó tính ra xác suất Claude là tác giả.
Anthropic xác nhận các đặc tính của hệ thống:
- Không thêm ký tự ẩn vào văn bản
- Không tiêu tốn thêm token (đơn vị xử lý mà mô hình AI dùng để tạo văn bản), chi phí giữ nguyên
- Watermark không chứa thông tin định danh, không thể truy nguyên ra người dùng, tổ chức hay phiên chat cụ thể
- Văn bản đọc y hệt nhau dù có watermark hay không
- Watermark không chỉ riêng Claude: các nhà phát triển mô hình lớn khác đã ký vào cùng Bộ quy tắc thực hành của EU và sẽ triển khai watermark theo cách riêng
Động lực đằng sau thay đổi này là Bộ luật Minh bạch AI của EU (EU AI Act’s Transparency Code), có hiệu lực từ ngày 2/8/2026, yêu cầu các nhà cung cấp AI phục vụ thị trường EU phải đánh dấu nội dung do AI tạo ra.
Watermark có làm Claude viết kém hơn không?
Không có sự khác biệt đáng kể nào về chất lượng. Anthropic cho biết kiểm thử nội bộ không ghi nhận tác động đến nội dung, tính sáng tạo hay khả năng đọc hiểu. Bằng chứng bổ sung đến từ bài báo SynthID-Text của Google DeepMind: nhóm nghiên cứu đã chạy mô hình có watermark trên một phần lưu lượng thực của Gemini và không tìm thấy sự khác biệt thống kê đáng kể về tỷ lệ đánh giá tích cực hoặc tiêu cực so với phiên bản không watermark. Trong một nghiên cứu đối chiếu trực tiếp, người đánh giá cũng không nhận ra sự khác biệt về chất lượng.
Hệ thống cũng không kéo Claude về phía từ ngữ bất thường. Anthropic nêu rõ watermark sẽ không bao giờ khiến Claude chọn một từ như “nubilous” (từ đồng nghĩa hiếm gặp, rất ít người biết, của “overcast”) mà bình thường mô hình sẽ không dùng. Claude chỉ chọn từ trong số những ứng viên nó đã cân nhắc sẵn. Watermark chỉ quyết định lựa chọn nào thắng trong một tình huống ngang cơ; nó không đưa thêm lựa chọn mới vào.
Chỉnh sửa có xóa được watermark không?
Tùy vào mức độ viết lại. Chỉnh sửa nhẹ có thể giữ nguyên phần lớn watermark. Viết lại hoàn toàn, thay thế mọi từ, sẽ xóa nó. Anthropic nhận định rằng ở mức đó, văn bản “trên thực tế” không còn là nội dung do AI tạo ra theo bất kỳ nghĩa có ý nghĩa nào.
Với văn bản do người viết và Claude chỉ đọc soát hay chỉnh sửa nhẹ, sự hiện diện của watermark phụ thuộc vào độ dài văn bản và mức độ Claude can thiệp. Nếu người dùng viết phần lớn, “hầu hết các từ” đến từ tác giả người và “có rất ít, nếu có, thứ để watermark bám vào,” theo Anthropic.
Cần phân biệt watermark với các công cụ phát hiện AI như Pangram, vốn tìm kiếm dấu hiệu phong cách viết đặc trưng của AI. Anthropic vạch rõ ranh giới: các công cụ đó nhận diện thói quen trong văn phong; watermark tìm kiếm chữ ký mật mã trong chuỗi lựa chọn từ ngữ. Đây là hai cơ chế khác nhau, trả lời hai câu hỏi khác nhau.
Watermark hoạt động thế nào với code?
Code mang ít watermark hơn văn xuôi, và đây là điều có chủ ý. Code phải tuân theo cú pháp và logic chính xác, khiến Claude ít có cơ hội tự do lựa chọn giữa các phương án ngang nhau về giá trị. Kết quả là watermark có ít chỗ để lại dấu vết hơn.
Tuy nhiên, ở những nơi có lựa chọn tùy ý trong code, chẳng hạn phần chú thích (comments) trong code, watermark vẫn có thể được áp dụng. Anthropic cho biết điều này sẽ có “tác động không đáng kể đến code thực tế được tạo ra.”
Ý nghĩa với khả năng hiển thị trên AI search
Watermark không phải hình phạt cho việc dùng AI. Nó là một dấu vết, một hồ sơ có thể kiểm tra sau khi thực tế đã diễn ra. Hãy nghĩ nó như một tờ biên lai. Nếu một thông cáo báo chí được Claude soạn thảo toàn bộ và đăng với chỉnh sửa tối thiểu, tín hiệu watermark sẽ rất rõ. Cùng bản thông cáo đó, nếu được biên tập viên người viết lại đáng kể trước khi đăng, sẽ mang rất ít hoặc không có watermark.
Watermark không phán xét cách nào tốt hơn. Nó chỉ ghi lại con đường mà văn bản đã đi qua.
Với các nhóm nội dung, điều này tạo ra một bất cân xứng thực tế đáng để hiểu ngay bây giờ. Anthropic có kế hoạch phát hành một API phát hiện watermark công khai. Điều đó có nghĩa là các nhà xuất bản, biên tập viên, và có thể cả các hệ thống AI, đều có thể truy vấn liệu một đoạn văn bản có khả năng do Claude tạo ra hay không trước khi quyết định trích dẫn, tái xuất bản hoặc dùng để huấn luyện mô hình. Cơ sở hạ tầng kỹ thuật cho quyết định đó nay đã tồn tại, và nhiều nhà cung cấp AI lớn đang cùng hướng đến tiêu chuẩn tương tự.
Một giới hạn mà các nguồn nêu rõ: watermark chỉ trả lời câu hỏi “Khả năng phần này do Claude viết là bao nhiêu?” Nó không thể xác nhận tác giả là người, và không thể nhận diện văn bản do mô hình AI khác tạo ra, dù mô hình đó dùng cách tiếp cận tương tự. Đây là giới hạn quan trọng với ai kỳ vọng watermark sẽ giải quyết dứt điểm câu hỏi về tác quyền. Watermark thu hẹp không gian xác suất; nó không kết luận câu hỏi.
Góc nhìn Hingewise
Điều quan trọng không phải là watermark tồn tại, mà là ai sẽ làm gì với tín hiệu đó.
Hãy lấy ví dụ cụ thể: Google, các nền tảng học thuật hay nhà tuyển dụng hoàn toàn có thể tích hợp API phát hiện watermark vào quy trình của họ và ưu tiên hoặc lọc nội dung dựa trên kết quả. Ngược lại, họ cũng có thể không làm gì cả trong nhiều năm. EU đã thiết lập tầng nền: yêu cầu đánh dấu nội dung AI kể từ 2/8/2026. Nhưng việc các nền tảng có xây dựng chính sách dựa trên tầng nền đó hay không là một quyết định hoàn toàn riêng biệt.
Có một điểm mà các nguồn không nêu rõ nhưng đáng lưu ý: watermark hiện tại chỉ trả lời được “Claude có tham gia không, và ở mức độ nào?” Nó không phân biệt được văn bản Claude soạn cho một chuyên gia rà soát kỹ với văn bản Claude viết xong và nhấn đăng không qua biên tập. Cả hai có thể có mức watermark gần giống nhau, nhưng chất lượng kiểm soát biên tập lại hoàn toàn khác nhau. Đây là khoảng mù mà các nền tảng và chính sách sẽ phải tự lấp đầy, và chưa có câu trả lời rõ ràng nào vào thời điểm này.
Nhận định của Hingewise: mức độ ảnh hưởng thực sự của watermark Claude sẽ do các hệ thống downstream quyết định, bao gồm các nền tảng AI search, nhà xuất bản, cơ sở giáo dục và nhà tuyển dụng, tùy vào việc họ có chọn hành động dựa trên tín hiệu đó không. Điều đáng theo dõi tiếp không phải là bản thân watermark, mà là khi nào và liệu các nền tảng lớn có công bố chính sách cụ thể dựa trên nó.
Trước khi đăng nội dung có dùng Claude: kiểm gì?
- Xác định tỷ lệ Claude viết so với người viết trong bài: đây là yếu tố quyết định mức watermark mà văn bản mang
- Đánh giá mức độ chỉnh sửa: chỉnh sửa nhẹ giữ phần lớn watermark; viết lại toàn bộ thì xóa nó
- Ghi lại quy trình biên tập của đội ngay từ bây giờ: ai viết gì, Claude can thiệp ở bước nào, mức độ ra sao
- Theo dõi khi Anthropic phát hành API phát hiện watermark công khai: thử nghiệm trên nội dung thực tế
- Rà soát chính sách của nền tảng đăng bài: một số nền tảng có thể bắt đầu dùng tín hiệu watermark để phân loại hoặc xếp hạng nội dung
- Lưu ý với code: watermark yếu hơn nhiều trong code nhưng vẫn xuất hiện trong phần chú thích (comments)
