AI Detection

Dấu watermark của Claude: Dấu này nằm ở đâu và chứng minh điều gì

Anthropic bắt đầu đánh dấu đầu ra văn bản của Claude vào ngày 11 August 2026. Hầu như mọi giải thích về nó kể từ đó đều mô tả sai cơ chế. Dấu này không phải là một ký tự ẩn trong trang, mà là một thiên lệch thống kê trong việc mô hình chọn từ nào, và sự khác biệt đó quyết định mọi thứ: cái gì mang dấu, cái gì xóa được dấu, và kết quả dương tính thực sự nói được rất ít về việc ai đã viết một tài liệu.

10 min
Diagram contrasting a hidden-character watermark with a sampling watermark carried in the model's word choices

Phần lớn những gì đã được viết về watermark của Claude kể từ tháng 8 mô tả một cơ chế không phải là cơ chế mà Anthropic đã triển khai. Cách giải thích phổ biến cho rằng có một ký tự vô hình được đặt giữa các từ, một khoảng trắng có độ rộng bằng 0 hoặc một ký tự Unicode trông giống hệt, chờ bộ phát hiện tìm ra. Đó sẽ là một phỏng đoán hợp lý. Nhưng nó cũng sai, và sai lầm này không mang tính học thuật, vì nó là lý do khiến cả một nhóm công cụ miễn phí được quảng bá là trình gỡ watermark hoàn toàn không có tác dụng đối với dấu này.

Dấu của Anthropic nằm ngay trong chính lựa chọn từ ngữ. Không có gì được chèn vào văn bản. Khi điều đó đã rõ, các câu hỏi thực tiễn tự trả lời theo cách mà chúng không thể trả lời khi hình dung về ký tự ẩn vẫn còn chi phối, bao gồm thao tác nào sẽ truyền dấu đi, thao tác nào sẽ xóa nó, và bộ phát hiện thực sự đang nói gì với bạn khi nó báo có khớp.

Phần sau đây được rút ra từ chính tài liệu của Anthropic, chứ không phải từ các bài viết xung quanh nó, và cố ý nêu cụ thể các giới hạn mà chính công ty đã nêu.

Bài viết hỗ trợ của Anthropic về cách Claude đánh dấu nội dung do AI tạo ra: watermark nhúng trong văn bản và siêu dữ liệu nguồn gốc được ký theo bộ quy tắc thực hành của EU AI Act
Tài liệu của Anthropic về kế hoạch đánh dấu: watermark văn bản nhúng cùng siêu dữ liệu nguồn gốc được ký, với các mô hình mới đánh dấu ngay từ ngày đầu theo lộ trình của EU AI Act.

Anthropic đã bật gì, và khi nào

Anthropic bắt đầu đánh dấu đầu ra của Claude vào ngày 11 tháng 8 năm 2026. Bài viết trong trung tâm trợ giúp của hãng về chủ đề này mô tả dấu văn bản là "một watermark không thể nhận thấy được trực tiếp vào chính văn bản", và nói rằng người đọc "sẽ không nhìn thấy nó, và nó không làm thay đổi ý nghĩa, chất lượng, hay khả năng đọc".

Phạm vi bao phủ rất rộng. Các mô hình được phát hành vào hoặc sau ngày 2 tháng 8 năm 2026 sẽ mang dấu hiệu từ khi ra mắt, và Anthropic liệt kê các bề mặt áp dụng là Claude Platform API, Claude, Claude Code, Claude Cowork và Claude Tag, bao gồm cả Claude được truy cập qua AWS, Google Cloud và Microsoft Foundry. Quy định này áp dụng trên toàn cầu. Việc cho rằng bất cứ nội dung nào được soạn trước tháng 8 đều tự động được miễn là không khôn ngoan, vì công ty đã mô tả việc đưa các mô hình trước đó vào trong một giai đoạn chuyển tiếp.

Động lực pháp lý đứng sau quy định này là Article 50 of the EU AI Act, trong đó các nghĩa vụ minh bạch yêu cầu các nhà cung cấp hệ thống sinh tạo phải đánh dấu đầu ra có thể đọc bằng máy. Anthropic đã ký Code of Practice của Article 50(2). Điều đáng chú ý là quy định này điều chỉnh các hệ thống được sử dụng trong Liên minh châu Âu và không có nội dung nào buộc phải áp dụng trên toàn thế giới. Anthropic đã áp dụng dấu hiệu ở mọi nơi bất kể điều đó, đây là một lựa chọn chính sách chứ không phải yêu cầu pháp lý, và đó là lý do vì sao một nhà nghiên cứu ở Kuala Lumpur hoặc Chicago cũng chịu sự điều chỉnh của một quy tắc châu Âu.

Dấu hiệu là một mẫu lựa chọn từ ngữ, không phải một ký tự ẩn

Ở mỗi bước tạo văn bản, một mô hình ngôn ngữ đang lựa chọn giữa một số phần tiếp nối gần như tương đương theo thống kê của chính nó. Khi một từ tốt ngang với một từ khác, phải có điều gì đó phá vỡ thế cân bằng. Một watermark lấy mẫu phá vỡ các thế cân bằng đó theo một khóa do nhà cung cấp nắm giữ, để trên một đoạn văn bản đủ dài, các lựa chọn tích lũy tạo thành một mẫu mà một bộ phát hiện giữ cùng khóa có thể đo được.

Không có gì được thêm vào trang. Không có ký tự nào để tìm, không có trường siêu dữ liệu nào trong văn bản, không có hiện vật định dạng nào. Những từ bạn đang đọc chính là watermark, theo nghĩa cụ thể rằng dấu hiệu là bản ghi của việc những từ nào đã được chọn trong số các phương án thay thế. Đó là lý do Anthropic có thể nói rằng dấu hiệu không làm tốn chi phí về ý nghĩa hay khả năng đọc, vì nó chưa bao giờ phải làm méo mó văn xuôi, mà chỉ phải ưu tiên một cách diễn đạt chấp nhận được hơn một cách diễn đạt chấp nhận được khác, lặp đi lặp lại.

Nó cũng giải thích tính bền vững. Anthropic nói rằng dấu này "sẽ đi cùng với văn bản khi nó được sao chép và dán ở nơi khác", và lý do là mang tính cấu trúc chứ không phải do sự khéo léo. Sao chép giữ nguyên các từ của bạn. Định dạng lại giữ nguyên các từ của bạn. Thay đổi phông chữ, xuất sang PDF, dán vào một trình soạn thảo khác, chuyển đổi sang văn bản thuần túy: tất cả đều giữ nguyên chuỗi từ, và chính chuỗi từ là thứ đang được đo lường.

Tại sao các công cụ làm sạch ký tự vô hình không có tác dụng với nó

Một số lượng lớn công cụ miễn phí hiện nay quảng cáo mình là trình gỡ watermark AI. Gần như tất cả chúng chỉ làm một việc: quét Unicode có độ rộng bằng không, khoảng trắng vô hình và các ký tự hình dạng tương tự, rồi xóa những gì chúng tìm thấy. Đó là một câu trả lời hợp lý cho một vấn đề có thật, vì một số hệ thống thực sự nhúng nguồn gốc trong các ký tự, và đây là công cụ phù hợp để loại bỏ các artefact định dạng thừa khỏi văn bản đã dán.

Đối với một watermark lấy mẫu, nó không làm được gì cả. Chạy một đoạn văn của Claude qua một công cụ làm sạch ký tự và mọi ký tự vô hình trong đó sẽ biến mất, trong khi đoạn văn vẫn được đo chính xác như trước, vì không một từ nào thay đổi. Công cụ đang tìm ở nơi mà dấu này chưa bao giờ tồn tại. Đây là sự hiểu lầm có hệ quả lớn nhất đang lưu hành, và bất kỳ ai dựa vào một công cụ xóa ký tự cho mục đích này đều đang nhận được một kết quả trông giống như một hành động nhưng thực ra không phải là một hành động.

Điểm chung này nằm cạnh câu hỏi rộng hơn về cách các bộ phát hiện AI thực sự hoạt động, mặc dù một watermark có khóa là một cơ chế khác với một bộ phân loại thống kê. Một bộ phân loại suy đoán từ hình dạng của bài viết. Một watermark đọc một tín hiệu đã được cài đặt có chủ đích, điều này khiến nó chính xác hơn nhiều về những gì nó phát hiện và hoàn toàn không tốt hơn trong việc cho bạn biết ai đã viết tài liệu.

Cơ chế thứ hai, áp dụng cho tệp thay vì văn bản

Anthropic vận hành hai hệ thống, và các bài viết đã phần lớn gộp chúng thành một. Bên cạnh watermark văn bản, các tệp do Claude tạo ra có thể mang "signed provenance metadata" theo tiêu chuẩn mở của Coalition for Content Provenance and Authenticity (C2PA).

Phần này hoạt động theo cách ngược lại với phần đầu. Siêu dữ liệu C2PA được gắn vào tệp thay vì được đan vào văn bản, vì vậy nó tương đối dễ bị mất, chỉ cần sao chép văn bản ra khỏi tệp thì siêu dữ liệu sẽ ở lại phía sau, vì nó chưa bao giờ nằm trong các từ ngữ. Hai hệ thống có những điểm mạnh đảo ngược nhau. Dấu văn bản vẫn tồn tại khi bị di chuyển và chống lại việc chỉnh sửa thông thường. Chữ ký của tệp thì chính xác và có thể kiểm chứng, nhưng không tồn tại qua hành động thông thường là chọn một đoạn và dán nó vào một tài liệu của riêng bạn.

Nhân hóa bài viết của bạn

Biến đổi văn bản có hỗ trợ AI của bạn và làm cho nó nghe tự nhiên như do con người viết, mà không chạm vào các từ quan trọng hoặc trích dẫn.

Bắt đầu miễn phí

Phát hiện dương tính thực sự xác lập điều gì

Ít hơn đáng kể so với điều mà từ "detection" gợi ra, và Anthropic nói về điều này một cách hiếm khi vòng vo. Tài liệu của hãng nêu rằng "detecting a Claude mark tells you that the content may have been processed by Claude" và rằng nó "does not, on its own, confirm the full provenance".

Hãy đọc kỹ điều đó, vì nó đang thực hiện một công việc chính xác. Được xử lý, chứ không phải được viết. Một kết quả dương tính phù hợp với một tài liệu mà Claude soạn từ con số không. Nó cũng hoàn toàn phù hợp với một tài liệu do chính bạn viết và yêu cầu Claude chỉnh cho chặt hơn. Tín hiệu này không có cách nào tách biệt các trường hợp đó, vì trong cả hai trường hợp Claude đều tạo ra các token cuối cùng xuất hiện trên trang.

Những giới hạn này cũng đi theo chiều ngược lại. Anthropic lưu ý rằng các dấu có thể không tồn tại qua việc chỉnh sửa mạnh, chuyển đổi định dạng hoặc các đoạn rất ngắn, và việc không có dấu không cho thấy nội dung không do AI tạo ra. Vì vậy, một kết quả âm tính hầu như không xác lập điều gì: văn bản có thể đến từ một mô hình khác, từ một Claude trước đó, hoặc từ Claude nhưng đã qua đủ nhiều lần sửa để làm mất tín hiệu. Việc phát hiện được thực hiện qua chính giao diện của Anthropic thay vì được mở cho bên thứ ba, đó là lý do các công cụ phát hiện AI đa dụng không đọc được tín hiệu này và cũng không thể được kỳ vọng là sẽ đọc được.

Thao tácTác động lên watermark của văn bảnVì sao
Sao chép và dánĐược giữ nguyênCác từ của bạn được bảo toàn chính xác
Định dạng lại, thay đổi phông chữ, xuất PDFĐược giữ nguyênTrình bày thay đổi, nhưng thứ tự từ không thay đổi
Xóa các ký tự vô hìnhKhông có tác độngDấu này chưa bao giờ được lưu trong một ký tự
Biên tập nhẹThường được giữ nguyênPhần lớn các từ vẫn còn, nên phần lớn mẫu cũng vẫn còn
Viết lại đáng kểBị phá vỡCác từ mới có nghĩa là các lựa chọn mới, không gắn với bản gốc
Dịch sang ngôn ngữ khácBị phá vỡChuỗi token được xây dựng lại từ đầu
Trích đoạn rất ngắnKhông đáng tin cậy theo cả hai cáchMột phép đo thống kê cần một đoạn văn bản đủ dài để kết luận bất cứ điều gì

Vấn đề ghi nhận tác giả mà điều này tạo ra đối với những người tự viết tác phẩm của mình

Phản ứng sắc bén nhất trước thông báo này không đến từ bất kỳ ai đang cố che giấu một tác phẩm do máy viết. Nó đến từ các luật sư, nhà nghiên cứu, học giả và biên tập viên, những người sử dụng mô hình theo cách họ sẽ dùng một biên tập viên sao chép, và những người nhận ra dấu này ghi lại điều gì.

Hãy xét trường hợp thông thường. Bạn viết một đoạn văn. Lập luận là của bạn, bằng chứng là của bạn, cấu trúc là của bạn. Bạn nhờ Claude sửa nhịp điệu và cắt đi hai trăm từ. Phần trả lại là đoạn văn của bạn, có dấu, và dấu đó không thể nói rằng gần như toàn bộ quá trình suy nghĩ và phần lớn cách diễn đạt đã có sẵn trước khi mô hình nhìn thấy nó. Nếu một cơ sở, nhà xuất bản hoặc người sử dụng lao động coi một kết quả dương tính là bằng chứng dứt khoát về quyền tác giả của AI, đây là một cách diễn giải mạnh hơn so với chính cách diễn đạt của Anthropic có thể ủng hộ, thì người viết buộc phải tranh luận chống lại một tín hiệu vốn chưa bao giờ được thiết kế để trả lời câu hỏi được đặt ra cho nó.

Đó là một vấn đề thực sự về ghi nhận tác giả hơn là một vấn đề về che giấu, và điều này đáng được nói rõ vì hai điều đó thường xuyên bị đánh đồng. Mong muốn lập luận của chính mình được ghi nhận cho mình không giống với mong muốn che giấu cách một tài liệu được tạo ra. Dù chính sách công bố của cơ sở của bạn yêu cầu gì, nó vẫn yêu cầu điều đó: việc xóa một dấu không làm thay đổi bất cứ điều gì về nghĩa vụ của bạn đối với người đọc trong một tuyên bố về việc sử dụng AI.

Điều gì xóa dấu, và điều gì chỉ trông như là xóa dấu

Một nguyên tắc bao trùm toàn bộ vấn đề này. Bất kỳ thao tác nào giữ nguyên các từ của bạn thì sẽ giữ dấu đó đi theo. Bất kỳ thao tác nào tạo lại các từ từ đầu thì sẽ phá vỡ dấu đó. Mọi điều khác đều suy ra từ đây.

Sao chép, định dạng lại, chuyển đổi kiểu tệp và loại bỏ các ký tự vô hình đều giữ nguyên các từ, vì vậy tất cả chúng đều giữ dấu. Dịch thuật và viết lại đáng kể tạo lại các từ từ đầu, vì vậy cả hai đều phá vỡ dấu, và Anthropic đã thừa nhận rằng việc chỉnh sửa nhiều có thể làm dấu biến mất. Viết lại bằng tay hoàn toàn có hiệu quả nếu bạn có thời gian, nhưng đối với một chương đầy đủ thì đa số mọi người không có.

Đây là cơ chế mà free Claude watermark remover của chúng tôi được xây dựng trên đó. Nó tái tạo một đoạn văn câu theo câu thông qua một mô hình khác, vì vậy mọi token đều được tạo mới, và một tín hiệu gắn với việc lấy mẫu của Claude không còn gì để bám vào. Phần mở đầu thay đổi và thứ tự mệnh đề dịch chuyển, trong khi số liệu, ngày tháng, tên riêng, các từ giảm nhẹ và từ vựng chuyên ngành được giữ nguyên, còn tài liệu trích dẫn và tài liệu tham khảo được chép lại chính xác thay vì diễn đạt lại. Một hệ quả của quy tắc cuối cùng đó đáng biết trước: một đoạn trích dài lấy ra từ Claude sẽ giữ nguyên bất kỳ dấu nào mà nó đi kèm, vì tái hiện chính xác một đoạn trích là nghĩa vụ quan trọng hơn trong hai nghĩa vụ.

Đối với các tài liệu dài hơn, hoặc đối với công việc học thuật nơi văn phong và cách xử lý trích dẫn có trọng lượng lớn hơn so với văn xuôi thông thường, cùng một cách tái cấu trúc đó được áp dụng trên toàn bộ bản thảo trong TextPulse humanizer, vốn được xây dựng riêng cho viết nghiên cứu và xem các trích dẫn, thuật ngữ được định nghĩa và từ vựng kỹ thuật như những điểm cố định.

Nếu bài viết của chính bạn đã bị đánh dấu

Hãy bắt đầu bằng việc xác định chính xác bạn đang nhìn vào điều gì. Một dấu đánh nghĩa là Claude đã xử lý văn bản vào một thời điểm nào đó. Nó không xếp hạng bao nhiêu phần của tài liệu là của bạn, và chính cách diễn đạt của Anthropic sẽ ủng hộ bạn về điểm đó nếu cuộc trao đổi trở nên chính thức.

Hãy giữ lại mọi bằng chứng về quá trình mà bạn đã có. Lịch sử bản nháp, tệp phiên bản, ghi chú và dàn ý đều nói lên quyền tác giả theo cách mà một tín hiệu nguồn gốc không thể làm được, và chúng thuyết phục hơn đáng kể so với một lập luận về thống kê. Nếu tác phẩm của bạn phải được công bố dưới tên của chính bạn và việc đánh dấu tạo ra một vấn đề quy thuộc thực sự, thì việc tái cấu trúc đoạn văn bằng chính cách diễn đạt của bạn sẽ giải quyết nó, dù bạn làm bằng tay hay bằng công cụ, và nó giải quyết chính xác vì tái cấu trúc là điều duy nhất chạm vào loại dấu này.

Anthropic sẽ tiếp tục thay đổi các chi tiết. Phạm vi vẫn đang mở rộng sang các mô hình cũ hơn, phát hiện vẫn đang phát triển, và bức tranh pháp lý phía sau nó còn non trẻ hơn công nghệ. Phần khó có khả năng thay đổi là cơ chế, và việc biết rằng dấu này nằm ở lựa chọn từ ngữ chứ không phải ở một ký tự ẩn là điều phân biệt một bước làm được gì đó với một bước chỉ tạo cảm giác như vậy. Nếu bạn muốn xem cùng câu hỏi từ phía bộ phân loại thay vì phía watermark, thì vốn từ mà tiết lộ bài viết AI cho người đọc là con người lại là một tín hiệu khác, và không có khóa nào có thể đo được.

XLinkedInFacebook

Câu hỏi thường gặp

Đó là một dấu thống kê mà Anthropic nhúng vào đầu ra văn bản của Claude, được áp dụng từ ngày 11 August 2026 trên mọi mô hình phát hành vào hoặc sau ngày 2 August 2026. Thay vì chèn bất cứ thứ gì vào trang, nó làm lệch lựa chọn của mô hình giữa các từ gần như tương đương theo một khóa mà Anthropic nắm giữ, để một đoạn đủ dài mang một mẫu có thể đo lường được. Anthropic mô tả nó là một watermark không thể nhận thấy, được dệt trực tiếp vào văn bản và không làm thay đổi ý nghĩa, chất lượng hoặc khả năng đọc.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

Cập nhật về AI humanization

Nhận mẹo về viết học thuật, phát hiện AI và humanization được gửi thẳng vào hộp thư của bạn.

Không spam. Có thể hủy đăng ký bất cứ lúc nào.