Claude 워터마크: 표식이 존재하는 위치와 그것이 입증하는 것
Anthropic은 2026년 8월 11일에 Claude의 텍스트 출력에 표식을 붙이기 시작했다. 그 이후의 거의 모든 설명은 그 메커니즘을 잘못 설명해 왔다. 이 표식은 페이지에 숨겨진 문자가 아니라, 모델이 선택한 단어들에 있는 통계적 편향이며, 바로 그 차이가 모든 것을 결정한다. 무엇이 그것을 지니는지, 무엇이 그것을 제거하는지, 그리고 양성 결과가 실제로 문서의 작성자에 관해 무엇을 얼마나 적게 확정하는지 말이다.
8월 이후 Claude의 워터마크에 관해 작성된 내용의 대부분은 Anthropic이 실제로 배포한 방식이 아닌 메커니즘을 설명한다. 일반적인 설명은 단어 사이에 보이지 않는 문자가 끼워져 있고, 제로 폭 공백이나 비슷하게 생긴 Unicode 글리프가 탐지기가 그것을 찾아내기를 기다린다는 것이다. 이는 그럴듯한 추측일 수 있다. 그러나 그것은 틀렸고, 그 오류는 학문적으로도 사소하지 않다. 바로 그 때문에 워터마크 제거 도구로 판매되는 무료 도구의 한 범주가 이 특정 표식에는 전혀 효과가 없다.
Anthropic의 표식은 단어 선택 자체에 존재한다. 텍스트에 어떤 것도 삽입되지 않는다. 이것이 분명해지면, 실무적 질문들은 숨은 문자라는 관점이 작동하는 동안에는 답할 수 없던 방식으로 스스로 답을 드러낸다. 여기에는 어떤 연산이 표식을 다음으로 전달하는지, 어떤 연산이 그것을 제거하는지, 그리고 탐지기가 적중을 보고할 때 실제로 무엇을 말해 주는지가 포함된다.
다음 내용은 Anthropic의 자체 문서에서 가져온 것이며, 회사가 스스로 밝힌 한계를 의도적으로 구체적으로 제시한다.

Anthropic이 무엇을, 언제 적용했는가
Anthropic은 2026년 8월 11일에 Claude의 출력에 표식을 적용하기 시작했다. 이 주제에 관한 도움말 센터 문서는 텍스트 표식을 "텍스트 자체에 직접 들어가는 지각할 수 없는 워터마크"라고 설명하며, 독자는 그것을 "볼 수 없고, 의미, 품질 또는 가독성을 바꾸지 않는다"고 말한다.
적용 범위는 넓습니다. 2026년 8월 2일 이후에 출시된 모델은 출시 시점부터 표시가 붙으며, Anthropic은 적용 대상 표면으로 Claude Platform API, Claude, Claude Code, Claude Cowork, Claude Tag를 제시하고, AWS, Google Cloud, Microsoft Foundry를 통해 도달한 Claude도 포함합니다. 이는 전 세계적으로 적용됩니다. 8월 이전에 작성된 모든 것이 자동으로 면제된다고 보는 것은 현명하지 않습니다. 회사는 이전 모델도 전환 기간에 걸쳐 포함시키겠다고 설명했기 때문입니다.
그 배경이 되는 규제 추진은 EU AI Act의 Article 50이며, 그 투명성 의무는 생성 시스템 제공자가 기계 판독 가능한 출력을 표시하도록 요구합니다. Anthropic은 Article 50(2) Code of Practice에 서명했습니다. 주목할 점은 이 규정이 유럽연합 내에서 사용되는 시스템을 규율할 뿐, 전 세계적 적용을 강제하는 내용은 전혀 포함하지 않는다는 것입니다. 그럼에도 Anthropic은 어디서나 동일한 표시를 적용했는데, 이는 법적 요구가 아니라 정책적 선택이며, 그래서 쿠알라룸푸르나 Chicago의 연구자도 유럽 규칙의 적용을 받게 됩니다.
표시는 숨겨진 문자가 아니라 단어 선택의 패턴이다
언어 모델은 텍스트를 생성하는 모든 단계에서, 자체 통계상 거의 동등한 여러 연속 후보 중 하나를 선택하고 있습니다. 한 단어가 다른 단어만큼 좋다면, 그 동률을 깨는 무언가가 필요합니다. 샘플링 워터마크는 제공자가 보유한 키에 따라 이러한 동률을 깨므로, 적절한 길이의 텍스트를 누적하면 동일한 키를 가진 탐지기가 측정할 수 있는 패턴이 형성됩니다.
페이지에 추가되는 것은 없습니다. 찾아낼 문자가 있는 것도 아니고, 텍스트 안의 메타데이터 필드도 없으며, 서식상의 인공물도 없습니다. 여러분이 읽고 있는 단어들이 바로 워터마크이며, 여기서 표시란 대안들 가운데 어떤 단어가 선택되었는지를 기록한 것이라는 특정한 의미를 가집니다. 이것이 Anthropic이 이 표시가 의미나 가독성에 비용을 들이지 않는다고 말할 수 있는 이유입니다. 이 표시는 산문을 왜곡할 필요가 전혀 없었고, 단지 허용 가능한 한 표현보다 다른 허용 가능한 한 표현을 반복해서 선호하기만 하면 되었기 때문입니다.
또한 이것은 내구성도 설명한다. Anthropic은 이 표식이 "복사하여 다른 곳에 붙여 넣을 때 텍스트와 함께 이동한다"고 말하며, 그 이유는 영리함이 아니라 구조에 있다. 복사는 단어를 보존한다. 재서식 지정도 단어를 보존한다. 글꼴을 바꾸는 것, PDF로 내보내는 것, 다른 편집기에 붙여 넣는 것, 일반 텍스트로 변환하는 것, 이 모든 것은 단어의 순서를 보존하며, 바로 그 단어의 순서가 측정 대상이다.
보이지 않는 문자 정리 도구가 이것에 아무런 영향을 주지 못하는 이유
현재 많은 무료 도구가 자신을 AI 워터마크 제거 도구라고 광고한다. 거의 모두가 하는 일은 하나다. 제로 폭 Unicode, 보이지 않는 공백, 그리고 비슷하게 생긴 글리프를 찾아낸 뒤, 발견한 것을 삭제한다. 이는 실제 문제에 대한 타당한 대응이었는데, 일부 시스템은 문자 안에 실제로 출처 정보를 내장하고 있으며, 붙여 넣은 텍스트에서 우발적인 서식 흔적을 제거하는 데에는 이것이 올바른 도구이기 때문이다.
표본 추출 워터마크에 대해서는 전혀 아무 일도 하지 못한다. Claude 문단을 문자 정리 도구에 통과시키면 그 안의 모든 보이지 않는 문자가 사라지지만, 문단은 이전과 정확히 같은 방식으로 측정된다. 단어가 하나도 바뀌지 않았기 때문이다. 이 도구는 표식이 한 번도 존재한 적이 없는 곳을 보고 있다. 이것은 현재 유통되는 가장 중대한 오해이며, 이 목적을 위해 문자 제거 도구에 의존하는 사람은 마치 행동을 한 것 같은 결과를 얻지만 실제로는 아무것도 하지 않은 것이다.
이 일반적인 요점은 AI 탐지기가 실제로 어떻게 작동하는지에 대한 더 넓은 질문과 함께 놓여 있지만, 키가 지정된 워터마크는 통계적 분류기와는 다른 종류의 것이다. 분류기는 글의 형태로부터 추정한다. 워터마크는 의도적으로 심어진 신호를 읽는다. 따라서 무엇을 탐지하는지에 대해서는 훨씬 더 정확하지만, 누가 문서를 썼는지를 알려 주는 데에는 전혀 더 낫지 않다.
텍스트가 아니라 파일에 적용되는 두 번째 메커니즘
Anthropic은 두 개의 시스템을 운영하며, 보도는 이를 대체로 하나로 합쳐 다루어 왔다. 텍스트 워터마크와 함께, Claude가 생성한 파일에는 콘텐츠 출처 및 진정성 연합(C2PA) 개방형 표준을 따르는 "서명된 출처 메타데이터"가 포함될 수 있다.
이 절반은 첫 번째와 반대 방식으로 작동한다. C2PA 메타데이터는 산문 전체에 스며드는 것이 아니라 파일에 첨부되므로, 비교적 쉽게 사라질 수 있다. 파일에서 텍스트를 복사해 내면 메타데이터는 남겨진다. 그것은 원래 단어들 속에 있던 것이 아니기 때문이다. 두 시스템의 강점은 서로 뒤집혀 있다. 텍스트 표시는 이동되어도 살아남고, 가벼운 편집에도 견딘다. 파일 서명은 정확하고 검증 가능하지만, 문단을 선택해 자신의 문서에 붙여 넣는 일상적인 행위까지는 살아남지 못한다.
자신의 논문을 인간적으로 다듬기
중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.
긍정적 탐지가 실제로 확립하는 것
"탐지"라는 말이 암시하는 것보다 훨씬 적은 것을 확립할 뿐이며, Anthropic은 이 점에 대해 이례적으로 직접적이다. 해당 문서는 "Claude 표시를 탐지한다는 것은 해당 콘텐츠가 Claude에 의해 처리되었을 수 있음을 의미한다"고 밝히며, 그것이 "그 자체로 완전한 출처를 확인하는 것은 아니다"라고 설명한다.
이 문장을 주의 깊게 읽어야 한다. 정확한 역할을 하고 있기 때문이다. 작성된 것이 아니라 처리된 것이다. 긍정 결과는 Claude가 아무것도 없는 상태에서 초안을 작성한 문서와 양립 가능하다. 또한 당신이 직접 작성한 문서를 Claude에게 다듬어 달라고 요청한 경우와도 양립 가능하다. 이 신호는 이 두 경우를 구분할 방법이 없다. 두 경우 모두 Claude가 페이지에 남게 된 토큰을 생성했기 때문이다.
한계는 반대 방향에서도 존재한다. Anthropic은 표시가 강한 편집, 형식 변환, 또는 매우 짧은 문단에서는 살아남지 못할 수 있으며, 표시가 없다고 해서 콘텐츠가 AI로 생성되지 않았음을 뜻하는 것은 아니라고 지적한다. 따라서 부정 결과가 확립하는 것은 거의 없다. 텍스트는 다른 모델에서 왔을 수도 있고, 더 이른 시기의 Claude에서 왔을 수도 있으며, 또는 충분한 수정 과정을 거쳐 신호가 지워진 Claude에서 왔을 수도 있다. 탐지는 제3자에게 공개되지 않고 Anthropic 자체 인터페이스를 통해서만 이루어지도록 설계되어 있으므로, 범용 AI 탐지 도구들은 이 신호를 읽지 않으며, 그렇게 할 것으로 기대할 수도 없다.
| 작업 | 텍스트 워터마크에 미치는 영향 | 이유 |
|---|---|---|
| 복사하여 붙여넣기 | 그대로 유지됨 | 사용자의 문장은 정확히 보존된다 |
| 서식 변경, 글꼴 변경, PDF 내보내기 | 그대로 유지됨 | 표현 방식은 바뀌지만, 단어의 순서는 바뀌지 않는다 |
| 보이지 않는 문자 삭제 | 영향 없음 | 표시는 문자 안에 저장된 적이 없다 |
| 가벼운 문장 편집 | 대체로 그대로 유지됨 | 대부분의 단어가 살아남으므로, 패턴의 대부분도 살아남는다 |
| 대폭적인 재작성 | 무너짐 | 새로운 단어는 새로운 선택을 뜻하며, 원문과 연결되지 않는다 |
| 다른 언어로의 번역 | 무너짐 | 토큰 시퀀스가 처음부터 다시 구성된다 |
| 매우 짧은 발췌문 | 어느 쪽이든 신뢰하기 어려움 | 통계적 측정은 결론을 내리기 위해 충분한 분량의 텍스트가 필요하다 |
자신의 작업을 스스로 작성한 사람들에게 이것이 만들어내는 저자 표시 문제
이 발표에 대한 가장 날카로운 반응은 기계가 작성한 작업을 숨기려는 사람에게서 나오지 않았다. 그것은 이 모델을 교정자처럼 사용하는 변호사, 연구자, 학자, 편집자에게서 나왔고, 그들은 이 표시가 무엇을 기록하는지 알아차렸다.
일반적인 경우를 생각해 보자. 당신은 한 단락을 쓴다. 논지는 당신의 것이고, 근거도 당신의 것이며, 구조도 당신의 것이다. 당신은 Claude에게 리듬을 다듬고 200단어를 줄여 달라고 요청한다. 돌아오는 것은 표시가 된 당신의 단락이며, 그 표시는 사고의 거의 전부와 표현의 대부분이 모델이 보기 전부터 이미 거기에 있었다는 사실을 말해 줄 수 없다. 기관, 출판사 또는 고용주가 양성 반응을 AI 저자의 확정적 증거로 취급한다면, 이는 Anthropic의 문구 자체가 뒷받침하는 해석보다 더 강한 해석인데, 작성자는 자신에게 제기된 질문에 답하도록 설계된 적이 없는 신호에 맞서 논증해야 하는 처지에 놓인다.
이는 은폐의 문제가 아니라 귀속의 문제에 관한 진정한 문제이며, 이 둘이 끊임없이 혼동되기 때문에 분명히 말할 필요가 있다. 자신의 논증이 자신에게 귀속되기를 바라는 것은 문서가 어떻게 작성되었는지를 숨기고자 하는 것과 같은 뜻이 아니다. 소속 기관의 공개 정책이 무엇을 요구하든, 그것은 여전히 요구한다. AI 사용 선언에서 표시를 지운다고 해서 독자에게 져야 할 의무가 달라지는 것은 아니다.
무엇이 표시를 지우고, 무엇이 그렇게 보일 뿐인지
하나의 원칙이 이 모든 것을 포괄한다. 사용자의 문장을 그대로 남겨 두는 모든 작업은 표시를 그대로 이어 간다. 문장을 처음부터 다시 생성하는 모든 작업은 그것을 끊는다. 나머지는 모두 이로부터 따른다.
복사, 재서식화, 파일 형식 변환, 보이지 않는 문자 제거는 모두 문장을 그대로 남기므로, 모두 표시를 이어 간다. 번역과 실질적인 재작성은 문장을 다시 생성하므로, 둘 다 표시를 끊으며, Anthropic도 대폭 편집하면 표시가 사라질 수 있음을 인정했다. 손으로 다시 쓰는 방법도 시간이 충분하다면 완전히 가능하지만, 한 장 전체를 그렇게 하기는 대부분의 사람에게 어렵다.
이것이 바로 우리의 free Claude watermark remover가 기반을 두고 있는 메커니즘이다. 이 도구는 다른 모델을 통해 한 문장씩 구절을 다시 구성하므로, 모든 토큰이 새로 생성되고 Claude의 샘플링에 연결된 신호는 더 이상 붙을 대상이 없다. 문두는 바뀌고 절의 순서도 이동하지만, 수치, 날짜, 이름, 완곡 표현, 분야 어휘는 그대로 유지되며, 인용문과 참고문헌은 표현을 바꾸지 않고 정확히 그대로 옮긴다. 이 마지막 규칙의 한 가지 결과는 미리 알아 둘 만하다. Claude에서 가져온 긴 블록 인용은 도착할 때 함께 있던 표시를 그대로 유지하는데, 인용을 정확하게 재현하는 것이 두 의무 중 더 중요한 것이기 때문이다.
더 긴 문서의 경우, 또는 일반 산문보다 문체와 인용 처리의 비중이 더 큰 학술 작업의 경우, 동일한 재구성 방식이 TextPulse humanizer에서 전체 원고에 걸쳐 적용되며, 이 도구는 연구 글쓰기를 위해 특별히 만들어졌고 인용, 정의된 용어, 기술 어휘를 고정점으로 취급한다.
자신의 글이 표시되어 돌아온 경우
먼저 무엇을 보고 있는지 정확하게 파악해야 한다. 표시가 있다는 것은 Claude가 어느 시점에 그 텍스트를 처리했다는 뜻이다. 그것은 문서의 어느 정도가 당신의 것인지를 평가하지 않으며, 대화가 공식적인 단계로 가더라도 Anthropic의 공식 표현은 그 점에서 당신을 뒷받침할 것이다.
이미 가지고 있는 작업 과정의 증거는 그대로 보관해야 한다. 초안 이력, 버전 파일, 메모, 개요는 모두 출처 신호가 보여줄 수 없는 방식으로 저작성을 입증하며, 통계에 관한 주장보다 훨씬 더 설득력이 있다. 당신의 이름으로 제출해야 하고 표시 때문에 실제 귀속 문제가 생긴다면, 해당 구절을 자신의 표현으로 다시 구성하면 그 문제가 해결된다. 손으로 하든 도구를 사용하든 마찬가지이며, 재구성이야말로 이런 종류의 표시에 영향을 주는 유일한 행위이기 때문에 정확히 그렇게 해결된다.
Anthropic은 세부 사항을 계속 바꿀 것이다. 적용 범위는 여전히 이전 모델로 확장되고 있고, 탐지는 여전히 발전 중이며, 이를 둘러싼 규제 환경은 기술보다 아직 덜 성숙하다. 바뀌지 않을 가능성이 큰 부분은 메커니즘이며, 표시가 숨겨진 문자가 아니라 단어 선택에 있다는 점을 아는 것이 실제로 효과가 있는 단계와 겉으로만 그런 것처럼 느껴지는 단계를 가르는 기준이다. 분류기 관점에서 같은 질문을 보고 싶다면, 워터마크 관점이 아니라 AI 글쓰기를 인간 독자에게 드러내는 어휘가 다시 다른 신호이며, 어떤 키로도 측정할 수 없는 신호이다.
자주 묻는 질문
이것은 Anthropic이 Claude의 텍스트 출력에 삽입하는 통계적 표식으로, 2026년 8월 2일 이후에 출시된 모든 모델에 대해 2026년 8월 11일부터 적용된다. 페이지 안에 무엇인가를 넣는 대신, Anthropic이 보유한 키에 따라 서로 거의 동등한 단어들 사이에서 모델의 선택에 편향을 주어, 충분히 긴 구절이 측정 가능한 패턴을 지니게 한다. Anthropic은 이를 의미, 품질 또는 가독성을 바꾸지 않는, 텍스트에 직접 엮인 지각할 수 없는 워터마크라고 설명한다.
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.