Scaled Content Abuse: Google가 실제로 처벌하는 것
Google의 정의는 한 문장으로 되어 있으며, 그것에 대한 거의 모든 요약은 중요한 절반을 빠뜨립니다. 이 정책은 순위를 조작하고 사용자를 돕지 않는 주된 목적으로 생성된 페이지를 설명하며, 이는 목적을 유발 요인으로, 양을 부수적 결과로 만듭니다. 여기에는 그 문구, Google이 제시한 다섯 가지 관행, 그리고 초안이 작성되기 전에 게시 계획을 점검하는 방법이 있습니다.
지역 서비스 브랜드가 도시 페이지 아흔 개를 발행하고, 다음 분기 내내 선을 넘은 것은 아닌지 걱정한다. 조금 떨어진 곳에서는 경쟁사가 같은 종류의 템플릿으로 사천 개의 페이지를 운영하고 있다. 두 팀 모두 양을 세고 있다. 그러나 Google의 정책이 측정하지 않는 것은 양이다.
Google이 스팸 정책에서 명명한 대규모 콘텐츠 남용에는 한 문장짜리 정의가 있으며, 그 안의 모든 핵심어는 의도를 설명한다. 현재 페이지에는 다음과 같이 적혀 있다. "Scaled content abuse is when many pages are generated for the primary purpose of manipulating search rankings and not helping users." 천천히 읽어 보라. 두 조건이 함께 성립해야 하며, 페이지 수만으로는 어느 조건도 충족하지 못한다.
그 구분이 출판 프로그램이 비즈니스 결정인지 스팸 패턴인지 가르며, 이 정책에 대한 대부분의 설명은 곧바로 얼마나 많은 콘텐츠가 지나친지에 대한 논의로 넘어간다. AI 생성 콘텐츠에 대한 Google의 더 넓은 입장도 같은 문서 체계 안에 있으며 동일한 논리로 작동한다. 여기서 이어지는 것은 바로 그 스팸 정책 자체로, 그 문구와 Google이 그 아래에 열거한 관행들, 그리고 초안이 작성되기 전에 계획에 적용할 수 있는 하나의 검토 기준이다.
Google이 처벌하는 대규모 콘텐츠 남용, 정확한 문구
Google의 정의는 세 개의 절로 나뉘며, 세 절 모두 기능을 한다. 많은 페이지가 생성된다는 점은 양에 관한 부분이며, 대부분의 요약이 인용하는 유일한 부분이기도 하다. 검색 순위를 조작하는 것이 주된 목적이라는 점은, 페이지가 애초에 왜 존재하는지에 대한 주장이다. 그리고 사용자에게 도움이 되지 않는다는 점은, 누군가 그 페이지에 도달한 뒤 그것이 무엇을 하는지에 대한 주장이다. 그 문장이 실린 페이지는 2026년 5월에 마지막으로 업데이트되었으므로, 이는 2024년 발표의 스크린샷이 아니라 현재의 문구이다.
Primary는 대부분의 일을 하는 단어입니다. 거의 모든 상업용 페이지는 부분적으로 순위를 염두에 두고 만들어지며, 이 정책은 발행자에게 그렇지 않은 척하라고 요구하지 않습니다. 이 정책은 그 페이지가 주로 무엇을 위한 것인지 묻습니다. 검색 엔진이 내일 갑자기 작동을 멈추더라도 여전히 게시할 가치가 있는 페이지라면, 그 페이지의 primary purpose는 이 기준을 무난히 통과합니다. 같은 날 오후에 삭제될 페이지라면 그렇지 않습니다.
Google이 제시한 다섯 가지 관행
Google은 이 정책 아래 다섯 가지 관행을 제시하며, 생성형 AI는 그중 정확히 하나에만 등장합니다. 나머지 네 가지는 스크래핑, 짜깁기, 숨겨진 위성 사이트, 그리고 아무도 읽을 수 없는 키워드 페이지를 설명하며, 이들 가운데 언어 모델이 필요한 것은 하나도 없습니다. 목록의 각 항목은 사용자에게 주는 가치에 관한 같은 한정어로 끝나는데, 바로 그 부분이 Google이 실제로 무엇을 측정하는지 알려줍니다.
| Google의 표현에 따른 관행 | 그 항목이 점검하는 것 |
|---|---|
| "Using generative AI tools or other similar tools to generate many pages without adding value for users" | 어떤 도구가 입력했는지가 아니라, 실제로 무엇이 추가되었는지 여부 |
| "Scraping feeds, search results, or other content to generate many pages (including through automated transformations like synonymizing, translating, or other obfuscation techniques), where little value is provided to users" | 원천 자료가 새로운 것으로 바뀌었는지, 아니면 단지 다시 이름만 붙였는지 여부 |
| "Stitching or combining content from different web pages without adding value" | 조합이 저작에 해당하는지 여부 |
| "Creating multiple sites with the intent of hiding the scaled nature of the content" | 발행자가 이미 적발될 것을 예상하는 사람처럼 행동하고 있는지 여부 |
| "Creating many pages where the content makes little or no sense to a reader but contains search keywords" | 인간 독자가 애초에 의도된 대상이었는지 여부 |
다섯 가지 중 네 가지는 생성형 AI보다 10년 앞선 관행을 설명한다. 스크랩된 피드, 동의어로 바꾼 재작성, 용어를 채워 넣은 도어웨이 페이지, 그리고 이어 붙인 집합물은, 모델이 쓸 만한 문단을 작성할 수 있기 훨씬 전부터 스팸이었다. 그러나 이제는 그것이 저렴하다. 예전에는 500번째 페이지가 첫 번째 페이지와 거의 같은 비용이 들었기 때문에, 지금 우리는 Google이 어떤 형태로든 수년간 집행해 온 규칙을 갖고 있다. 이것은 새로운 위협처럼 들린다.
자신의 논문을 인간적으로 다듬기
중요한 단어나 인용은 건드리지 않고, AI 보조로 작성한 텍스트를 자연스럽고 사람처럼 들리게 바꾸세요.
왜 양만으로는 발동 요인이 되지 않는가
Google은 페이지 수 기준을 공개하지 않으며, 페이지 수 자체가 정책을 발동시키는 일도 없다. 20만 개의 제품 페이지를 가진 소매업체, 모든 공석에 대해 실시간 목록을 제공하는 구인 게시판, 화학 화합물마다 항목이 있는 참고 사이트, 이들 모두는 엄청난 규모로 게시하지만, 그 어느 것도 순위를 조작하려는 목적으로 생성되었으면서 사용자에게 도움이 되지 않는 페이지라는 문장에 해당하지 않는다. 규모는 프로젝트의 이유가 아니라 목록화의 결과이다.
반대의 경우도 마찬가지로 분명하다. 40개의 페이지라도, 그 40개가 모두 지명만 바뀐 하나의 페이지이고 그 장소의 독자가 유용하다고 여길 만한 내용이 어느 하나에도 없다면, 정책을 어렵지 않게 위반할 수 있다. 대량은 얇은 패턴을 더 쉽게 드러내고 체계적으로 탐지하기도 더 쉽게 만들기 때문에, 정책이 규모를 언급하는 것이다. 규모는 문제가 드러나는 설정이고, 문제는 페이지가 무엇을 위해 존재하는가이다.
계획이 어느 쪽에 놓이는지 판단하는 방법
각 페이지가 그 묶음의 다른 어떤 페이지에도 없는 무엇을 담게 될지 묻고, 초안을 작성하기 전에 먼저 그 질문을 하라. 답이 스프레드시트에서 가져온 이름, 번호, 우편번호라면, 그 묶음은 변수만 바뀌는 하나의 템플릿이며 Google의 문장은 그것을 정확하게 설명한다.
- 첫 번째 초안이 존재하기 전에, 각 페이지가 가진 입력 중 배치의 다른 어떤 페이지도 가지지 않는 입력을 명명하라. 스프레드시트 열은 입력으로 간주되지 않는다.
- 각 페이지가 아무것도 순위에 오를 수 없다 하더라도 여전히 제작 의뢰되었을지 물어보라. 그렇다고 답하면 주요 목적에 대한 질문은 이미 답해진 것이다.
- 어떤 단일 페이지에 도착한 독자가, 당신보다 위에 있는 결과에서 얻을 수 없었던 무언가를 발견하는지 확인하라.
- 페이지들이 하나의 이름 아래 하나의 사이트에 존재하는지 확인하라. 이를 위성 도메인들에 분산시키는 것은 Google 자체 예시 목록에 나타난다.
Google의 다섯 항목 중 마지막 항목은, 올바른 검색어를 담고 있으면서도 독자에게 거의 또는 전혀 의미가 통하지 않는 콘텐츠를 가진 페이지를 다루며, 시험해 보기 가장 비용이 적게 드는 실패 사례이다. 배치의 중간에서 세 페이지를 뽑아 고객처럼 소리 내어 읽어 보라. 그중 하나를 무료 가독성 검사기에 넣으면, 그 문장들이 과연 사람을 위해 만들어진 것인지에 대한 직설적인 두 번째 의견을 얻을 수 있다.
배치가 내용상으로는 진정으로 구별되지만 어조만 일반적이라면, 해결책은 구조적이라기보다 편집적이다. AI humanizer는 한 묶음의 페이지가 배치 전체에서 읽히는 방식을 바꾸며, AI 텍스트를 인간화하는 단계별 가이드는 손으로 수행한 같은 작업을 다룬다. 어느 쪽도 입력 문제를 해결하지는 못한다. 그것은 글쓰기의 상류, 즉 누군가가 각 페이지의 목적을 결정하는 지점에서 고쳐야 한다.
Scaled Content Abuse는 Site Reputation Abuse와 같은가?
아니오, 그리고 이 둘은 2024년 3월 Google이 두 정책을 함께 발표했기 때문에 끊임없이 혼동된다. Scaled content abuse는 사이트 자체의 대량 생산된 저가치 페이지를 포괄한다. Site reputation abuse는 주로 호스트 사이트가 첫 번째 당사자 작업으로 이미 획득한 순위 신호 때문에 호스트 사이트에 게시된 제3자 콘텐츠를 가리키는 Google의 용어이며, 뉴스 사이트에 덧붙인 쿠폰 섹션이 모두가 알아보는 전형이다. 하나의 정책은 사이트가 자기 자신의 게시 역량을 남용하는 경우를 설명한다. 다른 하나는 사이트가 전혀 다른 목적을 위해 구축한 권위를 임대해 주는 경우를 설명한다.
Google가 대신 원한다고 밝힌 내용은 E-E-A-T, which has its own page 아래에 정리되어 있다. 제작 측면에서는 humanizing an AI blog post for SEO가 별도로 다루어진다.
다음 콘텐츠 브리프의 맨 위에 Google의 문장을 두고, 누구도 초안을 작성하기 전에 배치 전체에 대해 서면으로 그 질문에 답하라. 각 페이지가 무엇을 더하는지 말할 수 없는 팀은 대개 기획 단계에서 그것을 알게 되는데, 이는 그것을 알게 되는 가장 비용이 적게 드는 시점이다.
자주 묻는 질문
Google은 이를 검색 순위를 조작하고 사용자를 돕지 않는 주된 목적으로 생성된 많은 페이지로 정의합니다. 그 문장의 두 절반은 모두 성립해야 합니다. Google이 설명하는 scaled content abuse는 페이지가 왜 존재하는지, 그리고 그것이 독자에게 무엇을 하는지에 대한 진술이며, 정책은 그것만으로 이를 유발하는 페이지 수를 따로 제시하지 않습니다.
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.