Scaled Content Abuse: Googleが実際に罰するもの
Googleの定義は1文であり、その要点を含む半分を落として要約しているものがほとんどである。このポリシーは、主として順位を操作し、ユーザーの助けにならない目的で生成されたページを説明しており、目的が引き金で、量は副次的な結果である。以下に、その文言、Googleが挙げる5つの手法、そして何かを下書きする前に公開計画を検証する方法を示す。
ローカルサービスのブランドが90の都市ページを公開し、次の四半期を通じて、自分たちが一線を越えたのではないかと気に病む。少し先では、競合他社が同種のテンプレートを用いて4000ページを運用している。両チームとも量を数えている。Googleのポリシーが測定しない唯一のものは、量である。
Googleがスパムポリシーで名指しするscaled content abuseには、一文の定義があり、その中のすべての重要語は意図を説明している。公開ページには次のようにある。「Scaled content abuse is when many pages are generated for the primary purpose of manipulating search rankings and not helping users.」これをゆっくり読むべきである。成立しなければならない条件は2つあり、ページ数だけではそのどちらも満たさない。
この区別によって、ある公開プログラムが事業上の判断なのか、それともスパムのパターンなのかが決まる。しかし、このポリシーの説明の多くは、そこを飛ばして、コンテンツが多すぎるとはどの程度かという議論に直行する。AI生成コンテンツに対するGoogleのより広い立場も同じ文書群にあり、同一の論理で動いている。以下で扱うのは、このスパムポリシーそのものである。すなわち、その文言、Googleがその下に挙げる実践、そして、1語も下書きされる前に計画へ適用できる検証である。
Googleが罰するScaled Content Abuse, その正確な文言
Googleの定義は3つの節に分かれており、3つすべてに意味がある。Many pages are generated, これは量の部分であり、ほとんどの要約が引用する唯一の部分である。For the primary purpose of manipulating search rankings, これはページがそもそもなぜ存在するのかについての主張である。そして not helping users, これは誰かがそのページに到達した後に何をするのかについての主張である。その文を含むページの最終更新日は2026年5月であり、これは2024年の発表のスクリーンショットではなく、現行の文言であることを示している。
Primary は、最も重要な役割を担う語である。ほぼすべての商業ページは、部分的には順位を意識して作られており、このポリシーは発行者にその事実を装わせることを求めてはいない。問うているのは、そのページが主として何のためのものかである。検索エンジンが明日停止してもなお公開する価値があるページには、その基準を十分に満たす主目的がある。午後のうちに削除されるページには、それがない。
Google が挙げる 5 つの実践
Google はこのポリシーの下で 5 つの実践を挙げており、generative AI が登場するのはそのうち 1 つだけである。残りの 4 つは、スクレイピング、つぎはぎ、隠れたサテライトサイト、そして誰にも読めないキーワードページを説明しており、そのいずれにも言語モデルは必要ない。リストの各項目は、ユーザーにとっての価値について同じ修飾句で終わっており、そこから Google が実際に何を測っているのかが分かる。
| Google の言葉による実践 | その項目が検証していること |
|---|---|
| "Using generative AI tools or other similar tools to generate many pages without adding value for users" | どのツールが入力したかではなく、何かが追加されたかどうか |
| "Scraping feeds, search results, or other content to generate many pages (including through automated transformations like synonymizing, translating, or other obfuscation techniques), where little value is provided to users" | 元の素材が新しいものに変えられたのか、それとも単に別名を付け直しただけなのか |
| "Stitching or combining content from different web pages without adding value" | 組み立てが著作と見なされるかどうか |
| "Creating multiple sites with the intent of hiding the scaled nature of the content" | 発行者が、すでに発覚を予期している者のように振る舞っているかどうか |
| "Creating many pages where the content makes little or no sense to a reader but contains search keywords" | 人間の読者が最初から想定された対象だったのかどうか |
5つのうち4つは、生成AIより10年ほど前から存在していた慣行を説明している。スクレイピングされたフィード、同義語化された書き換え、語句で埋め尽くされたドアウェイページ、つなぎ合わせた集約ページは、モデルが実用的な段落を書けるようになるずっと前からスパムであった。しかし今では安価である。以前は、500番目のページの費用は1番目のページとほぼ同じであったため、現在ではGoogleが何らかの形で何年も適用してきた規則がある。これは新しい脅威のように聞こえる。
自分の論文を人間らしくする
重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。
量だけでは引き金にならない理由
Googleはページ数の閾値を公表しておらず、ページ数のいかなる数値も、それ自体ではこのポリシーを発動させない。20万件の商品ページを持つ小売業者、すべての空席に対してライブの掲載情報を載せる求人サイト、化学化合物ごとに1件の項目を持つ参考サイト, これらはいずれも巨大な規模で公開しているが、どれも、ユーザーの助けにならないまま順位を操作するために生成されたページについての文に当てはまらない。規模は、カタログの結果であって、プロジェクトの理由ではない。
逆も同様に成り立つ。40ページであっても、40ページすべてが地名だけを入れ替えた同一ページであり、その場所の読者にとって有用なものが何もなければ、容易にポリシーに違反しうる。大規模であることは、薄いパターンを見つけやすくし、体系的に検出しやすくするため、ポリシーが規模に言及しているのである。規模は問題が現れる設定であり、問題こそがページの目的である。
計画が境界のどちら側にあるかを見分ける方法
各ページに、バッチ内の他のどのページにも含まれない何が入るのかを問い、下書きの前にそれを問うべきである。答えが、スプレッドシートから取り出した名前、数値、郵便番号であるなら、そのバッチは変数を持つ1つのテンプレートであり、Googleの文はそれを正確に記述している。
- 最初の下書きが存在する前に、各ページが持ち、バッチ内の他のどのページにもない入力を特定する。スプレッドシートの列は入力とはみなさない。
- 各ページが、何についても決して順位付けされないとしても、なお依頼されるかどうかを問う。答えがはいであれば、主目的に関する問いにはすでに答えが出ている。
- 任意の1ページに到達した読者が、あなたの上位の結果からは得られなかった何かを見つけられることを確認する。
- ページが1つのサイト上で1つの名称の下に存在していることを確認する。これらをサテライトドメインに分散させることは、Google自身の例示一覧に挙がっている。
Googleの5項目のうち最後の項目は、正しい検索語を含みながら、読者にとってほとんど、あるいはまったく意味をなさない内容のページを扱っており、検証対象として最も安価な失敗である。バッチの中央から3ページを取り出し、顧客として読むつもりで音読する。さらに1ページを無料の可読性チェッカーにかけると、それらの文が人間のために作られたものだったのかについて、率直な第二の見解が得られる。
バッチが内容の上では真に独立しており、文体だけが一般的である場合、修正は構造的ではなく編集的である。AI humanizerは、ページ群全体にわたる読み方を変え、AIテキストを人間らしくするための手順付きガイドは、同じ作業を手作業で行う方法を扱っている。どちらも入力の問題は解決しない。それは、各ページが何のためにあるのかを誰かが決める段階で、執筆の上流において修正しなければならない。
Scaled Content AbuseはSite Reputation Abuseと同じか
いいえ、そしてこの2つは2024年3月にGoogleが同時に発表したため、絶えず混同されている。Scaled Content Abuseは、サイト自身が大量生産した低価値ページを指す。Site Reputation Abuseは、主として、そのホストが自らの一次的な作業によってすでに獲得していた順位付けシグナルのためにホストサイト上で公開される第三者コンテンツを指すGoogleの用語であり、ニュースサイトに後付けされたクーポン欄が誰もが認識する典型である。一方のポリシーは、サイトが自らの公開能力を悪用していることを述べる。もう一方は、まったく別の目的のために築いた権威をサイトが貸し出していることを述べる。
Google が代わりに求めているものは、E-E-A-T, これには専用ページがありますの下に示されています。制作面については、SEO のために AI のブログ記事を人間らしくすることは別に扱われています。
次のコンテンツブリーフの冒頭に Google の文を置き、誰かが下書きを始める前に、バッチ全体について書面でそれに答えてください。各ページが何を付け加えるのかを言えないチームは、たいてい計画段階でそれを知ることになりますが、それはそれを知るための最も安い時点です。
よくある質問
Googleはこれを、検索順位を操作し、ユーザーの助けにならない主目的で生成された多数のページと定義している。この文の両方の半分が成り立たなければならない。Googleが説明するscaled content abuseは、ページがなぜ存在し、読者に対して何をするのかについての記述であり、このポリシーは、それ自体で該当を決めるページ数を示していない。
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.