AI Detection

AI検出器はどのように機能するのか, Perplexity, Burstiness, およびトークン確率

AI検出器は、読者のように機械による文章を認識するわけではない。まず、あなたの文章がどれほど予測可能かを測定し、それをスコアに変換する。この点が理解できれば、技術そのものとその失敗の両方が、よりよく理解できる。

最終更新日 12 min
Diagram showing how AI detectors work by scoring token predictability across a sentence

あなたの大学では、提出物をAI detectorに通す運用が始まり、予想していなかった数値が示された報告書が返ってきました。それに異議を唱えようとする前に、その数値が何を意味するのかを知っておくと役立ちます。AI detectorはどのように機能するのでしょうか。人がするようには機械生成の文章を読みません。言語モデルにとってあなたの文章がどれほど予測しやすいかを測定し、その予測しやすさをスコアに変換します。その過程のどこにも、あなたが何を意味しているのか、議論の内容は何か、あるいは実際にそれを書いたのがあなたかどうかは見ていません。

私は何年にもわたって、テキストを統計的に分解するツールを作ってきましたが、検出について理解するうえで最も有用なのは、これが出自ではなく典型性の測定であるという点です。これが腑に落ちると、その技術も、その失敗も、ずっと理解しやすくなります。

detectorが実際に測定しているもの

detectorは、誰が何を書いたのかを知りません。そこにあるのは言語モデルとスコアリング関数だけです。モデルはあなたの文章を左から右へ読み、各時点で次に来るべき単語についての確率分布を生成します。たとえば "the results of the" という語を与えると、"study" を最も高く、"experiment" を少し低く、"marmalade" をほぼゼロに近い位置に並べます。

したがって、detectorはあなたの文書に対して一つの問いを投げかけます。このテキストは、モデルが予想した単語をどれほど頻繁に選んだのか、という問いです。高確率の単語に次々と落ち着く書き方は、機械が作ったように見えます。なぜなら、それこそがテキスト生成器のすることだからです。モデルは、自身の分布の上位から、何千もの token にわたって何度も何度もサンプリングします。

このため、この種の技術全体は、宣伝文句が示すよりもはるかに不安定な基盤の上にあります。detectorは透かしや指紋を見つけているのではありません。あなたの文章が統計的に意外ではないことに気づいているだけであり、意外でない文章には chatbot 以外にも多くの原因があります。

Perplexity, モデルがどれだけ驚くか

主要な指標は perplexity と呼ばれ、見た目ほど難しくはありません。実際に現れた各単語に対してモデルが割り当てた確率を取り、その確率の対数を平均し、結果を指数化します。そうして得られるのは、モデルがあなたの文書にどれほど驚いたかを示す単一の数値です。推測するよりも、自分の下書きの perplexity を確認することができます。

perplexity が低いということは、テキストがモデルの予想した方向に進んだということです。perplexity が高いということは、モデルが予想しなかった方向へ何度も曲がったということです。人間の文章は一般に高めに位置します。人は珍しい具体的な名詞や、普通でない構文、予想外の場所から始まる文を選びがちだからです。生成されたテキストは一般に低めに位置します。なぜなら、デコード過程はまさにそうした動きを避けるように設計されているからです。

方法の節の冒頭を二通り比べてみてください。"The results of the study were statistically significant" は、ほとんどあらゆるモデルが高い確信をもって予測するであろう連続です。そこには予想外の情報が含まれていないからです。"Two of the three cohorts drifted before week six, which we had not planned for" ははるかに予測しにくいです。なぜなら、論文の他の部分からは推測できない、具体的で扱いにくい情報を含んでいるからです。後者は検出器に実際の驚きを与え、その驚きこそが人間らしさとして記録されます。

Burstiness, 平均ではなく分散

perplexity だけでは十分ではありません。文書は平均すると完全に妥当な数値になっていても、その内部が疑わしいほど均一であることがあるからです。重要なのはテキスト全体にわたる変動であり、burstiness はそれを測ります。つまり、文章が進むにつれて文の長さと文レベルの perplexity がどれほど揺れ動くかです。burstiness checker を使えば、その広がりを直接確認できます。

私たちは自信があるときには速くなり、ためらっているときには遅くなります。そのリズムは散文にも残ります。人は断続的に書きます。ある段落は八語の短い平叙文で始まり、三つの節と挿入句を含む三十四語の文へ進み、その後また簡潔な表現に戻るかもしれません。

モデルの出力は、これを確実には行わない。文は平均的な長さの近くに集まる。段落は整った束として現れる。各セクションは、自身の見出しを言い換えることから始まる。これは滑らかに読めるが、評価は低い。なぜなら、文全体での分散が小さいことは、検出器が持つ最も強いシグナルの一つだからである。見破られるのは、特定の一文ではない。均一性である。

シグナル測定するもの機械生成テキストの評価が低い理由
Perplexity文書全体で平均したときに、モデルが語の選択にどれほど驚くか高確率トークンからのデコードを設計上行うため
Burstinessテキスト全体で文の長さと予測可能性がどれほど変動するか出力が揺れず、平均の近くに集まるため
Token probability他の二つが算出される、語ごとの生起確率個々には目立たない選択が長く続くため

Token probability とスコアの算出元

これら二つの数値は、第三の数値、すなわちトークンごとの対数尤度から構成される。これは、他のすべてが計算される元データである。一部のツールはこれを直接表示し、テキストが最も予測しやすかった箇所を強調する。そうした強調表示は、インターフェースが何を示唆していようとも、特定の文に対する非難ではない。それらは、文書全体の数値に最も大きく寄与した部分である。

研究上の手法は、単純な閾値を超えて進展している。DetectGPT とその後継は曲率に着目する。すなわち、テキストをわずかに摂動させ、生成テキストが示しがちなパターンで尤度が低下するかどうかを確認する。他の手法は、同じ一節を二つの異なるモデルで比較し、その不一致をシグナルとして用いる。

1つの帰結は、評価を受けるすべての人にとって重要である。指標は特定の参照モデルに対して計算されるため、スコアは常にそのモデルに対する相対値である。2つの検出器が同じ段落を読み、完全に異なる判断を下しても、どちらも故障しているわけではない。両者は、異なる参照点を用いて同じ問いに答えているのである。

第2の帰結は、あまりしばしば指摘されない。モデルがある箇所を予測可能だと見いだせるのは、その箇所が学習対象に似ている場合に限られるため、参照モデルとテキストを生成したものとの隔たりが広がるにつれて、検出の質は低下する。より新しい生成器、特殊な分野、そして英語以外の言語は、いずれもその隔たりを広げる。それが、管理されたベンチマークで測定された正確性が、実際の提出物の山に直面するとほとんど持ちこたえない理由の一部である。

自分の論文を人間らしくする

重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。

無料で始める

なぜ AI テキストはそもそも検出されるのか

言語モデルが次の語をどのように選ぶか

言語モデルをそのままにしておけば、可能な次の語の順位付き一覧をすべて示し、選択は別の何かに委ねるだけである。実際には、デコード戦略が語ごとにその選択を自動的に行い、どの戦略が動作しているかによって、基礎となるモデルが変わらなくても出力の見え方は変化する。

greedy decoding は、最も確率の高い単一の語を常に選択する。nucleus sampling を修正策として導入した論文で、Ari Holtzman と共著者は、この戦略に従うと、彼ら自身の言葉では, 'bland and strangely repetitive.' なテキストになると指摘した。複数の有力な継続候補を同時に追跡してから1つに確定する beam search も、同種の問題の同様の形に陥る。

サンプリング戦略は、ある程度のランダム性を再導入するが、それは制御された形である。temperature は、語が選ばれる前に、モデルが自らの上位候補をどれほど強く優先するかを調整する。nucleus sampling は、top-p と呼ばれることもあり、分布を、合計確率がしきい値を超える最小の語集合に切り詰め、その集合からのみ抽出する。原論文では、信頼できない末尾ではなく、分布の動的な nucleus からサンプリングするものと説明されている。

これらの設定のうち最も決定論的でないものでも、モデルがすでに高い確率でありそうだと考えているものを中心に構成された候補群から引き出している。人間の文章は、語彙を順位付けしてその上位から選ぶことで生成されたことは一度もないため、常にその候補群を超えていく。意味は、ときに、そもそも一覧に載っていなかった語の中に宿る。

語彙の平坦性, より少なく, より安全な語

語彙の平坦性は、同じ習性の語レベル版である。文の各時点では、数十の語がそれを続ける候補になりうるが、モデルの順位付けではその中の少数が他を大きく上回り、デコードはその少数に繰り返し落ち着く。文書全体でこの選択を各文にわたって積み重ねると、実際に使われる語の範囲は、同程度の長さの人間の文章と比べて測定可能なほど狭くなる。

この効果は一定にとどまるのではなく、累積する。第1文で最上位の語を選ぶモデルは、第2文でも最上位の語がやはり一般的であるような文脈を作りやすい。なぜなら、一般的な語は一般的な語に続きやすいからである。人間の書き手はその流れを絶えず中断し、特定の専門用語、やや珍しい動詞、実際の事物を安全な近似ではなく名指す語を選ぶ。この差は、生成版における作業語彙が測定可能なほど小さいこととして現れる。両者が同じ基礎的事実を述べている場合であっても、そうである。

これは個々の語の選択ではなく、文章全体の性質である。1つの安全な語だけでは何も証明しない。文ごとに、同じ水準の一般語彙へと手を伸ばす語が何ページにもわたって続くとき、検出器の語レベルの信号が実際に捉えようとしているものがそこにある。

統語的一様性, 同じ形が反復される

統語的一様性は、文レベル版である。問題は文の長さではない。ある文章がどれだけ異なる文法的形を使っているか、すなわち、文がどのように始まり、節が互いにどう結びつき、接続語がどれほど頻繁に一つの考えを次の考えへつなぐ役割を担うか、という点である。統計的にもっとも起こりやすい次の構造を予測し続けるモデルは、少数の形の回転に落ち着き、それを反復する。

段落は文の長さを変化させても、各文が同じ主語, 動詞, 補語の形に従い、同じ種類の移行表現で始まり、あるいは同じように結論に至るなら、統語的には平板なまま読まれうる。予測可能性は語数ではなくパターンに宿る。この区別は、burstiness が実際に何を測定するのかを扱うガイドで、より詳しく説明している。

何が狭めるかデコード最適化されたテキストがしがちなこと人間の文章がしがちなこと
語の選択各段階で最も確率の高い一般的な語に落ち着く実際の対象を指す、より具体的な語やあまり一般的でない語を選ぶ
文の冒頭安全な移行表現の少数の組み合わせを繰り返す文の始め方を変化させる, モデルならより起こりにくいと評価するような冒頭も含める
節構造一つか二つの好ましい文法的形を文章全体で繰り返す文に必要なものに応じて, 単純な構造と複雑な構造を混ぜる

人間だけがしがちな選択

狭い範囲の反対側にあるのは, その範囲の外に落ちるものだ。実際の出来事を描写する人は, 丸めた数ではなく正確な数値を選び, うまくいかなかった部分を認め, 思考の途中で文を中断して言い直し, 典型的だからではなく正しいからという理由で語を選ぶ。これらの選択はどれも, 言語モデルの観点からは低確率のトークンであり, まさに decoding が避けるように設計されている種類のものである。

これらは, 具体的または珍しい文章があらゆるフラグから安全だという意味でも, 流暢で正確な文章が既定で疑わしいという意味でもない。方法の節, 法的条項, あるいは大幅に編集された最終稿は, モデルとは無関係な理由で狭い範囲に入ることがある。だからこそ, 単一のスコアは, それを書いた人についての判定ではなく, パターンの記述なのである。

自分の下書きがその帯のどこに位置するかを知ることは、推測するよりも有用である。TextPulseの無料のperplexity checkerburstiness checkerは、語レベルの予測可能性と文から文へのリズムを別々に測定するため、平坦な語彙と反復された文の形は、1つに混ざった数値ではなく、2つの異なる信号として現れる。

ここから、より狭い2つのページが続く。TurnitinがAIを具体的にどのように検出するかが1つであり、その類似度スコアとAIスコアの違いがもう1つである。というのも、この2つはしばしば互いに取り違えられるからである。

どちらも、より広い無料ツール集の中にあり、単一の数値を無批判に信じるのではなく、自分でそのパターンを確かめたい人向けである。

ウェブのどれだけが現在AI生成なのか?

いくつかの指標によれば、機械生成テキストは現在、オンライン上で人間が書いたテキストを上回っている。Amazon Web Servicesのチームは、ウェブから6.4億文を分析し、そのうち57.1%が3言語以上にわたる機械翻訳として存在していたことを見いだしたが、その多くは低品質であった。SEO企業Graphiteによる2025年の分析では、新たに公開されたウェブ記事の半数をわずかに上回る割合がAI生成であった。Wikipediaも例外ではない。2024年8月に作成されたページを対象としたPrincetonの研究では、新しい英語記事のおよそ20本に1本が実質的にAI生成であると測定された。

その割合は上昇している。なぜなら、モデル出力のコストは人間の執筆よりも桁違いに低く、あらゆる商業的インセンティブが同じ方向を向いているからである。すでに、人間のライターをまったく使わずに運営されるプラットフォーム全体もある。ChirperはAIアカウントだけで構成されたソーシャルネットワークであり、人間は閲覧することしかできない。SocialAIは、あなたへのすべての返信がbotであるフィードを販売している。フォーラム、レビュー欄、コメントスレッドも、より小規模ながら同じパターンを示している。

検出において、これはベースレートを変化させる。2023年に任意のウェブテキストを読む分類器は、その大半が人間によるものだと仮定できたが、2026年の分類器はそうではない。また、これはモデル自体にもフィードバックする。というのも、新しい世代はそれ以前の世代がすでに書き込んだウェブ上で学習するからであり、検出器が注目する語彙上の習慣が拡散し、薄れない理由の一つはそこにある。

自分の文章にとって、その帰結は明白である。人間が書いた散文は少数派のクラスになりつつあり、採点者、編集者、読者はそれを知っている。疑念の高まりが今や標準であり、まさにそのため、検出器が何を測定でき、何を測定できないのかを理解することに価値がある。

商用検出器が上乗せするもの

実際に機関が購入するツールは、教科書的な perplexity を実行しない。Turnitin、GPTZero、Originality、その他のツールは、大規模にラベル付けされた人間文と機械文の集合で教師あり分類器を訓練し、文体的特徴と並んで統計的特徴を用いる。分類器が学習するのは、訓練データにおいてその二つの山を分けるものなら何でもであり、それは一般的な「AI writing」よりも狭く、より歴史依存的なものである。

訓練への依存は、静かな問題である。主として一世代のモデル出力で訓練された分類器は、より新しいモデル、見慣れない分野、そしてその英語が訓練分布に似ていない書き手へ一般化しなければならない。ベンダーは自社評価から精度の数値を公表するが、独立したベンチマークでは、同じツールに対してその数値をしばしば大きく下回る結果が出る。

過剰に読み取らずにスコアを読む

検出器の報告は通常、百分率として示され、その百分率はしばしば誤読される。それは、文書のうち機械が書いた割合ではない。ツールによって、それは分類器の確信度であったり、ある内部閾値を超えた文の割合であったりし、ベンダーはどれを指すのかについて曖昧であることが多い。どちらも60%を示す二つの報告が、かなり異なる意味を持つことがある。

また、誰が書いたかとは無関係な理由でスコアを動かす要因を知っておくことも重要である。短い文書はばらつきが大きい。平均値が安定するためのテキスト量が少ないためであり、500語のエッセイは、2つか3つの珍しい文の影響だけで大きく変動しうる。引用された素材も、ツールがそれを除外しない限りは計算に含まれる。そのため、ブロック引用を多く含む文献レビューは、引用先の文章が持つ予測可能性を引き継ぐ。標準的な用語が多い技術的な文章も同様に振る舞う。

もしフラグを受け取った場合、有用な対応は、指標そのものについて議論することではなく、証拠を示すことである。版の履歴、下書き、メモ、検索記録はいずれも作成過程を示し、そして作成過程こそが不正行為審査委員会が実際に評価できるものである。注意深い書き手とモデルを分ける境界として、誰も指摘できる閾値は存在しない。

なぜ検出器は、どのモデルも生成していない文章にフラグを立てるのか

偽陽性は、まれな不具合ではない。それは典型性を測定することから直接生じる。真に予測可能な文章は、誰が生成したものであっても、予測可能としてスコア付けされる。

非ネイティブの英語話者が最も強く影響を受ける。スタンフォードの研究者は、検出器が非ネイティブ話者のエッセイの大きな割合を機械生成と誤分類した一方で、ネイティブ話者のエッセイは正しく分類したことを明らかにした。その理由は悪意ではなく機械的である。第二言語で書く書き手は、使い古された構文や、より一般的な語彙に頼る傾向があるからである。それはまさに低い perplexity の特徴であり、そのためESL writers get flagged for writing carefully

学術的な慣習も同じ問題を引き起こす。方法の節は定型的であることが求められる。法律文書、技術文書、臨床報告はいずれも、独創的な表現より標準的な言い回しを評価する。大幅な編集はさらにそれを強める。というのも、下書きを磨き上げることは通常、統計的な特徴を担っていた不規則性を取り除くことを意味するからである。

機関もこれに気づいている。Vanderbiltは、検証できないスコアに基づいて判断するのではなく、TurnitinのAI検出機能を無効化した。また、他の大学では、数値を不正行為手続きでどのように用いてよいかを制限している。検出器のスコアは、結論ではなく、弱い証拠の一つとして扱うべきである。

これが自分の文章にとって意味すること

仕組みから導かれる実践的な助言は、特異なものではなく、そのどれもが何かを不正に操作することを含まない。文の長さは意図的に変えるべきである。均一性こそが検出されるからである。具体的な詳細は保つべきである。実際の数値、実際の制約、第6週に何がうまくいかなかったのか、である。一般的な有能さは機械生成と判定されやすく、具体性はよりよい文章であると同時に、より強いシグナルでもある。

自分自身の言い回しも保つべきである。ものごとを表現する自分なりのやり方があるなら、それを残すべきである。下書きを、分野の他の論文と同じように聞こえるまで削り落とそうとする衝動は、perplexityを下げる衝動である。

避けるべきことが一つある。一部のツールは、perplexityを上げるために意図的に文法上の誤りを導入する。これは指標上は機能するが、採点対象や査読対象のものにとっては非常に悪い考えである。なぜなら、疑念を確実なものと引き換えているからである。目標は、自分の文章として読まれる文章であり、意図的に損なわれた文章ではない。これが、人間の読者向けに書き換えることと、採点器を欺くために文章を壊すこととの、全体的な違いである。

黒箱をそのまま信じるのではなく、自分の下書きについてこれらの数値を見たいなら、基礎となる測定値は秘密ではない。無料のテキスト分析ツールを使えば、自分の文章がどの位置にあるかを示せるし、平坦な部分が修正に値する文体上の問題かどうかを、自分で判断できる。

XLinkedInFacebook

よくある質問

はい、そしてそれは予測可能である。検出器は、誰が書いたかではなく、文章が統計的にどれほど予測可能かを測定する。そのため、真に定型的な文章は機械生成と判定される。独立したベンチマークは一貫してベンダーの主張より低い精度を報告しており、いくつかの大学は、そのスコアの使用方法を制限している。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI人間化の最新情報を受け取る

学術ライティング、AI検出、そして人間化に関するヒントを、受信箱へお届けします。

スパムはありません。いつでも配信停止できます。