AI Detection

AI Detectorの偽陽性: なぜ人間の文章が検出されるのか

各ベンダーは、偽陽性率が1パーセント前後であると公表しています。しかし、同じツールを異なる文章に対して独立に検証すると、しばしば別の結果が得られます。ここでは、実際に何が誤検出を引き起こすのか、そしてその数値が一度存在した後に何を意味し、何を意味しないのかを示します。

7 min
AI detector false positive: table comparing writing traits, from short documents to heavy editing, that trigger false flags in human text

1982年、New England Journal of Medicineは、骨髄移植患者におけるサイトメガロウイルスに関する論文を掲載した。この論文は査読を通過し、40年間アーカイブに収められていた。2023年、研究者たちは、OpenAIが公開したAI文章検出器にこの論文を通したところ、そのツールはこれを99.96 percentの確率でAI生成と判定した。しかも、その論文が書かれたとされるモデルが存在する37年前のことであった。これは、AI detector false positiveの最も純粋な形である。すなわち、機械によって書かれたと判定された文書が、そもそも機械によって書かれるはずがないということである。

この例が極端なのは、その時期だけである。根底にあるパターン, すなわち、誰がいつ書いたかにかかわらず、定型的で予測可能な散文を機械生成とみなす検出器の判断は、通常の提出物, たとえばエッセイ、カバーレター、実験報告書、志望理由書などにおいて絶えず現れる。本稿では、false positiveを引き起こす要因、どの種類の文章が最も影響を受けやすいか、そして、1つのフラグ付きスコアが見かけほどの証拠ではない理由を扱う。

AI Detector False Positiveとは何か?

AI detector false positiveとは、検出ツールがAI生成と評価する人間が書いた文章のことである。書き手の作業過程、誠実さ、技能のいずれも測定されていない。ツールは、文の統計的な形, すなわち語の選択と構造がどれほど予測可能かを、機械出力に結び付けて学習した形と比較する。

各社はfalse positive率を単一の小さな百分率として報告しており、通常は1 percentか2 percent未満である。その数値は、各社が作成したベンチマークに対する管理された試験を示すものであり、個々の文書についての保証ではない。AI detectors are accurateかどうかというより広い問題はすでに独立に検証されており、その結果はまったく別のところに位置し、場合によっては各社の数値よりはるかに高い。本稿はより狭く、どの種類の文章がそのリスクを高めるのか、そしてフラグ付きスコアが何を示し、何を示さないのかに絞る。

どのような文章の特徴が人間の文章を機械生成のように見せるのか

通常の文章のうち、最もリスクが高いのは4種類あり、そのいずれにも、人が何か不正をしていることは関係ない。短い文書、強く定型化された文章、引用された素材やテンプレート化された素材、そして入念に校正された文章は、自由に構成された散文よりも予測可能であると判定されやすい。これは、あらゆる検出器が実際に測定している唯一の性質である。free burstiness checkerは、その同じ変動を直接測定するため、そのパターンを把握するには、説明文を読むよりも速い方法である。

いくつかのジャンルは、設計上、定型的である。方法の節、実験報告書、標準的なカバーレター、そして文献レビューはいずれも、独創的な表現よりも慣用的な表現を評価する。なぜなら、文書を読者にとって使えるものにするのは、その慣用性だからである。研究者は、これを実際の文章で直接検証した。彼らは、1980年から2023年の間に公表された14,400本の学術要旨を、公開されている検出器に通した。これは、いかなる大規模言語モデルも存在しない時代のものである。最大で8パーセントが、出版年にかかわらずAI生成としてフラグ付けされ、New England Journal of Medicineの要旨は10.24パーセントでフラグ付けされ、検証した5誌の中で最も高い偽陽性率であった。

その検査がChatGPTに関する何かを検出していたはずはない。なぜなら、ChatGPTはその検査が対象とした年の大半には存在しなかったからである。検出していたのはジャンルである。より形式的に言えば、2026年の検出問題に関する統計分析が示すように、ソフトウェアによって書かれたために予測可能な文と、そのジャンルではそうした種類の文を書くから予測可能な文とを区別する検出器を構築する方法はない。外から見ると、両者はまったく同じに見える。

大幅な編集も、同様の方向に作用する。初稿には、書き手固有の不規則性が現れる。たとえば、奇妙な語順や、考えが長く続いたために文も長くなったものがそれである。徹底した校正、特に別のツールを通した校正は、まさにそうした不規則性をならす傾向がある。これまでで最大規模の検出ツールの独立比較では、14種類のツールを検証し、サンプル文が言い換えられたり機械翻訳されたりすると、すべてのツールで精度がさらに低下することが示された。

執筆上の特徴文書の見かけ上の予測不能性を下げる理由証拠が示すこと
短い提出物文章量が少ないほど、人間のリズムと機械のリズムを分ける自然な変動が入り込む余地が少なくなる短い文書のスコアは、少数の異例な文の影響でより大きく変動する
定型的な、または分野特有の文章ジャンルの慣習は、独創的な表現よりも予想される定型句を優先するChatGPT以前の14,400件の学術要旨, 1980年から2023年までのもの, でも最大8%の偽陽性が出た。ある学術誌の要旨では10.24%に達した
大幅に編集された、または言い換えられた草稿仕上げの工程は、検出器が人間的だと読む個々の不規則性をならしてしまう独立した14ツールの比較では、言い換えまたは機械翻訳の後に精度がさらに低下した
引用された、またはテンプレート化された素材引用部分は、引用した書き手のものではなく、元の出典の統計的特徴を帯びている引用を除外しない検出器は、借用された文章に基づいて周囲の文書を採点する

自分の論文を人間らしくする

重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。

無料で始める

公表された率と実際の率が一致しない理由

主要な検出器はすべて、偽陽性率を1%前後、またはそれ以下として公表している。同じツールを別々の文書に対して、異なる条件下で実施した独立テストでは、しばしばそれよりはるかに高い値が報告される。ときには10倍以上になることもある。両方の数値は正しい可能性があるが、それでも共通点はほとんどない。なぜなら、同じものを測っているわけではないからである。

Turnitinは、競合他社の多くよりも詳細を公表しているという点で、まさに有用な例である。すなわち、提出物の20 percent超がAI-writtenと判定された場合に、文書レベルで1 percent未満の偽陽性率であること、さらに実際の結果は自社の実験室での試験とは異なるという会社の声明である。Washington Postは2023年に16件の実際の文書を同じツールに通し、その半数超が少なくとも一部は誤って識別されたと報じた。その中には、完全に人間が書いたエッセイが一部AI-generatedと判定された例も含まれていた。どちらの数値も捏造ではない。これらは異なるサンプル、異なる閾値、そして何をフラグとみなすかについての異なる定義に由来する。

同じ乖離は、1社だけでなく業界全体に見られる。14のツールを比較したその調査では、いずれも全体として80 percentの精度に届かず、14のうち6つは、言い換えが入る前の、修正されていない人間の文章に対して偽陽性を示した。公表された数値はベンチマークを示す。それは、いま教授の前に置かれている文書を示すものではない。

なぜ自信のあるスコアは自信のある告発ではないのか

偽陽性率という言葉は、問題ありと判定された1人の学生が無実である確率を指すように聞こえる。しかし、そうではない。それは、その検査を受ける全員に対して、その検査がどのように機能するかを記述する。これは、医学やセキュリティにおけるあらゆるスクリーニング検査と同様に、異なる答えを持つ異なる問いである。

Griffith Universityの研究者による2026年3月の統計分析は、その背後にある数学を明示している。AI detectionを、1つの孤立した文書ではなく学生の書き手の集団に適用される検査として扱うと、トレードオフが現れる。すなわち、その集団の一部が、典型的なAI outputと自然に重なる書き方、ジャンルの慣例に近い書き方、第二言語学習者の範囲に近い書き方をするとき、AI-writtenの作業を実際に捉える力を持つ検出器であれば、その重なりのある一部に対しては必ず誤作動する。これは、特定の検出器が不出来に作られているという主張ではない。これは、他の証拠がなく、1つの文書だけで多様な集団を検査することの性質である。

この論文自体の例示的な事例は、関与する規模を示している。ある学生集団の10 percentが典型的なAI出力にかなり近い文章を書き、検出器が実際にAIによって書かれた作業の80 percentを捉えるように調整されていると仮定しよう。すると数学的には、その集団全体で平均7.5 percent以上の偽陽性率が必要になる。これは検出器の設計上の欠陥ではない。検出対象となるものと、その集団の文章が統計的にどれほど重なっているかの直接的な帰結である。

10,000人の学生を抱える大学に拡大すると、この下限だけで、他に考慮すべき証拠のない単一の文書に対して多様な集団を検査することの数学的帰結として、集団全体でおよそ750件の誤ったフラグが生じることを意味する。論文の著者は、これらの数値が実際の大学で測定されたものではなく、説明のための例示であることを明確にしている。この例は、特定のキャンパスに対する個別の予測ではなく、問題の形を示している。

これらは、フラグ付きのスコアが無意味であることを意味しない。意味するのは、そのスコアが、単一の個人についての問いに答えるよう求められている、集団レベルの弱い1つのシグナルにすぎず、どれほどベンダーが洗練を重ねても、それだけで完全には埋められない不一致であるということだ。責任ある読み方は、その数値を、下書き、版の履歴、実際に何かを書いている人に通常残る書類上の痕跡といった、より良い証拠を集めるためのきっかけとして扱う。TextPulse's free toolsは、書き手が他の誰かより先に、下書きがこれら同じ指標の上で現在どの位置にあるかを確認することを可能にする。これは、特定の検出器を回避しようとすることとは異なる、技術の使い方である。

どのような書き手が最も高いリスクに直面するか

研究は、他のどの集団よりも目立つ2つの集団を示している。第二言語で書いている人々と、自分のエッセイをどのように書いたかとは無関係な理由で、もともと非常に構造化されている、または反復的な書き手である人々である。これら2種類の書き手はいずれも、検出器が捉えるように作られた同じ統計的特徴に現れる。

英語を母語としない話者は、記録されているリスクが最も大きい。独立した検証では、流暢な第二言語による学術的文章が、母語話者の文章よりもはるかに高い割合で機械生成と誤認されることが、繰り返し示されている。TextPulseのESLの学術的執筆者向けページでは、このリスクの背後にある仕組みを、どのような言い回しのパターンが関与しているのかも含めて、より詳しく説明している。

二つ目の、あまり議論されない集団も、関連する問題に直面している。研究者は、およそ60,000件のReddit投稿を、オートバイオグラフィーの著者によって書かれた可能性が高いと識別された一部と一般サンプルに分け、両方をGPT-2ベースの検出器に通した。両群とも全体では2 percent未満がフラグ付けされたが、オートバイオグラフィーの可能性が高い部分は、一般サンプルよりも有意に高い割合でフラグ付けされた。文字通りの表現、反復的な表現、厳密に型にはまった表現に傾く文章は、これは一部のオートバイオグラフィー的なコミュニケーション様式に見られる文書化された特徴であるが、検出器が捉えるように設計された、変化の少ないテキストをまさに生み出す。

二つのベンダーは、主張を照合できるだけの情報を公開している。Turnitin自身の偽陽性率は別に示されており、ZeroGPTの精度は独立したページで検討されている。これらの誤りが最も強く及ぶ相手は、また別の問題であり、なぜ英語を母語としない執筆者がより頻繁にフラグ付けされるのかには、別の答えがある。

この状況が近いうちに単純になる見込みはない。検出器は、実際に機械で書かれたテキストを捉える能力を今後も高めていくだろうし、集団の多様性は、より優れた工学だけでは完全には解消できない一定の割合の誤った告発を生み続けるだろう。より有用な転換は、すでに一部の機関で起きている。すなわち、スコアを結論ではなく対話の出発点として扱い、公表された率が実際にはどの集団を対象に検証されたのかを、目の前の文書にそれが当てはまると信じる前に確認することである。

Frequently Asked Questions

AI detectorの偽陽性とは、人間が書いた文章を検出ツールが誤ってAI生成と判定することです。これは、検出器が著者ではなく、文章の予測可能性を測定するために起こります。短い文章、定型的な文章、強く校正された下書き、第二言語で書かれた文章は、著者性とは無関係な理由で予測可能と読まれることが多く、それだけでフラグを引き起こすのに十分です。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.