AI Detection

AI検出器は正確か, 偽陽性とバイアス

ベンダーは偽陽性率が1%未満であると公表している。独立研究者が同じ検出器を非母語英語の文章に対して検証したところ, 60%を超える率が示された。以下に, 証拠が示す内容を述べる。

最終更新日 13 min
Are AI detectors accurate? Comparison table of vendor-claimed versus independently observed false positive rates for Turnitin, GPTZero, Originality.ai and Pangram.

Turnitinは、偽陽性率が1%未満であると主張している。独立した研究者の一団は、英語を母語としない話者による、より広範な範囲の文章サンプルに対して、複数の検出器を検証した。その結果、同じ種類の文章における平均偽陽性率は60%を超えていたことが分かった。これら二つの数値はいずれも実在し、いずれも公表されており、しかも同じ市場に販売される検出器に関係している。AI検出器は正確なのか。それは、どの集団を検証したのか、どの検出器を用いたのか、そしてそもそも販売元がそれをどのように定義したのかによって異なる。

この投稿では、検出器がそのスコアをどのように計算するかを改めて説明しない。その仕組み、perplexity、トークン確率、分類器がどのように訓練されるかについては、別の箇所で詳しく扱っているので、まだ読んでいないなら先に読む価値がある。ここで重要なのは、スコアが存在するようになった後に何が起こるかである。すなわち、どの程度の頻度で誤るのか、どのような文章について最も誤るのか、そして、何も悪いことをしていない人にとって、偽の非難が実際にはどれほどの負担を生むのかである。

AI検出器は正確なのか?

一貫して正確ではなく、宣伝上の主張と独立した検証との間の隔たりは十分に記録されている。Debora Weber-Wulffが率いる研究者 समूहは、2023年に人間の文章とChatGPTの文章を混ぜたものに対して検証された14の検出ツール, そのうち12は無料、2つは商用, について、その結果を公表した。その結果、これらのツールのいずれも正確でも信頼できるものでもなく、機械生成の文章を人間の文章として判定しやすく、その逆よりもその傾向が強いという組み込みの偏りがあることが分かった。この検証に含まれた商用ツール2つはTurnitinとPlagiarismCheckであった。この検証におけるすべてのツールは、文章が言い換えられている場合に性能がさらに低下した。

しかし、2年後の現在、状況は停滞していない。Chicago大学のBooth SchoolによるBrian JabarianとAlex Imasのワーキングペーパーは、Pangram、GPTZero、Originality.aiという3つの新参者と、1つのオープンソース競合を、ブログ、ニュース、レビュー、フィクションから集めたほぼ2,000件の人間が書いた文章で検証した。管理された試験条件下では、この中で最良のツールは99.8 percentの精度を下回ることがなく、偽陽性率も低い水準に保った。オープンソースモデルは無作為な推測者と同程度の成績だった。状況は確かに改善している。ある程度は。少しだけ。

しかし、問題はcontrolledという語にある。ベンチマークの文章は、清潔で、完全で、既知の条件下で作成される。提出されたエッセイは、そのいずれでも確実にはない。Turnitinの最高製品責任者自身が公に述べているように、現実世界の結果は実験室の結果と同一ではないかもしれないが、これはベンダーからのまれで有用な認め方である。次の節では、ベンダーの数値と独立研究者の数値を並べ、差が主張ではなく可視化されるようにする。

ベンダーの主張と独立したテスト

以下の表は、4つの検出器が自らについて主張している内容と、独立研究者がそれらのツールを直接テストした際に測定した内容を対応させたものである。ベンダーの列だけでなく、中央の2列を合わせて読むべきである。

検出器ベンダーが主張する精度独立に観察された結果ベンダーが偽陽性について述べていること
Turnitinフラグ付け前の98%の信頼閾値, 文書レベルの偽陽性は1%未満約80%の精度, 2023年の比較における12ツール中で最良, ただしこれはツールの旧版での結果20%のAI執筆閾値を超える場合, 文書レベルでは1%未満, 文レベルでは約4%
GPTZero独立したRAIDベンチマークで, 1%の偽陽性率において95.7%のAIテキスト検出短い文章では96%の精度, 2025年のUniversity of Chicago Boothの研究では偽陽性率は1%未満RAIDベンチマークで1%の偽陽性率を報告
Originality.ai99%の精度, 0.5%の偽陽性率, Liteモデル, 1.5%, Turboモデル偽陽性率は1%未満だが, 同じBoothの研究ではAI執筆テキストの10%から40%を見逃したモデル階層ごとに個別の偽陽性数値を公表
Pangram競合ツールより38倍以上低いと同社が述べるエラー率, 非ネイティブ英語話者に対する偏りはないと主張Boothの研究では, 精度は99.8%を下回らず, 偽陽性率はほぼゼロ10のテキスト領域と8つの言語モデルにわたり, 偽陽性率はほぼゼロであると主張

2点が際立っている。第一に, ベンダーの数値はすべてベンダーが管理する研究室からのものであり, Boothの数値は売るものを何も持たない研究者によるものである。第二に, 2025年の研究ではTurnitinを検証していないため, その中間列にはTurnitinがまったく含まれていない。表では, その独立指標は2023年の比較に基づいているが, これはツールの旧版で実施されたものであるため, 表を同条件比較として見る際にはこの点を忘れないでほしい。

TurnitinのAI検出はどの程度正確か?

Turnitinは、1つの正確性指標を公表していない。代わりに、しきい値とトレードオフを公表している。同社は、問題の部分がAIによって書かれたものであると98 percentの確信がある場合にのみ文書をフラグ付けすると述べており、このしきい値が文書レベルの偽陽性率を1 percent未満に保つものだとしている。Turnitinは、AIの助けを受けた文章のおよそ85 percentを検出し、誤った非難のリスクを避けるために残りを意図的に見逃していると推定している。

Turnitinが文レベルで返す偽陽性の実際の割合, つまりインターフェースが文書全体ではなく特定の行をハイライトする場合の割合は, 実際には4 percentに近い。教授が文書全体のスコアではなく、フラグが付いた1つの段落だけをスクリーンショットに収めるなら、知っておく価値があるのはこの数値である。というのも、ハイライトされた文は、その横に示される文書スコアよりも、誤っている可能性が有意に高いからである。

また、Turnitinがこの差を直接認めていることも注目に値する。同社は、最初の実地結果, とりわけ短い文書については、実験室でのテストに基づいて予想されていたよりも偽陽性率が高かったことを見いだした。そのため、採点対象とする最小文書長を150語から300語に調整した。これは、公表された数値が実験室の外では成り立たなかったために、ベンダーが自社製品を調整したということであり、独立研究と同じくらい多くのことを示している。

偽陽性が学生に実際に与えるコスト

これは、YaleのSchool of ManagementのエグゼクティブMBA学生に起きたことである。最も文字どおりの意味で言えば、その学生は違反を問われた。関与した検出器はGPTZeroであった。金融の授業におけるその学生の期末試験は、長く精緻で、ほぼ完璧な句読法と文法を備えていると考えたティーチングアシスタントによってフラグ付けされた。そして、この特定の教授はそれをGPTZeroに通しており、そのシステムは回答をAI生成の可能性が高いと判定した。

彼はその科目に不合格となり、1年間の停学処分を受けた。2025年2月に連邦裁判所に提起された彼の訴訟は、Yale自身の方針がまさにこの理由からGPTZeroのようなツールの使用を制限していること、その非英語母語話者に対する文書化された偽陽性率、そして彼がその方針に反してそれを使用したことを主張している。彼の提出書類はまた、GPTZeroがYaleの元学長とビジネススクールの学部長による学術的文章に対して100 percent AI-generatedのスコアを返したことも引用している。

裁判官は2025年5月に早期差止命令の発令を拒否した。この事件はまだ解決していない, 私がこれを書いている時点では。原告であるフランス国籍の人物は、非英語母語話者に対する同じ既知の偏りが、彼の文章がそのような結果になった原因だと主張している。次の節で見るのはその点である。争いの余地がないのは代償である。学位課程で1年を失い、不合格の成績を受け、法的費用を負担し、学位を得る代わりに得点をめぐって数か月争ったのである。1 percentの偽陽性率は、小さく聞こえるが、大きな集団がそれを特定の個人の問題にするまではそうである。

自分の論文を人間らしくする

重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。

無料で始める

どのような文章特性が人間の文章を機械生成のように見せるのか

通常の文章のうち最もリスクが高いのは4種類であり、そのいずれにも人が何か誤ったことをしているわけではない。短い文書、強く定型化された文章、引用された素材やテンプレート化された素材、そして入念に校正された文章は、自由に作成された散文よりも一貫して予測可能だと判定されやすい。これは、あらゆる検出器が実際に測定している唯一の特性である。free burstiness checkerは、その同じ変動を直接測定するため、その説明を読むよりも速くそのパターンを確認できる。

いくつかのジャンルは、設計上、定型的である。方法の節、実験報告書、標準的なカバーレター、文献レビューはいずれも、独創的な表現よりも慣用的な表現を評価する。なぜなら、その慣用性こそが文書を読者にとって利用可能なものにするからである。研究者はこれを実際の文章で直接検証した。彼らは、1980年から2023年の間に公表された14,400件の学術要旨を、公開されている検出器に通した。この期間は、大規模言語モデルが存在するより前である。最大8パーセントが、出版年にかかわらずAI生成と判定され、New England Journal of Medicineの要旨は10.24パーセントで判定され、検証した5誌の中で最も高い偽陽性率であった。

その検査がChatGPTに関する何かを検出していたはずはない。なぜなら、ChatGPTは対象とした年の大半には存在していなかったからである。検出していたのはジャンルである。より形式的に言えば、2026年の検出問題に関する統計分析が示すように、ソフトウェアによって書かれたために予測可能な文と、そのジャンルではそう書くものだから予測可能な文とを区別する検出器を作る方法はない。外から見ると、それらはまったく同じに見える。

大幅な編集も、同様の方向に働く。初稿には、書き手固有の不規則性が残る。奇妙な語順や、考えが長く続いたために長くなった文などである。入念な校正、特に別のツールを通した校正は、まさにそうした不規則性をならして消す傾向がある。これまでで最大の検出ツールの独立比較では、14種類のツールを検証し、サンプル文がパラフレーズされたり機械翻訳されたりすると、すべてのツールで精度がさらに低下することが示された。

Writing trait文書の見かけ上の予測不能性を低下させる理由証拠が示すこと
Short submissionsテキストが短いほど、人間のリズムと機械のリズムを分ける自然な変動が入る余地が少なくなる短い文書のスコアは、少数の珍しい文の影響でより大きく変動する
Formulaic or discipline-specific writingジャンルの慣習は、独創的な表現よりも予想される定型句を優先するChatGPT以前の14,400件の学術要旨(1980年から2023年)でも、最大8%の偽陽性が生じた。ある学術誌の要旨では10.24%に達した
Heavily edited or paraphrased drafts推敲によって、検出器が人間的と読み取る個々の不規則性がならされる独立した14ツールの比較では、言い換えや機械翻訳の後に精度がさらに低下した
Quoted or templated material引用された箇所は、引用した著者のものではなく、その出典の統計的特徴を帯びる引用を除外しない検出器は、借用されたテキストに基づいて周囲の文書を採点する

なぜ AI 検出器は非ネイティブの英語話者を誤分類するのか?

ひどく、しかも大きな差で誤分類する。これが、それを初めて数値化した研究の結論である。Stanford の研究者は、広く使われている7つの GPT 検出器を、非ネイティブの英語話者による91本の TOEFL エッセイと、米国の8年生による88本のエッセイに対して適用した。検出器は、8年生のエッセイをほぼ毎回正しく判定した。成人が書いた TOEFL エッセイについては、大学院レベルの英語試験を受けられる程度には流暢であったが、検出器の平均偽陽性率は61.3 percentであった。91本のエッセイのうち89本は、7つの検出器の少なくとも1つによって GPT によって生成されたと判定され、これらのエッセイのうち18本は7つすべての検出器によって判定された。

その仕組みは、検出の残りの部分を支配するものと同じである。予測可能な語彙とより単純な文構造は低い perplexity として読まれ、低い perplexity は、誰が筆を執っているかにかかわらず、機械生成と読まれる。第二言語で書く著者は、十分に確立された言い回しに頼るが、それは追加の言語における流暢さが実際にはそのように見えるからであり、まさにそれが detector が警告対象として作られたプロファイルである。

その立場にある著者にとって、単により自然に書くようにという助言はあまり役に立たない。なぜなら、自然であることこそがまさに警告されたものだからである。TextPulseのESL の学術著者向けページでは、そのリスクの背後にある言い回しのパターンをより詳しく扱っており、文の意味を変えずにそれらを変える方法も含まれている。

これは孤立した事例ではなかった。2025年12月には、新しい benchmark が公開され、これらの detector における bias を評価するために明示的に設計された。そこには、複数の人口統計学的属性と複数の言語にわたる 200,000 を超えるサンプルが含まれていた。Stanford の最初の研究から 2 年が経過し、同じ detector の多くの異なる model version を含んでいたにもかかわらず、この benchmark は、English language learner に対する bias が依然として存在することを明らかにした。

これはすべての vendor に当てはまるわけではない。Pangram の技術文書自体は、その classifier が非母語話者の英語使用者に対して bias を持たないと述べている。Chicago Booth の研究者はこの主張を独自に検証していないが、それでも、新しい世代の detector がこの問題を念頭に置いて構築されており、無視しているわけではないことは示している。

自分の文章が他者に採点される前に、どの位置にあるのかを見たいなら、無料の perplexity checker を使えば、機関に何かを提出する前に、detector が計算するのと同じ基礎数値を得られる。

誰がほかに警告対象となり、なぜか

英語を母語としない話者は、記録されている最大のリスクを負うが、同じ統計的な論理は他の文章にも当てはまる。Weber-Wulffのチームは、試した14のツールすべてが、言い換えられたテキストに適用したときに精度が低下することを見いだした。これは、検出器をかける前に校正者、編集者、あるいは指導教員の赤ペンを通った学術文書のかなりの部分を指している。

このことは、数値が無意味だという意味ではなく、特定の人物について何かを意味する前に裏づけが必要だということである。もし、文の長さが似ており、全体を通してリズムも似ている、均一に読めるテキストがあれば、それを書いたのが誰であれ、またその理由が何であれ、より機械的だと判定される。これは推測ではなく、free burstiness checkerを使って直接確認できる。

あまり議論されない第二の集団も、関連する問題に直面している。研究者たちは、およそ60,000件のReddit投稿を比較し、その一部は自閉症の著者によって書かれた可能性が高いと識別されたもの、残りは一般的なサンプルに分け、両方をGPT-2ベースの検出器にかけた。全体としては両群とも2 percent未満がフラグ付けされたままだったが、自閉症の著者によって書かれた可能性が高いとされた部分集合は、一般サンプルよりも有意に高い割合でフラグ付けされた。文字通りで反復的、かつ厳密に型にはまった言い回しに傾く文章は、自閉症のコミュニケーション様式の一部に見られることが記録されている特徴であり、検出器が捉えるよう設計された低変動のテキストをまさに生み出す。

なぜ高いスコアは高い告発ではないのか

False positive rateは、問題としてフラグ付けされた一人の学生が無実である可能性を指すように聞こえる。しかし、そうではない。それは、その検査を受ける全員に対して、その検査がどのように機能するかを述べている。そして、それらは異なる答えを持つ異なる問いであり、医学やセキュリティにおけるあらゆるスクリーニング検査と同じである。

2026年3月のGriffith Universityの研究者による統計分析は、基礎となる数学を明示している。AI検出を、1つの孤立した文書に対してではなく、学生執筆者の集団に適用される検査として扱うと、トレードオフが現れる。すなわち、その集団の一部が、典型的なAI出力と自然に重なり合う書き方、ジャンルの慣例に近い書き方、第二言語学習者の範囲に近い書き方をする場合、AIによる文章を実際に捉える力を持つ検出器は、その重なり合う一部の中の一定割合を誤って判定せざるを得ない。これは、特定の検出器の作りが悪いという主張ではない。これは、多様な集団を、1つの文書とそれ以外の証拠なしに検査することの性質である。

論文自身の説明例は、その規模を示している。学生集団の10 percentが典型的なAI出力に十分近い書き方をするとし、検出器が実際のAIによる文章の80 percentを捉えるよう調整されていると仮定する。このとき数学的には、その集団全体で平均の偽陽性率は少なくとも7.5 percentでなければならない。これは検出器の工学上の欠陥ではない。その集団の文章が、検出対象のものと統計的にどれほど重なっているかの直接的な帰結である。

10,000人の学生を抱える大学に当てはめると、その下限だけで、集団全体でおよそ750件の誤ったフラグが生じることを意味する。これは、他に考慮すべき証拠のない1つの文書に対して、多様な集団を検査することの数学的帰結である。論文の著者は、これらの数値が実在の機関で測定されたものではなく、説明のための例示であることを明言している。この例は、特定のキャンパスに対する個別の予測ではなく、問題の形を示している。

擁護可能なAI検出方針とは何か

Yaleにはすでに、GPTZeroのようなツールを制限しているとされる方針があり、それは本稿で述べた理由にかなり近い。すなわち、文書化された偽陽性率と、英語を母語としない書き手に対する文書化された偏りである。したがって、これは1人の不運な学生の話というより、既存の規則が守られていなかった話である。方針が、スコアと判定の違いを実際に強制するなら、スコアは判定ではなく、1つの入力になる。

  • スコアは一つの入力として扱い、懲戒認定の唯一の根拠としては決して用いない
  • そのツールの公表されている偽陽性率を、学生に対して、それを不利に用いる前に開示する
  • 短い提出物と非母語の英語による文章には、文書化された弱点であるため、特に注意を払う
  • 統計を反証することを要しない異議申立ての経路を保証する

これらは特異なことではない。むしろ、他のあらゆる場面で単一の法科学的証拠をどのように扱うべきかに近い。すなわち、有用であり、検証可能であり、単独では決して十分ではない。

個々の書き手にとっても、同じ原則は、スコアが存在した後ではなく、その前に当てはまる。どのツールによるものであれ、単一の数値は判定ではなく推定であり、それをいずれの方向においても確実性、すなわち安全であること、または摘発されたこととして扱うのは、その数値が支えられる以上のことを求めることになる。

TextPulse自身のAI humanizer toolは、同じ論理に基づいて Human Score を報告する。それは自分の文章から算出された推定値であり、その文章に対する検出器の判定ではない。したがって、特定の検出器が何を示すかについての約束ではなく、草稿が現時点でどのように読まれるかを示す信号として有用である。

正確性の問題は、より狭い論点に分かれ、それぞれに専用のページがある。Turnitin's false positive rateZeroGPT's accuracy に関する具体的な証拠は、別に扱っている。すでにスコアが不利に用いられている場合には、AI を使ったと आरोपされたときに何をすべきかAI を使っていないことを証明するために集められる証拠、そしてスコアにそれ自体の基準で応答する異議申立て書の書き方についての実用的な項目がある。

どの報告書における数値も、提供業者がモデルを再学習させ、研究者がより難しい事例に対して検証を続けるにつれて、変動し続けるだろう。しかし、変動してはならないのは、その下にある習慣である。すなわち、スコアを複数ある測定の一つとして読み、それがどの集団で妥当性確認されたのかを問い、そして、なお誤判定する事例について提供業者が何を述べていないのかを問うことである。

XLinkedInFacebook

よくある質問

はい。Weber-Wulffと共同研究者は, 2023年の比較研究でAI検出ツールは「正確でも信頼できるものでもない」と結論づけた。また, 非母語英語話者は最も高い文書化されたリスクに直面しており, ある研究ではTOEFLエッセイにおける平均偽陽性率が60%を超えた。単一のスコアだけでは何も証明できないため, それを告発の唯一の根拠にしてはならない。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI人間化の最新情報を受け取る

学術ライティング、AI検出、そして人間化に関するヒントを、受信箱へお届けします。

スパムはありません。いつでも配信停止できます。